一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

phd-bibliography:实践指南

时间:2026-09-11 08:34:01 编辑:袖梨 来源:一聚教程网

面对实际交付,我看phd-bibliography的重点不在星标,而在这项能力:最优控制、强化学习和运动规划参考资料。一旦进入日常自动化环节,输入边界、依赖和失败处理如果不清楚就很难稳定复用会直接影响交付,这也是我最关心的风险。先用一项范围明确的真实任务完成最小试跑更稳妥;过程中要观察配置时间、输出质量、异常信息和维护痕迹,失败也应能解释原因。整体来看,它适合愿意先做小范围验证并复查原始文档的团队拿来做对照测试,最终决定仍应回到真实结果和维护状态。

参考书目

目录

  • 最优控制
    • 动态规划
    • 线性规划
    • 基于树的规划
    • 控制原理
    • 模型预测控制
  • 安全控制
    • 鲁棒控制
    • 风险规避控制
    • 值约束控制
    • 状态约束控制和稳定性
    • 不确定动力系统
  • 博弈论
  • 顺序学习
    • 多臂强盗
      • 最佳手臂识别
      • 黑盒优化
    • 强化学习
      • 理论
      • 基于价值的
      • 策略型
        • 策略梯度
        • 演员评论家
        • 无衍生品
      • 基于模型的
      • 探索
      • 层次结构和时间抽象
      • 部分可观测性
      • 多代理
      • 表示学习
      • 当前离线
  • 示范学习
    • 模仿学习
      • 自动驾驶应用
    • 逆强化学习
      • 自动驾驶应用
  • 运动规划
    • 搜索
    • 采样
    • 优化
    • 无功
    • 架构与应用

最优控制:dart:

动态规划

  • (书)动态规划,贝尔曼 R. (1957)。
  • (书籍)动态规划和最优控制,第 1 卷和第 2 卷,Bertsekas D. (1995)。
  • (书)马尔可夫决策过程 - 离散随机动态规划,Puterman M.(1995)。
  • 近似最优值函数损失的上限、Singh S.、Yee R. (1994)。
  • 逆风帆船赛航行轨迹的随机优化,Dalang R. 等人。 (2015)。

线性规划

  • (书)马尔可夫决策过程 - 离散随机动态规划,Puterman M.(1995)。
  • REPS 相对熵策略搜索,Peters J. 等人。 (2010)。

基于树的规划

  • ExpectiMinimax 具有机会节点的游戏中的最优策略,Melkó E.,Nagy B. (2007)。
  • Sparse sampling 用于大型马尔可夫决策过程中接近最优规划的稀疏采样算法,Kearns M. 等人。 (2002)。
  • MCTS 蒙特卡罗树搜索中的高效选择性和备份算子,Rémi Coulom,SequeL (2006)。
  • UCT 基于 Bandit 的蒙特卡罗规划,Kocsis L.,Szepesvári C. (2006)。
  • 用于树搜索的 Bandit 算法,Coquelin P-A.,Munos R. (2007)。
  • OPD 确定性系统的乐观规划、Hren J.、Munos R. (2008)。
  • OLOP 开环乐观规划,Bubeck S.,Munos R. (2010)。
  • SOOP 连续动作确定性系统的乐观规划,Buşoniu L. 等人。 (2011)。
  • OPSS 稀疏随机系统的乐观规划、L. Buşoniu、R. Munos、B. De Schutter 和 R. Babuska (2011)。
  • HOOT 基于样本的连续 ActionMarkov 决策过程规划、Mansley C.、Weinstein A.、Littman M. (2011)。
  • HOLOP 基于强盗的规划和学习 inContinuous-Action 马尔可夫决策过程,Weinstein A.,Littman M. (2012)。
  • BRUE 马尔可夫决策过程在线规划中的简单遗憾优化,Feldman Z. 和 Domshlak C. (2014)。
  • LGP 逻辑几何规划:基于优化的组合任务和运动规划方法,Toussaint M. (2015)。
  • AlphaGo 通过深度神经网络和树搜索掌握围棋游戏,Silver D. 等人。 (2016)。
  • AlphaGo Zero 在没有人类知识的情况下掌握围棋游戏,Silver D. 等人。 (2017)。
  • AlphaZero 通过通用强化学习算法自玩掌握国际象棋和将棋,Silver D. 等人。 (2017)。
  • TrailBlazer 在踏上道路之前开拓道路:样本高效的蒙特卡罗规划、Grill J. B.、Valko M.、Munos R. (2017)。
  • MCTSnets 通过 MCTSnets、Guez A. 等人学习搜索。 (2018)。
  • ADI 在没有人类知识的情况下解决魔方问题、McAleer S. 等人。 (2018)。
  • OPC/SOPC 使用 Lipschitz 值进行折扣无限范围非线性最优控制的连续行动规划、Buşoniu L.、Pall E.、Munos R. (2018)。
  • 悲观场景下的实时树搜索:赢得 NeurIPS 2018 Pommerman 比赛,Osogami T.,Takahashi T. (2019)

控制理论

  • (书)最优过程的数学理论、L. S. Pontryagin、Boltyanskii V. G.、Gamkrelidze R. V. 和 Mishchenko E. F. (1962)。
  • (书)约束控制和估计,Goodwin G. (2005)。
  • PI² 强化学习的广义路径积分控制方法,Theodorou E. 等人。 (2010)。
  • PI²-CMA 通过协方差矩阵适应进行路径积分策略改进,Stulp F.,Sigaud O. (2010)。
  • iLQG 用于约束非线性随机系统局部最优反馈控制的广义迭代 LQG 方法,Todorov E. (2005)。 :octocat:
  • iLQG+ 通过在线轨迹优化合成和稳定复杂行为,Tassa Y. (2012)。

模型预测控制

  • (书)模型预测控制,Camacho E. (1995)。
  • (书)带约束的预测控制,Maciejowski J. M. (2002)。
  • 低曲率道路上车道保持和避障的线性模型预测控制,Turri V. 等人。 (2013)。
  • MPCC 基于优化的 1:43 比例 RC 赛车 的自动驾驶赛车,Liniger A. 等人。 (2014)。 |
  • MIQP 集成逻辑约束的自动驾驶最优轨迹规划:MIQP 视角、Qian X.、Altché F.、Bender P.、Stiller C. de La Fortelle A. (2016)。

安全控制:锁:

鲁棒控制

  • 随机问题的最小最大分析,Shapiro A.,Kleywegt A. (2002)。
  • Robust DP 鲁棒动态规划,Iyengar G. (2005)。
  • 稳健规划和优化,Laumanns M. (2011)。 (讲义)
  • 鲁棒马尔可夫决策过程、Wiesemann W.、Kuhn D.、Rustem B. (2012)。
  • 高斯过程的安全鲁棒学习控制,Berkenkamp F.,Schoellig A. (2015)。
  • Tube-MPPI 具有稀疏目标信息的基于鲁棒采样的模型预测控制,Williams G. 等人。 (2018)。
  • 机器人安全学习:从基于学习的控制到安全强化学习,Lukas Bronke 等人。 (2021)。 :octocat:

风险规避控制

  • 安全强化学习综合调查,García J.,Fernández F. (2015)。
  • RA-QMDP 不确定性下自动驾驶的风险规避行为规划,Naghshvar M. 等人。 (2018)。
  • StoROO X-Armed Bandits:优化分位数和其他风险、Torossian L.、Garivier A.、Picheny V. (2019)。
  • 最坏情况策略梯度,Tang Y. C. 等人。 (2019)。
  • 无模型风险敏感强化学习,Delétang G. 等人。 (2021)。
  • 支持感知 CVaR 强盗的最佳 Thompson 采样策略、Baudry D.、Gautron R.、Kaufmann E.、Maillard O. (2021)。

值约束控制

  • ICS 驾驶座会空吗?,Fraichard T.(2014)。
  • SafeOPT 采用高斯过程的四旋翼飞行器安全控制器优化、Berkenkamp F.、Schoellig A.、Krause A. (2015)。 :octocat:
  • SafeMDP 使用高斯过程的有限马尔可夫决策过程的安全探索、Turchetta M.、Berkenkamp F.、Krause A. (2016)。 :octocat:
  • RSS 关于安全且可扩展的自动驾驶汽车的正式模型,Shalev-Shwartz S. 等人。 (2017)。
  • CPO 约束策略优化、Achiam J.、Held D.、Tamar A.、Abbeel P. (2017)。 :octocat:
  • RCPO 奖励约束策略优化、Tessler C.、Mankowitz D.、Mannor S. (2018)。
  • BFTQ 预算 MDPs 的 Fitted-Q 算法,Carrara N. 等人。 (2018)。
  • SafeMPC 用于安全探索的基于学习的模型预测控制、Koller T、Berkenkamp F.、Turchetta M. Krause A. (2018)。
  • CCE 用于安全强化学习的约束交叉熵方法,Wen M.,Topcu U. (2018)。 :octocat:
  • LTL-RL 具有自动驾驶概率保证的强化学习,Bouton M. 等人。 (2019)。
  • 通过场景分解进行安全强化学习,用于复杂的城市环境导航,Bouton M. 等人。 (2019)。 :octocat:
  • 约束下的批量策略学习, Le H., Voloshin C., Yue Y. (2019)。
  • 值约束无模型连续控制,Bohez S. 等人 (2019)。
  • 安全学习控制约束线性二次调节器,Dean S. 等人 (2019)。
  • 以最小的人力学习在现实世界中行走,Ha S. 等人。 (2020)
  • PID 拉格朗日方法强化学习中的响应安全性、斯托克 A.、阿希姆 J.、阿贝尔 P. (2020)。 :octocat:
  • Envelope MOQ-Learning 多目标强化学习和策略适应的通用算法,Yang R. 等人 (2019)。

状态约束控制和稳定性

  • HJI-reachability 控制安全学习:将扰动估计、可达性分析和强化学习与系统探索相结合,Heidenreich C. (2017)。
  • MPC-HJI 在人机车辆交互的概率规划框架中注入基于可达性的安全保证,Leung K. 等人。 (2018)。
  • 不确定机器人系统中基于学习的控制的通用安全框架,Fisac J. 等人 (2017)。
  • 具有稳定性保证的基于安全模型的强化学习,Berkenkamp F. 等人。 (2017)。
  • Lyapunov-Net 基于安全交互模型的学习,Gallieri M. 等人。 (2019)。
  • 在神经网络策略中实施稳健的控制保证,Donti P. 等人。 (2021)。 :octocat:
  • ATACOM 约束流形上的机器人强化学习,Liu P. 等人 (2021)。

不确定动力系统

  • 受控不确定非线性系统的仿真,Tibken B.,Hofer E. (1995)。
  • 动态不确定系统的轨迹计算,Adrot O.,Flaus J-M。 (2002)。
  • 区间模型描述的不确定动态系统的模拟:调查,Puig V. 等人。 (2005)。
  • 不确定动力系统区间观测器的设计,Efimov D.,Raïssi T. (2016)。

博弈论:黑桃:

  • 自动驾驶车辆的分层博弈论规划,Fisac J. 等人。 (2018)。
  • 非线性多人一般和微分博弈的高效迭代线性二次近似,Fridovich-Keil D. 等人。 (2019)。

顺序学习:鞋:

  • 预测、学习和游戏、Cesa-Bianchi N.、Lugosi G. (2006)。

多臂强盗 :_machine:

  • TS 关于根据两个样本 的证据,一个未知概率超过另一个未知概率的可能性,Thompson W. (1933)。
  • 组织学习中的探索和利用,March J. (1991)。
  • UCB1 / UCB2 多臂问题的有限时间分析、Auer P.、Cesa-Bianchi N.、Fischer P. (2002)。
  • Empirical Bernstein / UCB-V 在多臂中使用方差估计进行探索-利用权衡、Audibert J-Y、Munos R.、Szepesvari C. (2009)。
  • 经验 Bernstein 界限和样本方差惩罚,Maurer A.,Ponti M. (2009)。
  • 汤普森采样的实证评估,Chapelle O.,Li L. (2011)。
  • kl-UCB 用于有界随机及超越 的 KL-UCB 算法,Garivier A.,Cappé O. (2011)。
  • KL-UCB Kullback-Leibler 最优顺序分配的置信上限,Cappé O. 等人。 (2013)。
  • IDS 具有异方差噪声的信息定向采样和 Kirschner J.、Krause A. (2018)。

语境化

  • LinUCB 个性化新闻文章推荐的上下文强盗方法,Li L. 等人。 (2010)。
  • OFUL 线性随机的改进算法、Abbasi-yadkori Y.、Pal D.、Szepesvári C. (2011)。
  • 具有线性支付函数的上下文,Chu W. 等人。 (2011)。
  • 用于流式置信回归的自归一化技术,Maillard O.-A。 (2017)。
  • 通过代理从延迟结果中学习并应用于推荐系统 Mann T. 等人。 (2018)。 (预测设置)
  • 非平稳环境的加权线性,Russac Y. 等人。 (2019)。
  • 具有随机延迟反馈的线性,Vernade C. 等人。 (2020)。

最佳手臂识别:肌肉:

  • Successive Elimination 多臂和强化学习问题的动作消除和停止条件,Even-Dar E. 等人。 (2006)。
  • LUCB PAC 随机多臂中的子集选择,Kalyanakrishnan S. 等人。 (2012)。
  • UGapE 最佳手臂识别:固定预算和固定置信度的统一方法、Gabillon V.、Ghavamzadeh M.、Lazaric A. (2012)。
  • Sequential Halving 多臂强盗中的几乎最优探索,Karnin Z. 等人 (2013)。
  • M-LUCB / M-Racing 最大最小动作识别:游戏的新强盗框架、Garivier A.、Kaufmann E.、Koolen W. (2016)。
  • Track-and-Stop 具有固定置信度的最优最佳手臂识别,Garivier A.,Kaufmann E. (2016)。
  • LUCB-micro 具有固定置信度的结构化最佳手臂识别,Huang R. 等人。 (2017)。

黑盒优化:black_large_square:

  • GP-UCB Bandit 设置中的高斯过程优化:无遗憾和实验设计、Srinivas N.、Krause A.、Kakade S.、Seeger M. (2009)。
  • HOO X-武装匪徒、Bubeck S.、Munos R.、Stoltz G.、Szepesvari C. (2009)。
  • DOO/SOO 确定性函数的乐观优化,无需了解其平滑度,Munos R. (2011)。
  • StoOO 从 Bandits 到蒙特卡洛树搜索:应用于优化和规划的乐观原理,Munos R. (2014)。
  • StoSOO 随机同时乐观优化、Valko M.、Carpentier A.、Munos R. (2013)。
  • POO 平滑度未知的噪声函数的黑盒优化、Grill J-B.、Valko M.、Munos R. (2015)。
  • EI-GP AlphaGo 中的贝叶斯优化,Chen Y. 等人。 (2018)

强化学习:机器人:

  • 强化学习:一项调查,Kaelbling L. 等人。 (1996)。

理论:书籍:

  • 在线强化学习的预期错误界限模型,Fiechter C-N。 (1997)。
  • UCRL2 强化学习的近乎最优后悔界限,Jaksch T. (2010)。 ^0.5-橙色)
  • PSRL 为什么后验采样比乐观强化学习更好?,奥斯班德 I.,范罗伊 B.(2016)。
  • UCBVI 强化学习的最小最大遗憾界限、Azar M.、Osband I.、Munos R. (2017)。 ^0.5-橙色)
  • Q-Learning-UCB Q-Learning 是否有效?,Jin C.,Allen-Zhu Z.,Bubeck S.,Jordan M.(2018)。 ^0.5-橙色)
  • LSVI-UCB 通过线性函数逼近证明有效的强化学习、Jin C.、Yang Z.、Wang Z.、Jordan M. (2019)。
  • 基于模型的强化学习中的 Lipschitz 连续性,Asadi K. 等人 (2018)。
  • 论强化学习中的函数逼近:面对大状态空间的乐观, Yang Z., Jin C., Wang Z., Wang M., Jordan M. (2021) ^0.5-orange)

生成模型

  • QVI 关于生成模型强化学习的样本复杂性、Azar M.、Munos R.、Kappen B. (2012)。
  • 基于模型的生成模型强化学习是最小最大最优,Agarwal A. 等人。 (2019)。

正策梯度

  • 使用函数逼近的强化学习策略梯度方法,Sutton R. 等人 (2000)。
  • 近似最优近似强化学习、Kakade S.、Langford J. (2002)。
  • 论策略梯度方法理论:最优性、近似和分布偏移,Agarwal A. 等人。 (2019)
  • PC-PG:可证明策略梯度学习的策略覆盖定向探索,Agarwal A. 等人。 (2020)
  • 策略梯度是梯度吗?、Nota C.、Thomas P.S. (2020)。

线性系统

  • PAC 线性系统的自适应控制,Fiechter C.-N。 (1997)
  • OFU-LQ 线性二次系统自适应控制的遗憾界、Abbasi-Yadkori Y.、Szepesvari C. (2011)。
  • TS-LQ 改进了线性二次控制问题中汤普森采样的遗憾界限、Abeille M.、Lazaric A. (2018)。
  • 线性系统中汤普森采样的探索-开发,Abeille M. (2017)。 (博士论文)
  • Coarse-Id 关于线性二次调节器 的样本复杂性,Dean S.、Mania H.、Matni N.、Recht B.、Tu S. (2017)。
  • 线性二次调节器的鲁棒自适应控制的遗憾界限,Dean S. 等人 (2018)。
  • 线性二次强化学习的稳健探索,Umenberger J. 等人 (2019)。
  • 具有对抗性干扰的在线控制,Agarwal N. 等人 (2019)。
  • 在线控制的对数遗憾,Agarwal N. 等人 (2019)。

基于价值的:chart_with_upwards_trend:

  • NFQ 神经拟合 Q 迭代 - 首次体验数据高效的神经强化学习方法,Riedmiller M. (2005)。
  • DQN 使用深度强化学习玩 Atari,Mnih V. 等人。 (2013)。
  • DDQN 采用双 Q 学习的深度强化学习,van Hasselt H.、Silver D. 等人。 (2015)。
  • DDDQN 用于深度强化学习的决斗网络架构,Wang Z. 等人。 (2015)。
  • PDDDQN 优先体验重播,Schaul T. 等人。 (2015)。
  • NAF 具有基于模型加速的连续深度 Q 学习,Gu S. 等人。 (2016)。
  • Rainbow Rainbow:结合深度强化学习的改进,Hessel M. 等人。 (2017)。
  • Ape-X DQfD 进一步观察:在 Atari 上实现一致的性能,Pohlen T. 等人。 (2018)。

基于正策:力量:

正策梯度

  • REINFORCE 用于联结强化学习的简单统计梯度跟随算法,Williams R. (1992)。
  • Natural Gradient 自然正策梯度,Kakade S. (2002)。
  • 机器人策略梯度方法, Peters J., Schaal S. (2006)。
  • TRPO 信任域策略优化,Schulman J. 等人。 (2015)。
  • PPO 近端策略优化算法,Schulman J. 等人。 (2017)。
  • DPPO 丰富环境中运动行为的出现,Heess N. 等人。 (2017)。

演员评论家

  • AC 用于函数逼近强化学习的策略梯度方法,Sutton R. 等人。 (1999)。
  • NAC 天生的演员评论家,Peters J. 等人。 (2005)。
  • DPG 确定性策略梯度算法,Silver D. 等人。 (2014)。
  • DDPG 通过深度强化学习进行连续控制,Lillicrap T. 等人。 (2015)。 1 | 2 | 3 | 4
  • MACE 使用深度强化学习的地形自适应运动技能、Peng X.、Berseth G.、van de Panne M. (2016)。 |
  • A3C 深度强化学习的异步方法, Mnih V. et al 2016. 1 | 2 | 3
  • SAC Soft Actor-Critic:使用随机 Actor 进行离策略最大熵深度强化学习,Haarnoja T. 等人。 (2018)。
  • MPO 最大后验策略优化,Abdolmaleki A. 等人 (2018)。
  • 深入研究 Actor-Critic 算法中的贴现不匹配,Zhang S.,Laroche R. 等人。 (2020)。

无衍生品

  • CEM 使用噪声交叉熵方法学习俄罗斯方块、Szita I.、Lörincz A. (2006)。
  • CMAES 进化策略中完全去随机化的自适应,Hansen N.,Ostermeier A. (2001)。
  • NEAT 通过增强拓扑进化神经网络,Stanley K. (2002)。
  • iCEM 用于实时规划的高效样本交叉熵方法,Pinneri C. 等人。 (2020)。

基于模型的:world_map:

  • Dyna 基于近似动态规划的学习、规划和反应集成架构,Sutton R. (1990)。
  • PILCO PILCO:基于模型和数据高效的策略搜索方法,Deisenroth M.,Rasmussen C. (2011)。 (讲)
  • DBN 概率 MDP- 汽车行为规划,Brechtel S. 等人。 (2011)。
  • GPS 深度视觉运动策略的端到端训练,Levine S. 等人。 (2015)。
  • DeepMPC DeepMPC:学习模型预测控制的深层潜在特征,Lenz I. 等人。 (2015)。
  • SVG 通过随机值梯度学习连续控制策略,Heess N. 等人。 (2015)。
  • FARNN 使用深度动态神经网络进行非线性系统识别,Ogunmolu O. 等人。 (2016)。 :octocat:
  • 使用学习的局部模型进行最优控制:在灵巧操作中的应用,Kumar V. 等人。 (2016)。
  • BPTT 通过短期预测进行长期规划,Shalev-Shwartz S. 等人。 (2016)。 1 | 2
  • 用于规划机器人运动的深度视觉远见,Finn C.,Levine S. (2016)。
  • VIN 价值迭代网络,Tamar A. 等人 (2016)。
  • 价值预测网络,Oh J. 等人。 (2017)。
  • DistGBP 基于模型的离散和连续操作规划,Henaff M. 等人。 (2017)。 1 | 2
  • 使用时间段模型进行预测和控制,Mishra N. 等人。 (2017)。
  • Predictron The Predictron:端到端学习和规划,Silver D. 等人。 (2017)。
  • MPPI 用于基于模型的强化学习的信息论 MPC,Williams G. 等人。 (2017)。 :octocat:
  • 通过梦想学习现实世界的机器人策略,Piergiovanni A. 等人。 (2018)。
  • 使用深度学习的车辆纵向和横向耦合控制、Devineau G.、Polack P.、Alchté F.、Moutarde F. (2018)
  • PlaNet 从像素学习潜在动态进行规划,Hafner 等人。 (2018)。
  • NeuralLander 神经着陆器:使用学习动力学进行稳定的无人机着陆控制,Shi G. 等人。 (2018)。
  • DBN+POMCP 在高速公路场景中实现自动驾驶车辆的类人预测和决策,Sierra Gonzalez D. (2019)。
  • 使用目标条件策略进行规划,Nasiriany S. 等人。 (2019)。
  • MuZero 通过学习模型规划掌握 Atari、围棋、国际象棋和将棋,Schrittwiese J. 等人。 (2019)。 :octocat:
  • BADGR BADGR:基于自主自监督学习的导航系统、Kahn G.、Abbeel P.、Levine S. (2020)。 :octocat:
  • H-UCRL 通过乐观正策搜索和规划实现基于模型的高效强化学习、Curi S.、Berkenkamp F.、Krause A. (2020)。 :octocat:

探索:帐篷:

  • 用内在恐惧对抗强化学习的西西弗斯诅咒,Lipton Z. 等人。 (2016)。
  • Pseudo-count 统一基于计数的探索和内在动机,Bellemare M. 等人 (2016)。
  • HER 事后经验回放,Andrychowicz M. 等人。 (2017)。
  • VHER 视觉后见之明体验重播,Sahni H. 等人。 (2019)。
  • RND 通过随机网络蒸馏进行探索,Burda Y. 等人。 (OpenAI)(2018)。
  • Go-Explore Go-Explore:硬探索问题的新方法,Ecoffet A. 等人。 (优步)(2018)。
  • C51-IDS 深度强化学习的信息导向探索、Nikolov N.、Kirschner J.、Berkenkamp F.、Krause A. (2019)。 :octocat:
  • Plan2Explore 计划通过自监督世界模型进行探索,Sekar R. 等人。 (2020)。 :octocat:
  • RIDE RIDE:奖励程序生成环境的影响驱动探索,Raileanu R.,Rocktäschel T.,(2020)。 :octocat:

层次结构和时间抽象:clock2:

  • 在 MDPs 和半 MDPs 之间:强化学习中时间抽象的框架,Sutton R. 等人。 (1999)。
  • 技能分层集合的内在动机学习,Barto A. 等人。 (2004)。
  • OC Option-Critic 架构、Bacon P-L.、Harb J.、Precup D. (2016)。
  • 调制运动控制器的学习和迁移,Heess N. 等人。 (2016)。
  • 自动驾驶的安全、多智能体、强化学习,Shalev-Shwartz S. 等人。 (2016)。
  • FuNs FeUdal 用于分层强化学习的网络,Vezhnevets A. 等人。 (2017)。
  • 结合神经网络和树搜索在挑战性环境中进行任务和运动规划,Paxton C. 等人。 (2017)。
  • DeepLoco DeepLoco:使用分层深度强化学习的动态运动技能,Peng X. 等人。 (2017)。 |
  • 通过自我对弈实现机器人乒乓球样本高效学习的分层策略设计,Mahjourian R. 等人 (2018)。
  • DAC DAC:学习选项的双重 Actor-Critic 架构,Zhang S.,Whiteson S.(2019)。
  • 使用 Hierarchical Sim2Real 通过运动进行多代理操作,Nachum O. 等人 (2019)。
  • SoftCon:利用仿生执行器模拟和控制软体动物,Min S. 等人。 (2020)。 :octocat:
  • H-REIL 基于强化学习的近似事故驾驶模仿策略控制,Cao Z. 等人。 (2020)。 1,2

部分可观察性:眼睛:

  • PBVI 基于点的值迭代:POMDPs 的随时算法,Pineau J. 等人。 (2003)。
  • cPBVI 基于点的连续值迭代 POMDPs,Porta J. 等人。 (2006)。
  • POMCP 大型蒙特卡洛规划 POMDPs,Silver D.,Veness J. (2010)。
  • A POMDP 不确定性下的机器人运动规划方法,Du Y. 等人。 (2010)。
  • 全自动驾驶中车道变换的概率在线 POMDP 决策,Ulbrich S.,Maurer M. (2013)。
  • 求解连续 POMDPs:通过增量学习有效空间表示的值迭代,Brechtel S. 等人。 (2013)。
  • 使用连续 POMDPs 的自动驾驶不确定性下的概率决策,Brechtel S. 等人。 (2014)。
  • MOMDP 意图感知运动规划,Bandyopadhyay T. 等人。 (2013)。
  • DNC 使用具有动态外部存储器的神经网络进行混合计算,Graves A. 等人 (2016)。
  • 推断交通参与者内部状态对于高速公路自动驾驶的价值,Sunberg Z. 等人。 (2017)。
  • 城市交叉口自主导航的信念国家规划、Bouton M.、Cosgun A.、Kochenderfer M. (2017)。
  • 利用传感器遮挡进行自动驾驶的可扩展决策,Bouton M. 等人。 (2018)。
  • 道路交叉口的概率决策:公式化和定量评估,Barbier M.,Laugier C.,Simonin O.,Ibanez J.(2018)。
  • 美女与野兽:无人机竞赛的最佳方法与学习,Kaufmann E. 等人。 (2018)。
  • social perception 具有社会感知的自动驾驶汽车行为规划,Sun L. 等人 (2019)。

转移:earth_americas:

  • IT&E 能够像动物一样适应的机器人、Cully A.、Clune J.、Tarapore D.、Mouret J-B。 (2014)。
  • MAML 用于快速适应深度网络的模型无关元学习、Finn C.、Abbeel P.、Levine S. (2017)。
  • 自动驾驶虚拟到真实的强化学习,Pan X. 等人。 (2017)。
  • 模拟到真实:学习四足机器人的敏捷运动,Tan J. 等人。 (2018)。
  • ME-TRPO 模型集成信任区域策略优化,Kurutach T. 等人。 (2018)。
  • 启动深度强化学习,Schmitt S. 等人。 (2018)。
  • 学习灵巧徒手操作、OpenAI (2018)。
  • GrBAL / ReBAL 通过元强化学习学习适应动态的现实环境,Nagabandi A. 等人。 (2018)。
  • 学习腿式机器人的敏捷和动态运动技能,Hwangbo J. 等人。 (ETH 苏黎世/英特尔 ISL)(2019)。
  • 使用深度强化学习的四足机器人鲁棒恢复控制器、Lee J.、Hwangbo J.、Hutter M. (ETH 苏黎世 RSL) (2019)
  • IT&E 使用“智能试错”算法学习和适应四足动物步态、Dalin E.、Desreumaux P.、Mouret J-B。 (2019)。
  • FAMLE 通过模拟先验的元学习嵌入实现机器人技术的快速在线适应、Kaushik R.、Anne T.、Mouret J-B。 (2020)。
  • 针对观测的对抗性扰动的鲁棒深度强化学习,Zhang H. 等人 (2020)。 :octocat:
  • 在具有挑战性的地形上学习四足运动,Lee J. 等人。 (2020)。
  • PACOH PACOH:具有 PAC- 保证的贝叶斯最优元学习、Rothfuss J.、Fortuin V.、Josifoski M.、Krause A. (2021)。
  • 基于模型的域泛化,Robey A. 等人。 (2021)。
  • SimGAN SimGAN:通过对抗性强化学习进行域适应的混合模拟器识别,Jiang Y. 等人。 (2021)。 :octocat:
  • 在野外学习四足机器人的鲁棒感知运动,Miki T. 等人。 (2022)。

多代理:two_men_holding_hands:

  • Minimax-Q 马尔可夫游戏作为多智能体强化学习的框架,M. Littman (1994)。
  • 自治代理对其他代理进行建模:综合调查和开放问题,Albrecht S.,Stone P. (2017)。
  • MILP 移动机器人沿指定路径的时间最优协调,Altché F. 等人。 (2016)。
  • MIQP 协作半自动驾驶车辆的监督驾驶算法,Altché F. 等人。 (2017)。
  • SA-CADRL 具有深度强化学习的社交意识运动规划,Chen Y. 等人。 (2017)。
  • 通过基于变化点的行为预测进行自动驾驶多策略决策:理论与实验,Galceran E. 等人。 (2017)。
  • 可扩展自治系统的在线决策,Wray K. 等人。 (2017)。
  • MAgent MAgent:人工智能集体智能的多智能体强化学习平台,Zheng L. 等人。 (2017)。
  • 使用值迭代网络的非完整智能体的协作运动规划,Rehder E. 等人。 (2017)。
  • MPPO 通过深度强化学习实现最佳去中心化多机器人碰撞避免,Long P. 等人。 (2017)。
  • COMA 反事实多代理策略梯度,Foerster J. 等人。 (2017)。
  • MADDPG 用于混合合作竞争环境的多智能体 Actor-Critic,Lowe R. 等人 (2017)。 :octocat:
  • FTW 通过基于人群的深度强化学习在第一人称多人游戏中实现人类水平的表现,Jaderberg M. 等人。 (2018)。
  • 通过自我对弈学习多智能体谈判,Tang Y. C. (2020)。
  • MAPPO MAPPO 在合作、多代理游戏中的惊人效果,Yu C. 等人。 (2021)。 |:octocat:
  • 多智能体强化学习, Yang Y. (2021)

表征学习

  • 最优控制中的可变分辨率离散化,Munos R.,Moore A. (2002)。
  • DeepDriving DeepDriving:自动驾驶中直接感知的学习功能可供性,Chen C. 等人。 (2015)。
  • 关于端到端训练与语义抽象训练的样本复杂性,Shalev-Shwartz S. 等人。 (2016)。
  • 使用稀疏编码学习强化学习中的稀疏表示、Le L.、Kumaraswamy M.、White M. (2017)。
  • 世界模型,Ha D.,Schmidhuber J. (2018)。 :octocat:
  • 一天学习驾驶,Kendall A. 等人。 (2018)。
  • MERLIN 目标导向代理中的无监督预测记忆,Wayne G. 等人。 (2018)。 1 | 2 | 3 | 4 | 5 | 6
  • 变分端到端导航和定位,Amini A. 等人。 (2018)。
  • 感知视觉和触觉:针对接触丰富的任务的多模态表示的自监督学习,Lee M. 等人。 (2018)。
  • 循环和离散世界模型的深度神经进化,Risi S.,Stanley K.O。 (2019)。 :octocat:
  • FERM 高效机器人操作框架,Zhan A.,Zhao R. 等人。 (2021)。 :octocat:
  • S4RL S4RL:离线强化学习的令人惊讶的简单自我监督,Sinha S. 等人 (2021)。

离线

  • SPI-BB 通过基线引导进行安全策略改进,Laroche R. 等人 (2019)。
  • AWAC AWAC:使用离线数据集加速在线强化学习,Nair A. 等人 (2020)。
  • CQL 用于离线强化学习的保守 Q 学习,Kumar A. 等人。 (2020)。
  • 决策转换器:通过序列建模进行强化学习,Chen L.,Lu K. 等人。 (2021)。 :octocat:
  • 强化学习作为一个大序列建模问题, Janner M., Li Q., Levine S. (2021)。

其他

  • Bellman 残差是一个不好的代理吗?、Geist M.、Piot B.、Pietquin O. (2016)。
  • 重要的深度强化学习,Henderson P. 等人。 (2017)。
  • 使用深度强化学习的自动桥梁投标,Yeh C. 和 Lin H. (2016)。
  • 通过深度强化学习实现共享自治,Reddy S. 等人。 (2018)。
  • 作为概率推理的强化学习和控制:教程和评论,Levine S.(2018)。
  • 强化学习中的价值函数多面体,Dadashi R. 等人。 (2019)。
  • 论价值函数和智能体-环境边界,姜娜 (2019)。
  • 如何通过深度强化学习训练你的机器人;我们学到的经验教训,Ibartz J. 等人 (2021)。

从演示中学习:mortar_board:

模仿学习

  • DAgger 将模仿学习和结构化预测简化为无悔在线学习、Ross S.、Gordon G.、Bagnell J. A. (2011)。
  • QMDP-RCNN 通过循环卷积神经网络进行强化学习,Shankar T. 等人。 (2016)。 (讲)
  • DQfD 从现实世界强化学习的演示中学习,Hester T. 等人。 (2017)。
  • 找到自己的方式:城市自治路径建议的弱监督分割,Barnes D.,Maddern W.,Posner I.(2016)。
  • GAIL 生成对抗性模仿学习,Ho J.,Ermon S.(2016)。
  • 从感知到决策:自主地面机器人端到端运动规划的数据驱动方法,Pfeiffer M. 等人。 (2017)。
  • Branched 通过条件模仿学习进行端到端驾驶,Codevilla F. 等人。 (2017)。 | 讲
  • UPN 通用规划网络,Srinivas A. 等人。 (2018)。
  • DeepMimic DeepMimic:基于物理的角色技能的示例引导深度强化学习,Peng X. B. 等人。 (2018)。
  • R2P2 用于灵活推理、规划和控制的深度模仿模型,Rhinehart N. 等人。 (2018)。
  • 通过模仿动物学习敏捷机器人运动技能,Bin Peng X. 等人 (2020)。
  • 用于灵活推理、规划和控制的深度模仿模型、Rhinehart N.、McAllister R.、Levine S. (2020)。

自动驾驶的应用:汽车:

  • ALVINN,神经网络 中的自主陆地车辆,Pomerleau D. (1989)。
  • 自动驾驶汽车端到端学习,Bojarski M. 等人。 (2016)。
  • 基于大规模视频数据集的驾驶模型的端到端学习,Xu H.,Gao Y. 等人。 (2016)。
  • 考虑时间依赖性的自动驾驶车辆端到端深度学习,Eraqi H. 等人。 (2017)。
  • 像人类一样驾驶:使用卷积神经网络进行路径规划的模仿学习,Rehder E. 等人。 (2017)。
  • 使用生成对抗网络模仿驾驶员行为,Kuefler A. 等人。 (2017)。
  • PS-GAIL 用于驾驶模拟的多智能体模仿学习,Bhattacharyya R. 等人。 (2018)。 :octocat:
  • 用于增强安全性的通用城市场景自动驾驶的深度模仿学习,Chen J. 等人。 (2019)。

逆强化学习

  • Projection 通过逆强化学习进行学徒学习,Abbeel P.,Ng A. (2004)。
  • MMP 最大规划,Ratliff N. 等人。 (2006)。
  • BIRL 贝叶斯逆强化学习,Ramachandran D.,Amir E. (2007)。
  • MEIRL 最大熵逆强化学习,Ziebart B. 等人。 (2008)。
  • LEARCH 学习搜索:模仿学习的函数梯度技术,Ratliff N.,Siver D. Bagnell A. (2009)。
  • CIOC 具有局部最优示例的连续逆最优控制、Levine S.、Koltun V. (2012)。
  • MEDIRL 最大熵深度逆强化学习,Wulfmeier M. (2015)。
  • GCL 引导成本学习:通过策略优化进行深度逆最优控制,Finn C. 等人。 (2016)。
  • RIRL 重复逆强化学习,Amin K. 等人。 (2017)。
  • 弥合模仿学习和逆强化学习之间的差距,Piot B. 等人。 (2017)。

自动驾驶的应用:出租车:

  • 运动规划学徒学习,应用于停车场导航,Abbeel P. 等人。 (2008)。
  • 像出租车司机一样导航:根据观察到的上下文感知行为进行概率推理,Ziebart B. 等人。 (2008)。
  • 基于规划的行人预测,Ziebart B. 等人。 (2009)。
  • 自主导航学习,Bagnell A. 等人。 (2010)。
  • 从专家演示中学习自动驾驶风格和操作,Silver D. 等人。 (2012)。
  • 从演示中学习自动驾驶汽车的驾驶风格,Kuderer M. 等人。 (2015)。
  • 使用逆强化学习和深度 Q 网络学习驾驶,Sharifzadeh S. 等人。 (2016)。
  • 观看此内容:城市环境中路径规划的可扩展成本函数学习,Wulfmeier M. (2016)。
  • 利用对人类行为影响的自动驾驶汽车规划,Sadigh D. 等人。 (2016)。
  • 基于学习的城市自动驾驶困境处理框架,Lee S.,Seo S. (2017)。
  • 通过基于能量的模型的 Langevin 采样进行连续逆最优控制学习轨迹预测,Xu Y. 等人。 (2019)。
  • 基于逆强化学习的成本函数解释和模仿人类驾驶行为的适用性,Naumann M. 等人 (2020)。

运动规划:running_man:

搜索

  • Dijkstra 关于与图相关的两个问题的注释,Dijkstra E. W. (1959)。
  • A* 启发式确定最小成本路径的形式基础,Hart P. 等人。 (1968)。
  • 规划自动驾驶车辆的长期动态可行机动,Likhachev M.,Ferguson D. (2008)。
  • Frenet 框架中动态街道场景的最佳轨迹生成,Werling M.,Kammel S. (2010)。
  • 自动驾驶和协作汽车的 3D 感知和规划,Stiller C.,Ziegler J. (2012)。
  • 道路自动驾驶不确定性下的运动规划,Xu W. 等人。 (2014)。
  • 用于模拟赛车的蒙特卡罗树搜索,Fischer J. 等人。 (2015)。

取样

  • RRT* 基于采样的最优运动规划算法,Karaman S.,Frazzoli E. (2011)。
  • LQG-MP LQG-MP:具有运动不确定性和不完美状态信息的机器人的优化路径规划,van den Berg J. 等人。 (2010)。
  • 在置信空间中使用微分动态规划进行不确定性下的运动规划,van den Berg J. 等人。 (2011)。
  • 快速探索不确定性下运动规划的随机置信树,Bry A.,Roy N. (2011)。
  • PRM-RL PRM-RL:结合强化学习和基于采样的规划的远程机器人导航任务,Faust A. 等人。 (2017)。

优化

  • Bertha 的轨迹规划 - 局部连续方法,Ziegler J. 等人。 (2014)。
  • 用于学习运动原语的学习吸引子景观,Ijspeert A. 等人。 (2002)。
  • 基于非欧几里得旋转组非线性模型预测控制的在线运动规划,Rösmann C. 等人 (2020)。 :octocat:

反应性

  • PF 机械手和移动机器人的实时避障,Khatib O. (1986)。
  • VFH 矢量场直方图 - 移动机器人的快速避障,Borenstein J. (1991)。
  • VFH+ VFH+:快速移动机器人的可靠避障,Ulrich I.,Borenstein J. (1998)。
  • Velocity Obstacles 使用速度障碍的动态环境中的运动规划、Fiorini P.、Shillert Z. (1998)。

架构与应用

  • 自动车辆运动规划技术综述,González D. 等人。 (2016)。
  • 自动驾驶城市车辆运动规划和控制技术的调查,Paden B. 等人。 (2016)。
  • 城市环境中的自动驾驶:老板和城市挑战,Urmson C. 等人。 (2008)。
  • MIT-康奈尔碰撞及其发生原因,Fletcher L. 等人。 (2008)。
  • 让 bertha 在历史路线上进行自动驾驶之旅,Ziegler J. 等人。 (2014)。

热门栏目