7
#Reinforcement Learning
多智能体强化学习入门——如何在对方也在学习的世界中进行优化
当多个智能体同时学习时,单智能体马尔可夫决策过程(MDP)不再适用。本文通过公式和图表,系统地阐述了非平稳性、合作/竞争/混合环境、CTDE、信用分配问题以及MADDPG和QMIX等问题。
Fundamentals · 12 分钟阅读奖励设计入门——为什么“最大化什么”是强化学习中最难的部分
在强化学习的实现中,奖励函数的设计往往比算法本身更能决定最终结果。本文将探讨稀疏奖励与密集奖励、基于势函数的奖励塑造的策略不变性、奖励操纵的真实案例、逆强化学习以及约束强化学习。
Fundamentals · 11 分钟阅读世界模型中的技术趋势
“‘世界模型’能够学习环境的动态变化,并在其内部模拟未来。从 Ha & Schmidhuber 的 VAE+RNN,到 DreamerV3、Genie 3 和 Sora,再到 Yann LeCun 倡导的 JEPA 架构——本文描绘了生成式和非生成式方法之间的分歧,以及双方都面临的物理一致性障碍。”
Trends · 11 分钟阅读强化学习入门:模仿学习和逆强化学习
行为克隆、DAgger 和逆强化学习在奖励难以编写时会使用演示。本入门指南涵盖协变量偏移、奖励推断、VLA 连接、评估、安全性和数据来源。
Fundamentals · 7 分钟阅读 强化学习 September 3, 2026强化学习基础——马尔可夫决策过程、贝尔曼方程和机器人探索
强化学习是一个闭环过程,其中智能体根据观察结果选择动作并最大化延迟奖励。本入门教程解释了马尔可夫决策过程(MDP)、价值函数、策略、贝尔曼方程、探索与利用、奖励设计以及从仿真到真实机器人的实现路径。
Fundamentals · 8 分钟阅读 强化学习 September 3, 2026基于模型的强化学习和模拟到现实
世界模型、预测误差、模型预测控制、域随机化、系统辨识以及真实机器的安全监控。
Fundamentals · 6 分钟阅读导航技术发展趋势
从传统的地图、代价地图和路径规划流程,到基于强化学习的端到端方法,再到基于视觉语言模型的基础模型,本文探讨了自主移动机器人导航的现状。
Trends · 9 分钟阅读