- Fundamentals · 8 分钟阅读
强化学习基础——马尔可夫决策过程、贝尔曼方程和机器人探索
强化学习是一个闭环过程,其中智能体根据观察结果选择动作并最大化延迟奖励。本入门教程解释了马尔可夫决策过程(MDP)、价值函数、策略、贝尔曼方程、探索与利用、奖励设计以及从仿真到真实机器人的实现路径。
- Fundamentals · 8 分钟阅读
Q学习和DQN——从Q表到深度强化学习
Q学习使用贝尔曼最优目标来更新动作值。本入门教程从表格形式的Q表讲解到深度Q网络,解释了经验回放、目标网络、高估以及机器人堆叠中的安全放置等概念。
- Fundamentals · 8 分钟阅读
策略梯度、PPO 和 SAC——机器人稳定连续控制
策略梯度直接更新策略,从而保持转向、推力和关节扭矩的连续性。本文将Actor-Critic算法、PPO算法和SAC算法联系起来,然后讨论裁剪、熵正则化、评估以及仿真到实测迁移的安全边界。
- Fundamentals · 11 分钟阅读
奖励设计入门——为什么“最大化什么”是强化学习中最难的部分
在强化学习的实现中,奖励函数的设计往往比算法本身更能决定最终结果。本文将探讨稀疏奖励与密集奖励、基于势函数的奖励塑造的策略不变性、奖励操纵的真实案例、逆强化学习以及约束强化学习。
- Fundamentals · 6 分钟阅读
基于模型的强化学习和模拟到现实
世界模型、预测误差、模型预测控制、域随机化、系统辨识以及真实机器的安全监控。
- Fundamentals · 7 分钟阅读
强化学习入门:模仿学习和逆强化学习
行为克隆、DAgger 和逆强化学习在奖励难以编写时会使用演示。本入门指南涵盖协变量偏移、奖励推断、VLA 连接、评估、安全性和数据来源。
- Fundamentals · 13 分钟阅读
π0详解——流量匹配如何改变VLA动作生成
“物理智能π0的基于源代码的技术指南:PaliGemma VLM和专用动作专家,具有条件流匹配的连续动作生成,跨越七种机器人类型的跨具身训练,以及与RT-2和OpenVLA等自回归VLA模型的区别。”
- Fundamentals · 12 分钟阅读
多智能体强化学习入门——如何在对方也在学习的世界中进行优化
当多个智能体同时学习时,单智能体马尔可夫决策过程(MDP)不再适用。本文通过公式和图表,系统地阐述了非平稳性、合作/竞争/混合环境、CTDE、信用分配问题以及MADDPG和QMIX等问题。