文章
制作、测试并拆解技术。通过实现、实验和调研,记录技术背后的原理。
← 返回 · 机器学习
8

强化学习

强化学习 — 按照清晰的学习路径,从基础原理走向实际应用。

强化学习 September 4, 2026

多智能体强化学习入门——如何在对方也在学习的世界中进行优化

当多个智能体同时学习时,单智能体马尔可夫决策过程(MDP)不再适用。本文通过公式和图表,系统地阐述了非平稳性、合作/竞争/混合环境、CTDE、信用分配问题以及MADDPG和QMIX等问题。

Fundamentals · 12 分钟阅读
强化学习 September 4, 2026

π0详解——流量匹配如何改变VLA动作生成

“物理智能π0的基于源代码的技术指南:PaliGemma VLM和专用动作专家,具有条件流匹配的连续动作生成,跨越七种机器人类型的跨具身训练,以及与RT-2和OpenVLA等自回归VLA模型的区别。”

Fundamentals · 13 分钟阅读
强化学习 September 4, 2026

奖励设计入门——为什么“最大化什么”是强化学习中最难的部分

在强化学习的实现中,奖励函数的设计往往比算法本身更能决定最终结果。本文将探讨稀疏奖励与密集奖励、基于势函数的奖励塑造的策略不变性、奖励操纵的真实案例、逆强化学习以及约束强化学习。

Fundamentals · 11 分钟阅读
强化学习 September 3, 2026

强化学习入门:模仿学习和逆强化学习

行为克隆、DAgger 和逆强化学习在奖励难以编写时会使用演示。本入门指南涵盖协变量偏移、奖励推断、VLA 连接、评估、安全性和数据来源。

Fundamentals · 7 分钟阅读
强化学习 September 3, 2026

强化学习基础——马尔可夫决策过程、贝尔曼方程和机器人探索

强化学习是一个闭环过程,其中智能体根据观察结果选择动作并最大化延迟奖励。本入门教程解释了马尔可夫决策过程(MDP)、价值函数、策略、贝尔曼方程、探索与利用、奖励设计以及从仿真到真实机器人的实现路径。

Fundamentals · 8 分钟阅读
强化学习 September 3, 2026

基于模型的强化学习和模拟到现实

世界模型、预测误差、模型预测控制、域随机化、系统辨识以及真实机器的安全监控。

Fundamentals · 6 分钟阅读
强化学习 September 3, 2026

策略梯度、PPO 和 SAC——机器人稳定连续控制

策略梯度直接更新策略,从而保持转向、推力和关节扭矩的连续性。本文将Actor-Critic算法、PPO算法和SAC算法联系起来,然后讨论裁剪、熵正则化、评估以及仿真到实测迁移的安全边界。

Fundamentals · 8 分钟阅读
强化学习 September 3, 2026

Q学习和DQN——从Q表到深度强化学习

Q学习使用贝尔曼最优目标来更新动作值。本入门教程从表格形式的Q表讲解到深度Q网络,解释了经验回放、目标网络、高估以及机器人堆叠中的安全放置等概念。

Fundamentals · 8 分钟阅读