3
#Sim-to-Real
强化学习
September 3, 2026
强化学习
September 3, 2026
强化学习基础——马尔可夫决策过程、贝尔曼方程和机器人探索
强化学习是一个闭环过程,其中智能体根据观察结果选择动作并最大化延迟奖励。本入门教程解释了马尔可夫决策过程(MDP)、价值函数、策略、贝尔曼方程、探索与利用、奖励设计以及从仿真到真实机器人的实现路径。
Fundamentals · 8 分钟阅读 强化学习 September 3, 2026基于模型的强化学习和模拟到现实
世界模型、预测误差、模型预测控制、域随机化、系统辨识以及真实机器的安全监控。
Fundamentals · 6 分钟阅读策略梯度、PPO 和 SAC——机器人稳定连续控制
策略梯度直接更新策略,从而保持转向、推力和关节扭矩的连续性。本文将Actor-Critic算法、PPO算法和SAC算法联系起来,然后讨论裁剪、熵正则化、评估以及仿真到实测迁移的安全边界。
Fundamentals · 8 分钟阅读