文章
制作、测试并拆解技术。通过实现、实验和调研,记录技术背后的原理。
Duskcoil
.
Home
Articles
Learn
Lab
Projects
About
简体中文
日本語
English
Deutsch
Français
Español
Português
हिन्दी
Bahasa Indonesia
简体中文
한국어
Türkçe
Italiano
登录
注册
收藏
退出登录
1
#Entropy
强化学习
September 3, 2026
策略梯度、PPO 和 SAC——机器人稳定连续控制
策略梯度直接更新策略,从而保持转向、推力和关节扭矩的连续性。本文将Actor-Critic算法、PPO算法和SAC算法联系起来,然后讨论裁剪、熵正则化、评估以及仿真到实测迁移的安全边界。
Fundamentals · 8 分钟阅读
Home
Articles
Learn
Lab
Projects
About
×
登录
电子邮箱
密码
登录
显示名称
电子邮箱
密码
≥ 6
注册
注册 →