文章
制作、测试并拆解技术。通过实现、实验和调研,记录技术背后的原理。
Duskcoil
.
Home
Articles
Learn
Lab
Projects
About
简体中文
日本語
English
Deutsch
Français
Español
Português
हिन्दी
Bahasa Indonesia
简体中文
한국어
Türkçe
Italiano
登录
注册
收藏
退出登录
1
#Reward Hacking
强化学习
September 4, 2026
奖励设计入门——为什么“最大化什么”是强化学习中最难的部分
在强化学习的实现中,奖励函数的设计往往比算法本身更能决定最终结果。本文将探讨稀疏奖励与密集奖励、基于势函数的奖励塑造的策略不变性、奖励操纵的真实案例、逆强化学习以及约束强化学习。
Fundamentals · 11 分钟阅读
Home
Articles
Learn
Lab
Projects
About
×
登录
电子邮箱
密码
登录
显示名称
电子邮箱
密码
≥ 6
注册
注册 →