文章
制作、测试并拆解技术。通过实现、实验和调研,记录技术背后的原理。
Duskcoil
.
Home
Articles
Learn
Lab
Projects
About
简体中文
日本語
English
Deutsch
Français
Español
Português
हिन्दी
Bahasa Indonesia
简体中文
한국어
Türkçe
Italiano
登录
注册
收藏
退出登录
1
#Value Function
强化学习
September 3, 2026
强化学习基础——马尔可夫决策过程、贝尔曼方程和机器人探索
强化学习是一个闭环过程,其中智能体根据观察结果选择动作并最大化延迟奖励。本入门教程解释了马尔可夫决策过程(MDP)、价值函数、策略、贝尔曼方程、探索与利用、奖励设计以及从仿真到真实机器人的实现路径。
Fundamentals · 8 分钟阅读
Home
Articles
Learn
Lab
Projects
About
×
登录
电子邮箱
密码
登录
显示名称
电子邮箱
密码
≥ 6
注册
注册 →