Contents — find the section you need

教机器人安全地放置杯子、避开狭窄通道中的人或操作复杂的工具,通常比听起来要难得多,因为奖励难以明确。奖励与目标的距离可能会鼓励机器人推开障碍物;而仅仅奖励最终成功则可能无法提供有用的探索信号。模仿学习利用人类、远程操作员或现有策略的演示来学习观察行为。逆强化学习 (IRL) 则试图推断使演示行为合理的目标(或奖励),然后针对该目标制定策略。

仅仅使用人类数据并不能保证两种方法的安全性。核心问题在于:策略在演示中未提及的状态下如何运作?如何确定标签的时间和归属?如何收集失败数据?以及哪些因素独立地限制了物理行为?本文将行为克隆 (BC)、协变量偏移、DAgger、逆强化学习 (IRL)、视觉-语言-动作模型、评估、安全性和数据来源联系起来。参见强化学习基础、PPO 和 SAC和VLA 入门了解相关概念。

实践结论

  • BC 是从已演示状态 s 到专家动作 a 的监督学习。它启动速度很快,但早期的小错误就可能导致策略进入从未见过的状态分布。

  • DAgger 在受控环境中运行当前策略,向专家询问策略实际访问过的状态对应的动作,聚合这些标签,然后重新训练。它将故障模式转化为数据,但需要安全执行和可靠的专家干预。

  • IRL 会根据演示数据估计奖励值 r_\theta(s,a),并据此优化策略。奖励值并非唯一确定;应根据在特定条件下的行为以及明确的安全约束来判断奖励值,而不是根据看似合理的热图。

  • VLA 可以是一个大型条件模仿策略,但语言和图像尺度并不能消除物理限制、时间限制、接触安全限制或安全停止路径限制。

演示数据是操作记录,而不仅仅是视频

一个可用的演示数据应包含以下信息:观察结果(图像、深度、力、关节状态)、动作(关节指令、速度、夹爪、停止)、时间戳、帧数、任务指令、成功/失败、操作员、环境条件和干预事件。如果记录的指令是经过传输延迟后到达机器人的指令,而不是操作员的预期指令,则该延迟应包含在数据集中。100 毫秒的图像到机械臂的偏差会将正确的行为转化为不一致的训练对。

数据来源包括采集者同意、录制环境许可、隐私、第三方作品、机器人安全责任以及追溯样本来源的能力。混合使用公共数据集需要检查许可、商业使用条款、再分发、人员和音频,以及针对预期用途的校准。“来自互联网”并非来源;它缺乏可追溯的同意和条款。

Diagram 1 · Use the button to switch views
从演示中学习;聚合访问状态

图:Duskcoil,概念图。实际部署是数据收集;该图并不意味着可以省略安全监控、停止逻辑或操作员干预。

行为克隆和协变量偏移

给定专家对 D=\{(s_i,a_i^*)\}_{i=1}^N,连续动作行为克隆 (BC) 可以最小化

\min_\theta\;\mathcal L_{BC}(\theta)=\frac1N\sum_{i=1}^N\lVert\pi_\theta(s_i)-a_i^*\rVert_2^2

离散动作使用交叉熵。如果多个动作有效,则单个平方误差预测可以将“向左传递”和“向右传递”平均为一个不安全的中间动作;条件分布、混合模型或扩散式策略可以表示多种模式。上下文、操作员风格和任务指令都很重要。

行为克隆的吸引力在于它可以在奖励设计或探索之前进行离线训练。其核心弱点在于,演示来自专家状态分布 d_{\pi^*}(s),而部署产生的是 d_{\pi_\theta}(s)。小的错误会改变下一个。观察可以累积误差。在简化的分析中,单步误差 \epsilon 在序列时间范围 T 内可以增长到 O(T^2\epsilon) 阶;确切的界限取决于假设,但因果关系是持久的:策略会生成其自身的未来输入。

DAgger:聚合学习器运行过程中的标签

数据集聚合在受控条件下运行学习到的策略,请求专家在实际访问的状态 s 执行期望的操作 a^*,将该对添加到 D,然后重新训练。迭代过程中可以使用策略混合。该方法使训练分布向部署分布靠拢。

DAgger 并非允许机器人在公共场合出现故障。首先需要进行仿真,降低运行速度,设置物理防护装置、远程紧急停止按钮、专家立即接管以及动作安全过滤器。标签可以是专家实际执行的操作,也可以是对“应该如何操作”的反事实回答。这里发生了什么事?后者虽然有价值,但会增加专家的工作量、延迟和主观差异。应围绕未发现的故障模式来规划数据收集,而不仅仅关注行数。

IRL:推断目标而非复制动作

IRL 根据专家策略 \pi_E 估计奖励 r_\theta(s,a) 或 r_\theta(s,a,s')。最大熵的直觉是,专家轨迹倾向于高奖励,同时避免在相似的优秀轨迹中出现不必要的确定性。从概念上讲,轨迹 \tau 的概率为

p_\theta(\tau)\propto\exp\left(\sum_t r_\theta(s_t,a_t)\right)

更新 \theta 以提高专家轨迹的概率,可以得到一个可以与强化学习 (RL) 或最优控制相结合的奖励。这可能比直接边界条件 (BC) 更能适应新的初始状态或约束,因为目标可以重新优化。

但是,许多奖励都可以解释相同的演示;未观察到的约束和操作员习惯可能会被吸收。学习奖励。能够解释训练轨迹的奖励可能会造成危险的泛化。GAIL 式方法则通过判别器匹配专家和学习者的占用分布。这两种方法都不能仅通过推理来学习禁令——碰撞、夹力、人体禁区。明确的安全规则仍然需要明确说明。

与 VLA 的联系

视觉-语言-动作模型 (VLA) 将下一个动作或动作块与图像、语言和机器人状态联系起来。广义上讲,这是一种大规模的条件模仿。其对象和语言范围并不能保证能够外推到新的光照、摩擦力、摄像头位置、模糊指令或接触力限制。例如,VLA 对“把杯子放在架子上”的解释本身并不能保证力、碰撞距离、关节活动范围或停止距离;参见VLA 入门。

在动作到达执行器之前,验证坐标系、单位、速度、加速度和新鲜度。将其路由到……运动学、碰撞检测以及阻抗或位置/速度控制器。含糊不清的语言应触发澄清、拒绝或低速模式;感知下降应停止执行。数据尺度不能替代物理安全限制。

评估、安全性和来源

不要仅凭离线操作错误就批准策略。创建针对初始姿态、物体、光照、背景、摩擦力、延迟、指令措辞和干扰的保留评估。报告成功、碰撞、停止、干预次数、峰值力、完成时间和观察到的最差情况。高平均成功率并不能消除罕见的人为或设备风险。跟踪每次 DAgger 迭代、源演示、标注者、拆分、模型、阈值、故障和回滚路径。

层 验证 故障响应
数据 同意、许可、时间、帧、成功/失败来源 隔离、重新标注、停止使用
策略 保留状态、偏移、操作不确定性 慢速、咨询专家、重新收集
驱动 限位、速率、碰撞、力、通信 安全过滤器、停止、急停
操作 主管、恢复、日志、变更控制 回滚和根本原因分析
检查你的理解
模仿是否能还原演示者的原因?

重现行为和推断奖励是不同的任务。多种奖励可能解释相同的行为,因此请检查强化学习 (IRL) 的假设。

参考文献

What to read next

Review the background基于模型的强化学习和模拟到现实Continue the seriesπ0详解——流量匹配如何改变VLA动作生成Explore another aspect of this field多智能体强化学习入门——如何在对方也在学习的世界中进行优化