Contents — find the section you need
教机器人安全地放置杯子、避开狭窄通道中的人或操作复杂的工具,通常比听起来要难得多,因为奖励难以明确。奖励与目标的距离可能会鼓励机器人推开障碍物;而仅仅奖励最终成功则可能无法提供有用的探索信号。模仿学习利用人类、远程操作员或现有策略的演示来学习观察行为。逆强化学习 (IRL) 则试图推断使演示行为合理的目标(或奖励),然后针对该目标制定策略。
仅仅使用人类数据并不能保证两种方法的安全性。核心问题在于:策略在演示中未提及的状态下如何运作?如何确定标签的时间和归属?如何收集失败数据?以及哪些因素独立地限制了物理行为?本文将行为克隆 (BC)、协变量偏移、DAgger、逆强化学习 (IRL)、视觉-语言-动作模型、评估、安全性和数据来源联系起来。参见强化学习基础、PPO 和 SAC和VLA 入门了解相关概念。
实践结论
-
BC 是从已演示状态 s 到专家动作 a 的监督学习。它启动速度很快,但早期的小错误就可能导致策略进入从未见过的状态分布。
-
DAgger 在受控环境中运行当前策略,向专家询问策略实际访问过的状态对应的动作,聚合这些标签,然后重新训练。它将故障模式转化为数据,但需要安全执行和可靠的专家干预。
-
IRL 会根据演示数据估计奖励值 r_\theta(s,a),并据此优化策略。奖励值并非唯一确定;应根据在特定条件下的行为以及明确的安全约束来判断奖励值,而不是根据看似合理的热图。
-
VLA 可以是一个大型条件模仿策略,但语言和图像尺度并不能消除物理限制、时间限制、接触安全限制或安全停止路径限制。
演示数据是操作记录,而不仅仅是视频
一个可用的演示数据应包含以下信息:观察结果(图像、深度、力、关节状态)、动作(关节指令、速度、夹爪、停止)、时间戳、帧数、任务指令、成功/失败、操作员、环境条件和干预事件。如果记录的指令是经过传输延迟后到达机器人的指令,而不是操作员的预期指令,则该延迟应包含在数据集中。100 毫秒的图像到机械臂的偏差会将正确的行为转化为不一致的训练对。
数据来源包括采集者同意、录制环境许可、隐私、第三方作品、机器人安全责任以及追溯样本来源的能力。混合使用公共数据集需要检查许可、商业使用条款、再分发、人员和音频,以及针对预期用途的校准。“来自互联网”并非来源;它缺乏可追溯的同意和条款。
图:Duskcoil,概念图。实际部署是数据收集;该图并不意味着可以省略安全监控、停止逻辑或操作员干预。
行为克隆和协变量偏移
给定专家对 D=\{(s_i,a_i^*)\}_{i=1}^N,连续动作行为克隆 (BC) 可以最小化
离散动作使用交叉熵。如果多个动作有效,则单个平方误差预测可以将“向左传递”和“向右传递”平均为一个不安全的中间动作;条件分布、混合模型或扩散式策略可以表示多种模式。上下文、操作员风格和任务指令都很重要。
行为克隆的吸引力在于它可以在奖励设计或探索之前进行离线训练。其核心弱点在于,演示来自专家状态分布 d_{\pi^*}(s),而部署产生的是 d_{\pi_\theta}(s)。小的错误会改变下一个。观察可以累积误差。在简化的分析中,单步误差 \epsilon 在序列时间范围 T 内可以增长到 O(T^2\epsilon) 阶;确切的界限取决于假设,但因果关系是持久的:策略会生成其自身的未来输入。
DAgger:聚合学习器运行过程中的标签
数据集聚合在受控条件下运行学习到的策略,请求专家在实际访问的状态 s 执行期望的操作 a^*,将该对添加到 D,然后重新训练。迭代过程中可以使用策略混合。该方法使训练分布向部署分布靠拢。
DAgger 并非允许机器人在公共场合出现故障。首先需要进行仿真,降低运行速度,设置物理防护装置、远程紧急停止按钮、专家立即接管以及动作安全过滤器。标签可以是专家实际执行的操作,也可以是对“应该如何操作”的反事实回答。这里发生了什么事?后者虽然有价值,但会增加专家的工作量、延迟和主观差异。应围绕未发现的故障模式来规划数据收集,而不仅仅关注行数。
IRL:推断目标而非复制动作
IRL 根据专家策略 \pi_E 估计奖励 r_\theta(s,a) 或 r_\theta(s,a,s')。最大熵的直觉是,专家轨迹倾向于高奖励,同时避免在相似的优秀轨迹中出现不必要的确定性。从概念上讲,轨迹 \tau 的概率为
更新 \theta 以提高专家轨迹的概率,可以得到一个可以与强化学习 (RL) 或最优控制相结合的奖励。这可能比直接边界条件 (BC) 更能适应新的初始状态或约束,因为目标可以重新优化。
但是,许多奖励都可以解释相同的演示;未观察到的约束和操作员习惯可能会被吸收。学习奖励。能够解释训练轨迹的奖励可能会造成危险的泛化。GAIL 式方法则通过判别器匹配专家和学习者的占用分布。这两种方法都不能仅通过推理来学习禁令——碰撞、夹力、人体禁区。明确的安全规则仍然需要明确说明。
与 VLA 的联系
视觉-语言-动作模型 (VLA) 将下一个动作或动作块与图像、语言和机器人状态联系起来。广义上讲,这是一种大规模的条件模仿。其对象和语言范围并不能保证能够外推到新的光照、摩擦力、摄像头位置、模糊指令或接触力限制。例如,VLA 对“把杯子放在架子上”的解释本身并不能保证力、碰撞距离、关节活动范围或停止距离;参见VLA 入门。
在动作到达执行器之前,验证坐标系、单位、速度、加速度和新鲜度。将其路由到……运动学、碰撞检测以及阻抗或位置/速度控制器。含糊不清的语言应触发澄清、拒绝或低速模式;感知下降应停止执行。数据尺度不能替代物理安全限制。
评估、安全性和来源
不要仅凭离线操作错误就批准策略。创建针对初始姿态、物体、光照、背景、摩擦力、延迟、指令措辞和干扰的保留评估。报告成功、碰撞、停止、干预次数、峰值力、完成时间和观察到的最差情况。高平均成功率并不能消除罕见的人为或设备风险。跟踪每次 DAgger 迭代、源演示、标注者、拆分、模型、阈值、故障和回滚路径。
| 层 | 验证 | 故障响应 |
|---|---|---|
| 数据 | 同意、许可、时间、帧、成功/失败来源 | 隔离、重新标注、停止使用 |
| 策略 | 保留状态、偏移、操作不确定性 | 慢速、咨询专家、重新收集 |
| 驱动 | 限位、速率、碰撞、力、通信 | 安全过滤器、停止、急停 |
| 操作 | 主管、恢复、日志、变更控制 | 回滚和根本原因分析 |
模仿是否能还原演示者的原因?
重现行为和推断奖励是不同的任务。多种奖励可能解释相同的行为,因此请检查强化学习 (IRL) 的假设。
评论
请先登录。
暂无数据。