Contents — find the section you need
总结
基于模型的强化学习(RL)学习一个世界模型\hat f,该模型将状态和动作映射到预测的下一个状态,测试模型内部的动作序列,并将监督下的动作应用于硬件。无模型方法直接从奖励中学习策略;基于模型的强化学习(MBRL)可以更高效地利用数据并表达约束,但模型误差可能导致仅在模拟器上成功。参见强化学习基础、Q学习、PPO/SAC和MPC。
世界模型与规划
图 1 — 由 Duskcoil 创建的概念性 SVG,并非测量系统数据。
学习 \hat s_{t+1}=\hat f_\theta(s_t,a_t) 并优化滚动时域目标函数:
仿真到实际、识别和安全性
单步误差会在长时间的测试中累积。集成方法可以估计不确定性;规划器可以避开高方差区域并使用较短的视界。域随机化会改变质量、摩擦力、延迟、传感器噪声、光照和相机姿态。系统识别测量惯性、摩擦力、电机常数和延迟,因此这些范围是合理的,而不是任意的。
从日志记录到低速影子控制,再到有界监督试验。将紧急停止、独立的速度/力/温度监控器、通信丢失停止和人机分离等操作排除在学习策略之外。常见的故障包括固定摩擦力仿真导致车轮打滑、光照过拟合、奖励机制作弊导致振动以及未建模的延迟导致不稳定。报告违规次数、停止距离、不确定性触发的弃权等。最坏情况行为——不仅仅是平均奖励。
无模型和基于模型的角色
无模型强化学习直接从经验更新策略或值。当接触动态难以建模时,它具有很强的表达能力,但每次改进都可能消耗实际试验次数。基于模型的强化学习 (MBRL) 重用每次转换来训练预测器,并在该预测器中评估多个候选序列。如果预测器存在系统性偏差,规划器会优化一个仅在模拟器上运行的捷径。
| 方面 | 无模型 | 基于模型 |
|---|---|---|
| 硬件数据 | 低到中等效率 | 在模型范围内为中到高效率 |
| 运行时间 | 通常策略推理较轻 | 每个周期进行部署和优化 |
| 约束 | 通常是一个间接的奖励/安全层 | 自然地将其纳入规划问题中 |
| 主要缺陷 | 从稀疏数据中推断效果差 | 长期模型误差 |
| 典型适用场景 | 复杂的接触和视觉策略 | 短期运动、能量和热规划 |
混合堆栈很常见:学习到的策略提出候选方案,学习到的模型预测短期预测范围,而模型预测控制 (MPC) 则强制执行速度、力和电流约束。使用 PPO/SAC 文章 和 MPC 文章 来分配时间和安全性责任,而不是将算法视为替代品。
不要将不确定性简化为一个数字
认知不确定性源于训练数据的缺失;随机不确定性源于不可约的传感器和环境变化。集成方差对于前者是一个有用的信号,但集成仍然可能共享相同的偏差。当预测方差超过阈值时,应缩短预测范围、降低速度、切换到经典控制器或在规划之前收集另一个观测值。此弃权策略必须在部署之前指定。
对于单步残差 e_t=s_{t+1}-\hat s_{t+1},对数分位数和除了均方误差外,还应考虑最坏情况。较低的平均误差可能掩盖了碰撞前不久的较大误差。切勿将概率预测区间解读为安全保证;务必保持独立的碰撞、力、温度和电流监测。
设计辨识实验
系统辨识是一个实验设计问题,而非单一的校准问题。对于电机,应分别测量静摩擦力、不同转速下的惯性、负载相关的扭矩以及通信往返延迟。对于液压执行器,应在同一时钟周期内记录压力、流量、油缸速度、油温和阀门指令的时间戳。数据应按日期、楼层、有效载荷、光照和温度进行分割,而不是随机分割相邻帧,以确保最终数据集是真正未曾见过的。
一个简单的数值示例
考虑一辆 1 kg 的小车,其速度每 T_s=0.1\,\mathrm{s} 变化 0.1u。无摩擦模型预测,在五个步骤内,小车的速度将增加 0.5\,\mathrm{m/s},持续 u=1。如果实际小车失去……每步摩擦力达到 0.02\,\mathrm{m/s},五步误差达到 0.1\,\mathrm{m/s}。较短的预测周期、在线识别、速度约束中的裕量以及基于测量结果的重新规划,使得这个简单的模型仍然有效。
发布证据
除了方程之外,还要保留训练周期、传感器速率、延迟、随机种子、环境参数、求解器截止时间和回退策略。绘制预测残差、约束违反、停止距离以及由不确定性触发的弃权情况,并使用与奖励相同的实验 ID。如果无法共享原始日志,请发布匿名统计数据、仿真设置、单位和参考日期,以确保声明的范围可验证。
学习到的模型能否保证可靠的长距离滚动?
较小的模型误差会在预测过程中累积。检查滚动长度、不熟悉的状态以及验证情况。
真实环境。参考资料
世界模型类型和规划器
物理模型可解释,但可能难以处理接触问题;潜在模型和集成模型可能效率较高,但需要针对真实空间安全性进行验证。候选动作可以使用射击法、CEM 或可微分 MPC,并设置截止时间回退机制。
数据集清理
标记饱和传感器、时间误差、限幅器干预、插值和最终原因。保持评估集的不可变性,以防止模型更新掩盖回归问题。
证据边界
预测准确率、奖励和硬件安全行为是不同的声明。请分别发布每个声明的指标、测试条件和负责的安全层。
评论
请先登录。
暂无数据。