Contents — find the section you need

“红灯停车,跟随速度较慢的前车,并在相邻车道间隙安全时变换车道”听起来像是一个简短的程序。然而,现实道路会同时出现这三个问题,并且充满不确定性:信号灯可能部分被遮挡,前车可能转弯或停车,相邻车辆看似让行但尚未减速。自动驾驶车辆必须根据不完整的观测数据选择一种可行的行为模式,并根据场景变化不断调整。

行为规划是感知/预测和连续运动控制之间的决策层。它的输入包括自我状态、道路拓扑结构、信号灯、跟踪目标、预测的未来情况、路线意图以及运行设计域(ODD)。它的输出是离散的意图——跟随、停车、让行、并线、变换车道或进入最小风险状态——以及对车道、速度、时间和间隙的约束。它不应该直接设定转向角。它告诉下游的路径、轨迹和控制层必须实现什么,以及绝对不能违反什么。

配备立体摄像头 EyeSight 驾驶辅助系统的斯巴鲁 WRX S4配备驾驶辅助系统的量产车示例

图片:斯巴鲁 WRX S4 2.0GT-S EyeSight (Tokumeigakarinoaoshima, CC BY-SA 4.0), Wikimedia Commons。此外观照片不涉及此处讨论的任何产品的内部状态机或实现方式。

实际结论

  • 行为规划选择诸如停车、跟随、并线、变道或回退等操作;路径和轨迹规划确定实现该操作的连续运动。

  • A有限状态机对于有界函数来说是可追踪且有效的,但异常情况会导致状态转换爆炸。行为树表达了优先级和可重用的子树,但共享状态和并发操作可能会掩盖复杂性。

  • POMDP 将遮挡和潜在意图表示为概率分布,代价是需要耗费大量资源进行信念更新和未来搜索。生产系统通常会结合规则、状态机、优化和学习组件,而不是选择单一的通用方法。

  • 感知类别标签不应成为命令。行为规划需要时间戳、协方差、存在概率、轨迹历史记录和多个预测假设。

  • 路径规划解决几何可达性问题;模型预测控制 (MPC) 解决连续约束控制问题。行为规划提供它们的目标、约束、优先级、中止标准和截止时间——并且必须在报告不可行时做出反应。

  • 安全证据需要可追踪的需求、场景覆盖、边界扫描、故障注入、反事实分析、封闭路线复现以及独立的安全监控器,而不仅仅是累积的无事故里程。

1. 行为状态机使决策可检查

以下有限状态机 (FSM) 简化了高速公路辅助系统。系统巡航,跟随速度较慢的前车,在检查路线需求和安全间隙后准备变道,执行变道,然后返回巡航状态。传感器故障、ODD 退出或规划不可行都可能导致系统从任何激活状态降级或执行最小风险操作。

Diagram 1 · Use the button to switch views
行为选择:正常转换和安全监控

图 1 — Duskcoil 概念行为状态机。为了便于教学,转换过程被特意简化;该图并不代表斯巴鲁 EyeSight 或任何其他指定产品的实现或安全规范。

有限状态机 (FSM) 包含状态集 S、事件或输入集 E 和转换函数

s_{t+1}=\delta(s_t,e_t)

其主要优势在于可追溯性。日志可以记录“由于后间隙 TTC 越过其保护点,准备变道操作已中止”。转换表自然地映射到需求和测试。这使得 FSM 对于自适应巡航控制、车道保持辅助、接合和降级模式等有界功能非常有效。

其弱点在于组合性。左右变道、施工区域、紧急车辆、收费站、传感器降级和驾驶员干预都会产生大量的状态和转换。分层 FSM、显式状态所有权、优先级转换、无副作用保护和超时机制可以有效防止这种爆炸式增长。车道变换警示器可能是

g=ODD\land RouteNeed\land GapSafe\land PerceptionFresh\land TrajectoryFeasible

这个布尔值对控制流很有用,但工程师应该保留 GapSafe 背后的相对距离、速度、协方差、预测权重和新鲜度;否则,决策的改变将无法解释。

2. 行为树表达优先级和重用

行为树 (BT) 评估控制节点和叶节点组成的树状结构。序列 只有在其子节点按顺序成功后才会成功。回退/选择器 会尝试子节点,直到有一个成功或保持运行状态。条件 和 动作 叶节点检查间隙、请求轨迹或命令回退。

树状结构使“先进行紧急响应,再进行交叉路口处理,最后进行正常巡航”的流程清晰可见,并允许团队重用子树来实现安全停车、受保护转弯或泊车。它通常比全连接转换图更容易扩展。

然而,树状结构并非自动安全。从根节点触发的反应树可以在噪声条件超过其阈值时改变行为。滞后、最小停留时间和明确的完成标准是必要的。共享的黑板可以成为隐藏的全局状态。如果正在运行的动作停止,树必须取消其下游轨迹,并验证过期的命令无法保留。并行节点还需要定义资源策略:两个动作不能独立拥有纵向控制权。

3. POMDP 表示隐藏意图

并道驾驶员的意图(让行或先行)无法直接观察。被卡车遮挡的行人也无法直接观察。部分可观察的马尔可夫决策过程使用状态 s、动作 a、观察 o、转移模型 T(s'|s,a)、观察模型 O(o|s') 和奖励 R(s,a)。

对于无法直接观察到的状态,规划器维护一个置信分布 b_t(s)=P(s_t=s\mid o_{1:t},a_{1:t-1})。在执行某个动作后,观测值 o_{t+1} 到达,概念更新为

b_{t+1}(s')=\eta O(o_{t+1}|s')\sum_s T(s'|s,a_t)b_t(s)

其中 \eta 用于归一化概率。它寻找的策略类似于

\pi^*=\arg\max_\pi E\left[\sum_{k=0}^{H}\gamma^k R(s_{t+k},a_{t+k})\right]

它寻找能够最大化此值的策略 \pi。碰撞会受到非常大的惩罚,而违反规则、造成不适和延误的惩罚较小。其吸引力在于不确定性是明确的;“向前移动以观察障碍物周围”的动作可能会改善信息。成本在于计算和建模。连续的交通状态、众多参与者和较长的预测范围使得精确解不切实际。较低的奖励可能会导致激进的行为或车辆始终不动。实际系统使用规则限制候选策略,并使用近似方法,例如在线搜索、蒙特卡洛树搜索、学习值函数或紧凑意图模型。

4. 混合设计划分职责

方法 优势 劣势 适用角色
有限状态机/分层有限状态机 确定性和可追溯性 转换爆炸 模式、ODD、降级、有界ADAS
行为树 优先级、重用、恢复 黑板语义和滴答语义 任务组合和异常处理
规则/规则手册 明确的法律和安全优先级 无法枚举世界 硬约束和候选排序
马尔可夫决策过程/部分马尔可夫决策过程 不确定性下的未来交互 建模和计算成本 合并、交集、协商
模仿/强化学习 近似复杂交互 分布偏移和保证 有界ODD中的预测或候选生成

一种可行的混合模型使用有限状态机 (FSM) 来识别系统和故障模式,使用行为树 (BT) 来处理行为优先级,使用部分可知图决策过程 (POMDP) 或学习模型来评估合并选项,并使用可验证的安全包络来拒绝不安全的输出。学习组件负责提出方案;一个单独审核的约束层负责授权。具体的边界取决于目标设计 (ODD) 和安全案例。

5. 将感知和预测与分布连接起来

“车辆位于 x,y”这样的接口并不充分。行为规划需要测量时间、帧、轨迹 ID、尺寸、速度、加速度、存在概率、类别概率、协方差、遮挡情况和传感器健康状况。来自特征跟踪 (Feature Tracking) 或光流 (Optical Flow) 的运动信息并不能自动转化为三维物体速度。

预测并非将对象 i 的未来轨迹限定于单一猜测,而是可以保留多种假设模式。

P(\tau_i|z_{1:t})=\sum_m w_m P(\tau_i|m,z_{1:t}),\quad \sum_m w_m=1

对于模式 m——直行、转弯、变道或停止。规划器必须考虑低概率但高严重性的冲突,而不仅仅是最可能的路径。当协方差增大时,规划器应扩大裕度;当数据过时时,规划器应放慢速度。轨迹 ID 的交换不得将一位驾驶员的推断意图传递给另一辆车。

6. 双向连接行为、路径、轨迹和 MPC

“变道至左侧车道”并不能证明存在一条无碰撞且动态可行的轨迹。路径规划搜索的是几何自由空间。 轨迹生成 添加了时间、速度和加速度。模型预测控制 在车辆和执行器约束下优化连续控制。

一个典型的 MPC 目标是:

J=\sum_{k=0}^{N-1}\left(\|x_k-x_k^{ref}\|_Q^2+\|u_k\|_R^2+\|\Delta u_k\|_S^2\right)+\|x_N-x_N^{ref}\|_P^2

行为规划提供目标车道、速度包络线、停止线、禁行区域、舒适度目标和完成截止时间——而不仅仅是 x^{ref}。如果轨迹优化报告不可行,行为规划必须选择其他选项,而不是强制执行指令。完整的循环如下:

  1. 感知和预测更新概率世界模型。

  2. 行为规划生成并确定机动候选方案的优先级。

  3. 路径和轨迹规划测试几何和动力学可行性。

  4. MPC 计算转向、推进和制动,同时返回跟踪限制。

  5. 独立的安全监督机制会检查截止日期、新鲜度、间隙和偏差。

如果一个 10 Hz 的行为循环中的目标轨迹已经过时 300 毫秒,则该循环不再是新鲜的。应在整个流程中保留采集时间戳和过期时间。时间不匹配的变换、来自先前请求的响应以及未取消的旧轨迹是常见的集成失败原因。

7. 当前 ADAS 和自动驾驶示例的实际表现

斯巴鲁将 EyeSight 描述为一种以立体摄像头感知为核心的驾驶辅助技术,支持碰撞避免辅助和跟随等功能。公开的功能描述并未透露其内部实现是否使用了有限状态机 (FSM)、蓝牙 (BT) 或学习型决策组件。车主手册(而非产品昵称)定义了天气、能见度、速度、道路状况和驾驶员的职责。

SAE 2 级高速公路辅助系统可以在驾驶员持续监控路况的同时控制转向和速度。美国国家公路交通安全管理局 (NHTSA) 明确区分了辅助驾驶员的二级高级驾驶辅助系统 (ADAS) 和三至五级自动驾驶系统 (ADS)。二级 ADAS 辅助驾驶员需要保持专注,而三至五级 ADAS 则需要保持专注。例如,梅赛德斯-奔驰的 DRIVE PILOT 系统在三级功能有限的情况下,会在驾驶员专注驾驶时执行驾驶任务,并在超出其功能范围时请求接管。梅赛德斯-奔驰宣布其 2025 年更新版在德国获得最高 95 公里/小时的行驶速度认证,但该认证结果不应推广至所有道路、天气、车辆或司法管辖区。

Waymo 等地理范围有限的无人驾驶服务结合了行为规划、冗余传感、地图、车队运营、远程协助、ODD 管理和安全论证。Waymo 会公布事故率对比数据并提供可下载数据,但这些结果并不能证明其性能具有普遍性。读者必须仔细审查运营城市、道路暴露情况、报告标准、基准构建、行驶里程和置信区间。

8. 安全意味着对智能进行约束

即使是效用很高的候选动作 a,如果违反了安全约束 C_j,也必须被拒绝:

a^*=\arg\max_{a\in A_{safe}} U(a),\qquad A_{safe}=\{a\in A\mid C_j(a)\le0,\ \forall j\}

如果 A_{safe} 为空,系统必须暴露规划失败并进入最小风险策略。约束条件可以涵盖碰撞裕度、保证停车空间、道路偏离、车辆稳定性、信号、路权和执行器限制。当进度、礼让、法律和安全无法作为一个单一的不透明标量进行优化时,规则手册有助于确定优先级。

ISO 26262 规范了由电子电气设备故障引起的危险。ISO 21448(SOTIF)规范了即使没有组件故障,功能或规范不足造成的不合理风险——例如,雾中的感知限制或对建筑工人手势的误解。网络安全是另一个重要维度:伪造的地图或误导性的车联网(V2X)输入可能会将原本无故障的规划器引向危险。正如V2X入门指南所解释的,有效的签名验证的是信息的来源和完整性,而非信息的物理真实性。

独立的安全监控器应避免与主规划器共享所有假设和故障模式。它可以监控碰撞时间、可行驶空间、速度、跟踪误差、计算截止时间和传感器健康状况,并在必要时覆盖正常行为。每当主规划器发生变化时,备用路径和紧急路径都需要重新验证。

9. 评估不仅仅需要成功率

  • 安全:碰撞、最小碰撞时间、反应时间、制动裕度、严重规避。

  • 规则和社交互动:信号、停止线、优先权、让行、激进驾驶和过度谨慎。

  • 舒适性:加速度、横向加速度、偏航率和加加速度j=da/dt。

  • 进度:到达率、行驶时间、死锁、不必要的停车和重新规划。

  • 鲁棒性:雨天、眩光、遮挡、地图变化、延迟和传感器丢失情况下的性能下降。

  • 可追溯性:可复现的选择操作、被拒绝的备选方案、输入数据年龄、规则/模型版本和安全裕度。

不要将罕见事件掩盖在平均值中。即使是将故障概率p视为独立伯努利试验的简单上限估计,也不能让零次观测故障得出p=0的结论。预先确定所需的置信水平和暴露程度,并将场景难度与实际驾驶分布相匹配。公共道路里程可以提供真实的暴露程度,但对罕见危险组合的采样效率低下,因此应将其与模拟、封闭场地和日志回放相结合。

10. 实验性工作流程

  1. 定义 ODD 和职责。 记录道路等级、速度、天气、照明、地图、连通性、驾驶员角色以及 0-5 级职责边界。使用 SAE 自动化级别入门 分配 DDT、对象和事件检测与响应以及回退机制。

  2. 定义行为词汇。 明确定义停车、跟随、让行、并线、变道和靠边停车的进入、完成、中止和超时条件。

  3. 冻结接口。 版本控制帧、时间戳、协方差、预测模式、轨迹 ID、取消确认和计算截止时间。

  4. 检查决策结构。 查找不可达状态、循环、优先级反转、同时为真的保护条件以及无法达到最小风险条件的路径。

  5. 测试不变性。 测试诸如“不要越过可达的红色停止线”和“不要在感知失效后加速”之类的属性声明。

  6. 回放日志。 保持感知输出不变,并比较不同版本的规划器。人类驾驶是有用的证据,但并非唯一的真实情况。

  7. 扫描场景边界。 在过渡阈值两侧改变相对速度、遮挡、摩擦力、光照和延迟;使用变形测试来发现非理性翻转。

  8. 注入故障。 移除摄像头、交换轨迹 ID、切换 GNSS、偏移地图、伪造 V2X 数据、使 MPC 超时以及限制执行器;验证性能下降情况。

  9. 分阶段部署。 从仿真过渡到硬件在环、封闭赛道、安全驾驶员操作以及具有明确停止标准的有界服务。

  10. 对比反事实模拟和实际回放。 当模拟估计在没有干预的情况下会发生什么时,应暴露模型误差并在封闭的赛道上重现典型案例。

  11. 追踪变化。 感知模型的更新会改变行为分布。将需求、设计、代码、测试和安全声明关联起来,然后从实际依赖关系图中选择回归范围。

最终日志不应仅仅记录“已选择变道”。将带有时间戳的对象、信念或预测模式、候选动作、成本、安全裕度、拒绝原因、已选择的行为、下游可行性、实际指令和跟踪误差关联到一个追踪 ID 下。否则,一次性的现场决策将无法重现。

一个有用的悖论:安全驾驶有时必须有所进展

在屏幕截图中,一个缺乏经验的规划者可以通过在十字路口无限期地等待来避免碰撞。但在实际交通中,过度犹豫会阻碍其他车辆,违反预期,并可能导致不安全的超车。相反的错误是将另一辆车的轻微减速视为必须让行的约束性承诺。

行为规划之所以困难,是因为其他道路使用者会预测并应对本车的行为。车辆向前行驶的微小动作会改变他们的预测;他们的反应又会改变本车的判断。这种反馈解释了研究从“如果”语句到部分可预测决策过程(POMDP)、博弈论和学习策略的演变过程。一个生产系统仍然需要将这些复杂的理论转化为可检验的语句:它为什么继续行驶?观察什么情况会让它停止?还剩下多少余地?

主要及相关来源

检查你的理解
应该超车决策是否立即执行?

检查预测和轨迹可行性。行为层必须处理执行失败,并在必要时返回等待状态。

Related reading

Explore another aspect of this field占用栅格地图绘制——将激光雷达和摄像头数据转化为可通行性Explore another aspect of this fieldSAE驾驶自动化等级0-5——ADAS背后的责任边界