Contents — find the section you need

“Detenerse ante el semáforo en rojo, seguir al vehículo precedente más lento y cambiar de carril cuando el espacio adyacente sea seguro” suena a un programa breve. Una carretera real presenta los tres problemas de incertidumbre: el semáforo está parcialmente obstruido, el vehículo precedente puede girar o estacionar, y un conductor adyacente parece ceder el paso pero aún no ha desacelerado. Un vehículo automatizado debe seleccionar un modo de comportamiento adecuado a partir de observaciones incompletas y luego revisarlo continuamente según la evolución de la situación.

La planificación del comportamiento es la capa de decisión entre la percepción/predicción y el control continuo del movimiento. Sus entradas incluyen el estado del vehículo, la topología de la carretera, las señales, los objetos rastreados, los futuros previstos, la intención de ruta y el dominio de diseño operativo (ODD). Sus salidas son intenciones discretas —seguir, detenerse, ceder el paso, incorporarse, cambiar de carril o entrar en una condición de riesgo mínimo—, además de restricciones de carril, velocidad, tiempo y espacio libre. No debe determinar directamente el ángulo de dirección. Indica a las capas posteriores de ruta, trayectoria y control qué debe lograrse y qué no debe infringirse bajo ninguna circunstancia.

Subaru WRX S4 equipado con el sistema de asistencia al conductor EyeSight con cámara estéreoEjemplo de un vehículo de producción con asistencia al conductor

Imagen: Subaru WRX S4 2.0GT-S EyeSight (Tokumeigakarinoaoshima, CC BY-SA 4.0), Wikimedia Commons. Esta fotografía exterior no revela la máquina de estados interna ni la implementación de ningún producto aquí descrito.

Conclusión práctica

  • La planificación del comportamiento selecciona una maniobra como detenerse, seguir, incorporarse, cambiar de carril o retroceder; la planificación de la trayectoria determina el movimiento continuo que la realiza.
  • A Una máquina de estados finitos es trazable y eficaz para funciones acotadas, pero las excepciones pueden provocar una explosión de transiciones de estado. Un árbol de comportamiento expresa prioridades y subárboles reutilizables, pero el estado compartido y las acciones concurrentes pueden ocultar complejidad.

  • Un POMDP representa la oclusión y la intención latente como distribuciones de probabilidad, a costa de costosas actualizaciones de creencias y búsqueda futura. Los sistemas de producción suelen combinar reglas, máquinas de estados, optimización y componentes aprendidos en lugar de elegir un método universal.

  • Una etiqueta de clase de percepción no debe convertirse en un comando. La planificación del comportamiento requiere marcas de tiempo, covarianza, probabilidad de existencia, historial de trayectoria e hipótesis de predicción múltiple.

  • La planificación de trayectorias resuelve la alcanzabilidad geométrica; el MPC resuelve el control continuo con restricciones. La planificación del comportamiento proporciona sus objetivos, restricciones, prioridades, criterios de aborto y plazos, y debe reaccionar cuando se informa de inviabilidad.

  • La evidencia de seguridad requiere requisitos trazables, cobertura de escenarios, barridos de límites, inyección de fallos, análisis contrafactual, reproducción de trayectoria cerrada y un monitor de seguridad independiente, no solo kilómetros acumulados sin incidentes.

1. Un estado de comportamiento La máquina toma decisiones inspeccionables

La siguiente máquina de estados finitos (FSM) simplifica la asistencia en carretera. El sistema circula a velocidad constante, sigue a un vehículo líder más lento, prepara un cambio de carril tras comprobar la necesidad de la ruta y una distancia de seguridad, lo ejecuta y vuelve a circular a velocidad constante. Fallos en los sensores, salidas de ODD o inviabilidad de la planificación pueden provocar que cualquier estado activo derive en una degradación o una maniobra de riesgo mínimo.

Diagram 1 · Use the button to switch views
Selección de comportamiento: transiciones normales y monitorización de seguridad

Figura 1 — Máquina de estados de comportamiento conceptual de Duskcoil. Las transiciones se han simplificado deliberadamente para facilitar la enseñanza; El diagrama no representa la implementación ni las especificaciones de seguridad de Subaru EyeSight ni de ningún otro producto mencionado.

Una máquina de estados finitos (FSM) tiene un conjunto de estados S, un conjunto de eventos o entradas E y una función de transición

s_{t+1}=\delta(s_t,e_t)

Su principal ventaja es la trazabilidad. Un registro puede indicar: «La preparación para el cambio de carril se abortó porque el control de crucero adaptativo (TTC) de la retaguardia cruzó su protección». Las tablas de transición se corresponden de forma natural con los requisitos y las pruebas. Esto hace que las FSM sean valiosas para funciones acotadas como el control de crucero adaptativo, la asistencia de carril, la activación y los modos de degradación.

Su debilidad reside en la combinatoria. Los cambios de carril a la derecha y a la izquierda, las zonas de obras, los vehículos de emergencia, los peajes, la degradación de los sensores y la intervención del conductor generan un conjunto de estados y transiciones. Las FSM jerárquicas, la propiedad explícita de los estados, las transiciones priorizadas, las protecciones sin efectos secundarios y los tiempos de espera evitan parte de esta explosión. Un agente de cambio de carril podría ser:

g=ODD\land RouteNeed\land GapSafe\land PerceptionFresh\land TrajectoryFeasible

Este valor booleano es útil para el flujo de control, pero los ingenieros deben conservar la distancia relativa, la velocidad, la covarianza, los pesos de predicción y la información actualizada asociada a GapSafe; de lo contrario, no se podrá explicar un cambio de decisión.

2. Los árboles de comportamiento expresan prioridad y reutilización

Un árbol de comportamiento (BT) evalúa un árbol de nodos de control y hojas. Una Secuencia solo tiene éxito después de que sus hijos lo tengan en orden. Un Selector/Respaldo intenta con los hijos hasta que uno tenga éxito o permanezca en ejecución. Las hojas de Condición y Acción verifican un hueco, solicitan una trayectoria o ordenan un respaldo.

La estructura de árbol hace visible la "respuesta de emergencia antes del manejo de intersecciones antes del crucero normal" y permite a los equipos reutilizar subárboles para paradas seguras, giros protegidos o estacionamiento. A menudo es más fácil de extender que un grafo de transición de todos a todos.

Sin embargo, un árbol no es automáticamente seguro. Un árbol reactivo, con un nivel de actividad desde la raíz, puede alternar su comportamiento cuando una condición ruidosa supera su umbral. Se requieren histéresis, tiempo mínimo de permanencia y criterios de finalización explícitos. Una pizarra compartida puede convertirse en un estado global oculto. Si una acción en ejecución se detiene, el árbol debe cancelar su trayectoria descendente y verificar que los comandos obsoletos no sobrevivan. Los nodos paralelos también necesitan una política de recursos definida: dos acciones no pueden tener control longitudinal de forma independiente.

3. Los POMDP representan la intención oculta

La intención de un conductor que se incorpora al carril (ceder el paso o entrar primero) no es directamente observable. Tampoco lo es la de un peatón detrás de un camión que lo obstruye. Un proceso de decisión de Markov parcialmente observable utiliza el estado s, la acción a, la observación o, el modelo de transición T(s'|s,a), el modelo de observación O(o|s') y la recompensa R(s,a).

Para estados que no son directamente visibles, el planificador mantiene una distribución de creencias b_t(s)=P(s_t=s\mid o_{1:t},a_{1:t-1}). Tras recibir una observación o_{t+1} después de una acción, la actualización conceptual es:

b_{t+1}(s')=\eta O(o_{t+1}|s')\sum_s T(s'|s,a_t)b_t(s)

donde \eta normaliza la probabilidad. Busca una política como:

\pi^*=\arg\max_\pi E\left[\sum_{k=0}^{H}\gamma^k R(s_{t+k},a_{t+k})\right]

Busca la política \pi que maximice esta probabilidad. Una colisión puede conllevar una penalización muy elevada, con penalizaciones menores por incumplimiento de reglas, incomodidad y retraso. La ventaja reside en que la incertidumbre es explícita; una acción de "avanzar para ver alrededor de la obstrucción" puede mejorar la información. El coste es computacional y de modelado. El estado continuo del tráfico, la gran cantidad de actores y un horizonte temporal amplio hacen que las soluciones exactas sean poco prácticas. Las bajas recompensas pueden generar un comportamiento agresivo o un vehículo que nunca se mueve. Los sistemas prácticos restringen los candidatos con reglas y utilizan aproximaciones como la búsqueda en línea, la búsqueda en árbol de Monte Carlo, las funciones de valor aprendidas o los modelos de intención compactos.

4. Diseños híbridos: división de responsabilidades

Método Fortalezas Debilidades Rol apropiado
Máquina de estados finitos (FSM) / FSM jerárquica Determinista y trazable Explosión de transiciones Modos, diseño orientado a objetos (ODD), degradación, sistemas avanzados de asistencia al conductor (ADAS) limitados
Árbol de comportamiento Prioridad, reutilización, recuperación Semántica de pizarra y de marca de verificación Composición de tareas y manejo de excepciones
Reglas / manuales de reglas Prioridad legal y de seguridad explícita No puede enumerar el mundo Restricciones estrictas y clasificación de candidatos
Proceso de decisión de Markov (MDP) / Proceso de decisión de Markov de orden superior (POMDP) Interacción futura bajo incertidumbre Costo del modelo y de cómputo Fusión, intersecciones, negociación
Imitación / Aprendizaje por refuerzo Aproxima la interacción compleja Cambio de distribución y garantía Predicción o generación de candidatos en un ODD limitado

Un híbrido plausible utiliza una máquina de estados finitos (FSM) para los modos de sistema y de fallo, una tabla de comportamiento (BT) para las prioridades de comportamiento, un modelo POMDP o un modelo aprendido para puntuar las opciones de fusión, y un margen de seguridad verificable para rechazar la salida insegura. Un componente aprendido propone; una capa de restricciones revisada por separado autoriza. El límite exacto depende del ODD y del caso de seguridad.

5. Conectar percepción y predicción con distribuciones

«Coche en la posición x,y» no es una interfaz suficiente. La planificación del comportamiento requiere tiempo de medición, fotograma, ID de pista, dimensiones, velocidad, aceleración, probabilidad de existencia, probabilidades de clase, covarianza, oclusión y estado del sensor. El movimiento a partir del seguimiento de características o del flujo óptico no es automáticamente la velocidad del objeto 3D.

En lugar de basar la trayectoria futura del objeto i en una sola suposición, la predicción puede conservar múltiples modos de hipótesis.

P(\tau_i|z_{1:t})=\sum_m w_m P(\tau_i|m,z_{1:t}),\quad \sum_m w_m=1

Para el modo m: recto, giro, cambio de carril o parada. El planificador debe considerar conflictos de baja probabilidad pero alta gravedad, no solo la ruta más probable. Debe ampliar el margen cuando la covarianza aumenta y reducirlo cuando los datos se vuelven obsoletos. Un intercambio de ID de pista no debe transferir la intención inferida de un conductor a otro vehículo.

6. Conectar el comportamiento, la ruta, la trayectoria y el MPC bidireccionalmente

«Cambiar al carril izquierdo» no prueba que exista una trayectoria dinámicamente factible y libre de colisiones. La Planificación de Rutas busca en el espacio geométrico libre. La generación de trayectorias (Trayectoria) añade tiempo, velocidad y aceleración. El control predictivo basado en modelo (MPC, por sus siglas en inglés) (Control Predictivo Basado en Modelo) optimiza el control continuo bajo restricciones del vehículo y los actuadores.

Un objetivo representativo del MPC es:

J=\sum_{k=0}^{N-1}\left(\|x_k-x_k^{ref}\|_Q^2+\|u_k\|_R^2+\|\Delta u_k\|_S^2\right)+\|x_N-x_N^{ref}\|_P^2

La planificación del comportamiento proporciona el carril objetivo, el rango de velocidad, la línea de parada, el espacio prohibido, el objetivo de confort y la fecha límite de finalización, no solo x^{ref}. Si la optimización de la trayectoria indica que no es factible, la planificación del comportamiento debe seleccionar otra opción en lugar de forzar una orden. El ciclo completo es:

  1. La percepción y la predicción actualizan un modelo probabilístico del entorno.

  2. La planificación del comportamiento genera y prioriza posibles maniobras.

  3. La planificación de la trayectoria y la ruta evalúa la viabilidad geométrica y dinámica.

  4. El MPC calcula la dirección, la propulsión y el frenado, a la vez que devuelve los límites de seguimiento.

  5. La supervisión de seguridad independiente verifica los plazos, la vigencia, la autorización y las desviaciones.

Un bucle de comportamiento de 10 Hz no se considera vigente si sus trayectorias de objetos tienen ya 300 ms de antigüedad. Las marcas de tiempo de adquisición y la fecha de caducidad se mantienen a lo largo de todo el proceso. Las transformaciones con desajustes temporales, las respuestas a solicitudes anteriores y las trayectorias antiguas no canceladas son fallos de integración comunes.

7. Lo que muestran los ejemplos actuales de ADAS y conducción automatizada

Subaru describe EyeSight como una tecnología de asistencia al conductor centrada en la percepción mediante cámara estéreo, que admite funciones como la asistencia para evitar colisiones y el seguimiento. Las descripciones públicas de las funciones no revelan si una implementación interna utiliza una máquina de estados finitos (FSM), una máquina de Boltzmann (BT) o componentes de decisión aprendidos. El manual del propietario —no el nombre del producto— define las condiciones meteorológicas, la visibilidad, la velocidad, la carretera y las obligaciones del conductor.

La asistencia en carretera de nivel 2 de la SAE puede controlar la dirección y la velocidad simultáneamente mientras el conductor supervisa continuamente la carretera. La NHTSA distingue explícitamente los sistemas ADAS de Nivel 2, que asisten a un conductor humano atento, de los sistemas ADS de Niveles 3 a 5. En una función limitada de Nivel 3, como Mercedes-Benz DRIVE PILOT, el sistema realiza la tarea de conducción mientras el conductor está atento y puede solicitar la intervención del sistema en sus límites. Mercedes-Benz anunció la homologación en Alemania para velocidades de hasta 95 km/h bajo condiciones específicas para su actualización de 2025; esta afirmación no debe generalizarse a otras carreteras, condiciones climáticas, vehículos o jurisdicciones.

Un servicio de conducción autónoma con cobertura geográfica limitada, como Waymo, combina la planificación del comportamiento con sensores redundantes, mapas, gestión de flotas, asistencia remota, gestión de dispositivos de conducción autónoma y un análisis de seguridad. Waymo publica comparaciones de tasas de accidentes y datos descargables, pero estos resultados no constituyen prueba de un rendimiento universal. Los usuarios deben examinar las ciudades donde opera, la exposición vial, los criterios de notificación, la construcción de los puntos de referencia, el kilometraje y los intervalos de confianza.

8. La seguridad implica limitar la inteligencia

Incluso una acción candidata a con alta utilidad debe rechazarse si infringe una restricción de seguridad C_j:

a^*=\arg\max_{a\in A_{safe}} U(a),\qquad A_{safe}=\{a\in A\mid C_j(a)\le0,\ \forall j\}

Si A_{safe} está vacío, el sistema debe detectar fallos de planificación y adoptar una estrategia de riesgo mínimo. Las restricciones pueden abarcar el margen de colisión, el espacio de frenado garantizado, la salida de la vía, la estabilidad del vehículo, las señales, la prioridad de paso y los límites de los actuadores. Los manuales de reglas ayudan a definir la prioridad cuando el progreso, la cortesía, la normativa y la seguridad no pueden optimizarse como una única variable opaca.

La norma ISO 26262 aborda los peligros causados por fallos eléctricos y electrónicos. La norma ISO 21448, SOTIF, aborda el riesgo irrazonable derivado de la insuficiencia funcional o de las especificaciones, incluso sin un fallo en un componente; por ejemplo, una limitación de la percepción en la niebla o un gesto malinterpretado de un trabajador de la construcción. La ciberseguridad es una dimensión adicional: un mapa falsificado o una entrada V2X engañosa pueden llevar a un planificador sin fallos hacia el peligro. Como explica la Guía V2X, una firma válida autentica el origen y la integridad, no la veracidad física de un mensaje.

Un supervisor de seguridad independiente debe evitar compartir todas las suposiciones y modos de fallo con el planificador principal. Puede monitorizar el tiempo hasta la colisión, el espacio transitable, la velocidad, el error de seguimiento, el plazo de cálculo y el estado de los sensores, y luego anular el comportamiento normal. Las rutas alternativas y de emergencia requieren una revalidación cada vez que cambia el planificador habitual.

9. La evaluación requiere más que una tasa de éxito

  • Seguridad: colisiones, tiempo mínimo hasta la colisión, tiempo de reacción, margen de frenado, evasiones graves.

  • Reglas e interacción social: señales, líneas de parada, prioridad, ceder el paso, agresividad y precaución excesiva.

  • Comodidad: aceleración, aceleración lateral, velocidad de guiñada y sacudida j=da/dt.

  • Progreso: tasa de llegada, tiempo de viaje, bloqueo, paradas innecesarias y replanificaciones.

  • Robustez: degradación bajo lluvia, deslumbramiento, oclusión, cambio de mapa, latencia y pérdida de sensores.

  • Trazabilidad: acción seleccionada reproducible, alternativas rechazadas, antigüedad de la entrada, versión de la regla/modelo y margen de seguridad.

No oculte eventos raros en un promedio. Incluso una simple estimación del límite superior que trata la probabilidad de falla p como ensayos de Bernoulli independientes no permite concluir que no se observen fallas p=0. Fije el nivel de confianza y la exposición requeridos de antemano, y ajuste la dificultad del escenario a la distribución real de la conducción. Los kilómetros recorridos en carreteras públicas proporcionan una exposición realista, pero muestrean combinaciones peligrosas raras de forma ineficiente, por lo que se recomienda combinarlos con simulación, circuitos cerrados y reproducción de registros.

10. Un flujo de trabajo experimental

  1. Definir ODD y responsabilidad. Registrar la clase de carretera, velocidad, clima, iluminación, mapeo, conectividad, rol del conductor y el límite de responsabilidad de nivel 0-5. Asignar DDT, detección y respuesta de objetos y eventos, y reserva utilizando la Guía básica de niveles de automatización SAE.

  2. Definir el vocabulario de comportamiento. Especificar condiciones explícitas de entrada, finalización, cancelación y tiempo de espera para detenerse, seguir, ceder el paso, incorporarse, cambiar de carril y detenerse.

  3. Congelar interfaces. Versionar marcos, marcas de tiempo, covarianza, modos de predicción, identificadores de trayectoria, confirmaciones de cancelación y plazos de cálculo.

  4. Inspeccionar la estructura de decisión. Identificar estados inalcanzables, ciclos, inversiones de prioridad, condiciones de guarda simultáneamente verdaderas y rutas que no pueden alcanzar una condición de riesgo mínimo.

  5. Prueba de invariantes. Comprueba afirmaciones de propiedad como «no cruces una línea roja de parada alcanzable» y «no aceleres si la percepción ha caducado».

  6. Reproduce registros. Mantén constante la salida de percepción y compara las versiones del planificador. La conducción humana es una evidencia útil, pero no la única verdad absoluta.

  7. Explora los límites del escenario. Varía la velocidad relativa, la oclusión, la fricción, la iluminación y la latencia a ambos lados de los umbrales de transición; utiliza pruebas metamórficas para detectar cambios irracionales.

  8. Inyecta fallos. Desconecta cámaras, intercambia identificadores de pista, cambia la señal GNSS, desplaza mapas, falsifica datos V2X, agota el tiempo de espera del MPC y limita los actuadores; verifica la degradación.

  9. Despliegue por etapas. Pasa de la simulación a la operación con hardware en bucle, circuito cerrado, conductor de seguridad y servicio limitado con criterios de parada explícitos.

  10. Comparar la simulación contrafactual con la física. Cuando la simulación estima lo que sucedería sin una intervención, exponer el error del modelo y reproducir casos representativos en un circuito cerrado.

  11. Registrar los cambios. Una actualización del modelo de percepción modifica la distribución del comportamiento. Vincular los requisitos, el diseño, el código, las pruebas y la declaración de seguridad, y luego seleccionar el alcance de la regresión a partir del gráfico de dependencias real.

El registro final debe incluir más información que simplemente «cambio de carril seleccionado». Conectar los objetos con marca de tiempo, los modos de creencia o predicción, las acciones candidatas, los costos, los márgenes de seguridad, los motivos de rechazo, el comportamiento seleccionado, la viabilidad posterior, el comando real y el error de seguimiento bajo un único identificador de seguimiento. De lo contrario, no se podrá reconstruir una decisión puntual en el terreno.

Una paradoja útil: la conducción segura a veces requiere progreso

Un planificador ingenuo puede evitar una colisión en una captura de pantalla esperando indefinidamente en una intersección. En el tráfico, la vacilación excesiva bloquea a otros, incumple las expectativas y puede provocar adelantamientos peligrosos. El error opuesto consiste en interpretar la ligera desaceleración de otro vehículo como una promesa vinculante de ceder el paso.

La planificación del comportamiento es difícil porque los demás usuarios de la vía predicen y reaccionan ante el vehículo en cuestión. Avanzar ligeramente modifica su predicción; su respuesta modifica la percepción del vehículo. Esta retroalimentación explica la evolución de la investigación, desde las declaraciones condicionales hasta los POMDP, la teoría de juegos y las políticas aprendidas. Un sistema de producción aún debe traducir esa sofisticación en afirmaciones comprobables: ¿por qué procedió?, ¿qué observación lo habría detenido?, ¿qué margen de seguridad quedaba?

Fuentes primarias y relacionadas

Comprueba tu comprensión
¿Es lo mismo elegir adelantar que planificar una trayectoria? ¿Curva?

El comportamiento selecciona la maniobra; la planificación de la trayectoria y el camino la hacen ejecutable. Una maniobra permitida aún necesita una trayectoria factible.

Related reading

Explore another aspect of this fieldMapeo de cuadrículas de ocupación: transformando la evidencia de LiDAR y cámaras en transitabilidad.Explore another aspect of this fieldNiveles de automatización de la conducción SAE 0–5: el límite de responsabilidad detrás de los sistemas avanzados de asistencia al conductor (ADAS).