Contents — find the section you need

« S’arrêter au feu rouge, suivre le véhicule qui précède plus lentement et changer de voie lorsque l’espace adjacent est suffisant » ressemble à un programme court. Sur une route réelle, ces trois problèmes sont présentés avec une part d’incertitude : le feu est partiellement masqué, le véhicule qui précède peut tourner ou se garer, et le conducteur adjacent semble céder le passage mais n’a pas encore ralenti. Un véhicule automatisé doit sélectionner un mode de comportement acceptable à partir d’observations incomplètes, puis l’ajuster en fonction de l’évolution de la situation.

La planification comportementale constitue la couche de décision entre la perception/prédiction et le contrôle continu du mouvement. Ses entrées comprennent l’état du véhicule, la topologie de la route, les feux de signalisation, les objets suivis, les futurs prévus, l’intention de l’itinéraire et le domaine de conception opérationnelle (DCO). Ses sorties sont des intentions discrètes — suivre, s’arrêter, céder le passage, s’insérer, changer de voie ou entrer dans une zone à risque minimal — ainsi que des contraintes sur la voie, la vitesse, le temps et le dégagement. Elle ne doit pas calculer directement un angle de braquage. Elle indique aux couches de chemin, de trajectoire et de contrôle en aval ce qui doit être réalisé et ce qui ne doit jamais être enfreint.

Subaru WRX S4 équipée du système d'assistance à la conduite EyeSight avec caméra stéréoExemple de véhicule de série avec assistance à la conduite

Image : Subaru WRX S4 2.0GT-S EyeSight (Tokumeigakarinoaoshima, CC BY-SA 4.0), Wikimedia Commons. Cette photographie extérieure ne révèle pas le fonctionnement interne ni la mise en œuvre du produit présenté ici.

Conclusion pratique

  • La planification du comportement sélectionne une manœuvre telle que l'arrêt, le suivi, l'insertion, le changement de voie ou le repli ; la planification de la trajectoire détermine le mouvement continu qui la réalise.

  • A Une machine à états finis est traçable et efficace pour les fonctions bornées, mais les exceptions peuvent provoquer une explosion des transitions d'état. Un arbre de comportement exprime les priorités et les sous-arbres réutilisables, mais l'état partagé et les actions concurrentes peuvent masquer la complexité.

  • Un POMDP représente l'occlusion et l'intention latente sous forme de distributions de probabilité, au prix de mises à jour coûteuses des croyances et d'une recherche future. Les systèmes de production combinent généralement règles, machines à états, optimisation et composants d'apprentissage plutôt que de choisir une méthode universelle.

  • Une étiquette de classe de perception ne doit pas devenir une commande. La planification comportementale nécessite des horodatages, la covariance, la probabilité d'existence, l'historique des trajectoires et de multiples hypothèses de prédiction.

  • La planification de trajectoire résout le problème d'accessibilité géométrique ; le MPC résout le problème du contrôle continu sous contraintes. La planification comportementale fournit leurs objectifs, contraintes, priorités, critères d'abandon et échéances, et doit réagir lorsqu'elle signale une impossibilité.

  • Les preuves de sécurité nécessitent des exigences traçables, une couverture de scénarios, des analyses de limites, l'injection de défauts, l'analyse contrefactuelle, la reproduction en circuit fermé et un moniteur de sécurité indépendant, et pas seulement le nombre de kilomètres sans incident accumulés.

1. Une machine à états comportementale prend des décisions inspectable

L'automate fini (AF) suivant simplifie l'assistance à la conduite sur autoroute. Le système roule en vitesse de croisière, suit un véhicule plus lent, prépare un changement de voie après vérification de la nécessité de l'itinéraire et d'un intervalle de sécurité, l'exécute, puis reprend sa vitesse de croisière. Des défaillances de capteurs, une sortie ODD ou une impossibilité de planification peuvent entraîner, depuis n'importe quel état actif, une dégradation des performances ou une manœuvre à risque minimal.

Diagram 1 · Use the button to switch views
Sélection du comportement : transitions normales et surveillance de la sécurité

Figure 1 — Automate à états du comportement conceptuel de Duskcoil. Les transitions sont volontairement simplifiées à des fins pédagogiques ; Le diagramme ne représente ni l'implémentation ni les spécifications de sécurité de Subaru EyeSight ou de tout autre produit mentionné.

Un automate fini (FSM) possède un ensemble d'états S, un ensemble d'événements ou d'entrées E et une fonction de transition.

s_{t+1}=\delta(s_t,e_t)

Son principal avantage est la traçabilité. Un journal peut indiquer : « La préparation du changement de voie a été annulée car le système de contrôle de trajectoire (TTC) arrière a franchi sa limite. » Les tables de transition correspondent naturellement aux exigences et aux tests. Cela rend les automates finis précieux pour les fonctions délimitées telles que le régulateur de vitesse adaptatif, l'assistance au maintien de voie, l'engagement et les modes de dégradation.

Leur point faible réside dans la complexité combinatoire. Les changements de voie à droite et à gauche, les zones de travaux, les véhicules d'urgence, les péages, la dégradation des capteurs et l'intervention du conducteur génèrent un produit d'états et de transitions. Les automates finis hiérarchiques, la gestion explicite des états, les transitions priorisées, les gardes sans effets secondaires et les temporisations permettent de limiter cette complexité. Un agent de changement de voie pourrait être :

g=ODD\land RouteNeed\land GapSafe\land PerceptionFresh\land TrajectoryFeasible

Ce booléen est utile pour la gestion du flux, mais les ingénieurs doivent conserver la distance relative, la vitesse, la covariance, les pondérations de prédiction et la date de dernière modification associées à GapSafe ; sinon, une décision modifiée ne peut être expliquée.

2. Les arbres de comportement expriment la priorité et la réutilisation

Un arbre de comportement (AC) évalue un arbre de nœuds de contrôle et de feuilles. Une Séquence réussit uniquement si ses enfants réussissent dans l'ordre. Un Sélecteur/Repli teste les enfants jusqu'à ce que l'un d'eux réussisse ou reste actif. Les feuilles Condition et Action vérifient un intervalle, demandent une trajectoire ou commandent un repli.

La structure arborescente rend visible la priorité donnée à la « réponse d'urgence avant la gestion de l'intersection avant la circulation normale » et permet aux équipes de réutiliser des sous-arbres pour un arrêt sécurisé, un virage protégé ou un stationnement. Il est souvent plus facile de l'étendre qu'un graphe de transition global.

Cependant, un arbre n'est pas automatiquement sûr. Un arbre réactif, déclenché à partir de sa racine, peut adapter son comportement lorsqu'une condition perturbée franchit son seuil. L'hystérésis, un temps de séjour minimal et des critères d'achèvement explicites sont nécessaires. Un tableau noir partagé peut devenir un état global caché. Si une action en cours est interrompue, l'arbre doit annuler sa trajectoire en aval et vérifier que les commandes obsolètes ne peuvent pas être conservées. Les nœuds parallèles nécessitent également une politique de ressources définie : deux actions ne peuvent pas contrôler indépendamment l'ordre longitudinal.

3. Les POMDP représentent l'intention cachée

L'intention d'un conducteur s'insérant sur une voie (céder le passage ou s'engager en premier) n'est pas directement observable. Il en va de même pour un piéton derrière un camion qui le masque. Un processus de décision markovien partiellement observable utilise l'état s , l'action a , l'observation o , le modèle de transition T(s'|s,a) , le modèle d'observation O(o|s') et la récompense R(s,a) .

Pour les états non directement visibles, le planificateur maintient une distribution de croyances b_t(s)=P(s_t=s\mid o_{1:t},a_{1:t-1}). Après une observation o_{t+1} suite à une action, la mise à jour conceptuelle est la suivante :

b_{t+1}(s')=\eta O(o_{t+1}|s')\sum_s T(s'|s,a_t)b_t(s)

où \eta normalise la probabilité. Le système recherche une politique telle que :

\pi^*=\arg\max_\pi E\left[\sum_{k=0}^{H}\gamma^k R(s_{t+k},a_{t+k})\right]

Il recherche la politique \pi qui maximise cette probabilité. Une collision peut entraîner une pénalité très élevée, tandis que les infractions aux règles, l’inconfort et les retards sont moins pénalisés. L’avantage réside dans la prise en compte explicite de l’incertitude ; une action consistant à « avancer légèrement pour voir autour de l’obstacle » peut améliorer l’information. Le coût est lié au calcul et à la modélisation. Un état de trafic continu, de nombreux acteurs et un horizon temporel long rendent les solutions exactes impraticables. Des récompenses insuffisantes peuvent engendrer des comportements agressifs ou l’immobilisation d’un véhicule. Les systèmes pratiques limitent les candidats par des règles et utilisent des approximations telles que la recherche en ligne, la recherche arborescente Monte Carlo, les fonctions de valeur apprises ou les modèles d’intention compacts.

4. Les conceptions hybrides répartissent les responsabilités

Méthode Points forts Points faibles Rôle approprié
Automate fini / Automate fini hiérarchique Déterministe et traçable Explosion de transitions Modes, ODD, dégradation, ADAS borné
Arbre de comportement Priorité, réutilisation, récupération Sémantique tableau noir et tic Composition des tâches et gestion des exceptions
Règles / Recueils de règles Priorité légale et de sécurité explicite Impossible d'énumérer le monde Contraintes strictes et classement des candidats
Processus de décision markovien / Processus de décision perceptible par impulsions Interaction future en contexte d'incertitude Modélisation et coût de calcul Fusion, intersections, négociation
Apprentissage par imitation / renforcement Approximation des interactions complexes Décalage de distribution et assurance Prédiction ou génération de candidats dans un ODD borné

Un modèle hybride plausible utilise un automate fini pour les modes système et de défaillance, un arbre de comportement pour les priorités comportementales, un processus de décision perceptible par impulsions ou un modèle appris pour évaluer les options de fusion, et une enveloppe de sécurité vérifiable pour rejeter les sorties non sécurisées. Un composant d'apprentissage propose une action ; une couche de contraintes, examinée séparément, l'autorise. La limite exacte dépend du modèle ODD et du scénario de sécurité.

5. Relier la perception et la prédiction aux distributions

« Voiture à la position x,y » ne constitue pas une interface suffisante. La planification comportementale nécessite l'instant de mesure, l'image, l'identifiant de la trajectoire, les dimensions, la vitesse, l'accélération, la probabilité d'existence, les probabilités de classe, la covariance, l'occlusion et l'état des capteurs. Le mouvement issu du Suivi de caractéristiques ou du Flux optique ne correspond pas automatiquement à la vitesse de l'objet 3D.

Plutôt que de baser la trajectoire future de l'objet i sur une seule estimation, la prédiction peut conserver plusieurs hypothèses.

P(\tau_i|z_{1:t})=\sum_m w_m P(\tau_i|m,z_{1:t}),\quad \sum_m w_m=1

Pour le mode m : tout droit, virage, changement de voie ou arrêt. Le planificateur doit prendre en compte les conflits à faible probabilité mais à forte gravité, et non pas seulement le chemin le plus probable. Il doit augmenter la marge lorsque la covariance augmente et la réduire lorsque les données deviennent obsolètes. Un changement d'identifiant de voie ne doit pas transférer l'intention inférée d'un conducteur à un autre véhicule.

6. Relier de manière bidirectionnelle le comportement, la trajectoire et le MPC

« Changer pour la voie de gauche » ne prouve pas l'existence d'une trajectoire sans collision et dynamiquement réalisable. La planification de trajectoires explore l'espace géométrique libre. La génération de trajectoires (/fr/blog/posts/control-trajectory-generation.html) intègre le temps, la vitesse et l'accélération. La commande prédictive par modèle (/fr/blog/posts/control-mpc.html) optimise le contrôle continu en tenant compte des contraintes du véhicule et des actionneurs.

Un objectif MPC représentatif est :

J=\sum_{k=0}^{N-1}\left(\|x_k-x_k^{ref}\|_Q^2+\|u_k\|_R^2+\|\Delta u_k\|_S^2\right)+\|x_N-x_N^{ref}\|_P^2

La planification comportementale définit la voie cible, la plage de vitesse, la ligne d'arrêt, l'espace interdit, la cible de confort et la date limite d'exécution, et non pas seulement x^{ref}. Si l'optimisation de la trajectoire conclut à son inapplicabilité, la planification comportementale doit sélectionner une autre option plutôt que d'imposer une commande. La boucle complète est la suivante :

  1. La perception et la prédiction mettent à jour un modèle probabiliste du monde.

  2. La planification comportementale génère et hiérarchise les manœuvres candidates.

  3. La planification de la trajectoire teste la faisabilité géométrique et dynamique.

  4. Le MPC calcule la direction, la propulsion et le freinage tout en respectant les limites de suivi. 5. Un système de supervision de sécurité indépendant vérifie les délais, la mise à jour, la disponibilité et les écarts.

Une boucle de comportement à 10 Hz n'est pas à jour si ses trajectoires d'objets datent déjà de 300 ms. Les horodatages d'acquisition et d'expiration doivent être conservés tout au long du processus. Les transformations temporellement décalées, les réponses à une requête précédente et une ancienne trajectoire non annulée sont des erreurs d'intégration fréquentes.

7. Ce que les exemples actuels d'ADAS et de conduite automatisée démontrent réellement

Subaru décrit EyeSight comme une technologie d'aide à la conduite basée sur la perception par caméra stéréoscopique, prenant en charge des fonctions telles que l'assistance à l'évitement des collisions et le suivi de véhicule. Les descriptions publiques des fonctionnalités ne précisent pas si une implémentation interne utilise un automate fini, un système de suivi de trajectoire ou des composants de décision appris. Le manuel du propriétaire (et non un surnom du produit) définit les conditions météorologiques, la visibilité, la vitesse, l'état de la route et les obligations du conducteur.

L'assistance autoroutière de niveau 2 SAE peut contrôler simultanément la direction et la vitesse, tandis que le conducteur surveille en permanence la route. La NHTSA distingue clairement les systèmes ADAS de niveau 2, qui assistent le conducteur humain, des systèmes ADAS de niveaux 3 à 5. Dans une fonction de niveau 3 limitée, comme le système Mercedes-Benz DRIVE PILOT, le système effectue la conduite pendant que le conducteur est impliqué et peut reprendre le contrôle à la limite de son champ d'application. Mercedes-Benz a annoncé l'homologation en Allemagne pour une vitesse maximale de 95 km/h sous certaines conditions pour sa mise à jour de 2025 ; cette affirmation ne doit pas être généralisée à l'ensemble des routes, conditions météorologiques, véhicules ou juridictions.

Un service de conduite autonome à couverture géographique limitée, tel que Waymo, combine la planification du comportement avec la redondance des capteurs, la cartographie, la gestion de flotte, l'assistance à distance, la gestion des données ODD et une analyse de sécurité. Waymo publie des comparaisons de taux d'accidents et des données téléchargeables, mais ces résultats ne constituent pas une preuve de performance universelle. Il est essentiel d'examiner les villes d'exploitation, le réseau routier, les critères de rapport, les infrastructures de référence, le kilométrage et les intervalles de confiance.

8. La sécurité implique de limiter l'intelligence

Même une action candidate a présentant une grande utilité doit être rejetée si elle enfreint une contrainte de sécurité C_j :

a^*=\arg\max_{a\in A_{safe}} U(a),\qquad A_{safe}=\{a\in A\mid C_j(a)\le0,\ \forall j\}

Si A_{safe} est vide, le système doit signaler une défaillance de planification et adopter une stratégie à risque minimal. Les contraintes peuvent concerner la marge de collision, l'espace d'arrêt garanti, la sortie de route, la stabilité du véhicule, la signalisation, la priorité de passage et les limites des actionneurs. Les manuels de règles permettent de définir les priorités lorsque la progression, la courtoisie, le respect du code de la route et la sécurité ne peuvent être optimisés simultanément par une seule variable opaque.

La norme ISO 26262 traite des dangers causés par un dysfonctionnement électrique/électronique. La norme ISO 21448, SOTIF, traite des risques inacceptables liés à une insuffisance fonctionnelle ou de spécification, même en l'absence de défaut de composant — par exemple, une limitation de la perception par temps de brouillard ou un geste mal interprété d'un ouvrier sur un chantier. La cybersécurité représente une dimension supplémentaire : une carte falsifiée ou des données V2X erronées peuvent conduire un planificateur pourtant infaillible vers le danger. Comme l’explique le Guide V2X, une signature valide authentifie l’origine et l’intégrité d’un message, et non sa véracité physique.

Un superviseur de sécurité indépendant doit éviter de partager toutes ses hypothèses et tous ses modes de défaillance avec le planificateur principal. Il peut surveiller le temps avant collision, l’espace praticable, la vitesse, l’erreur de suivi, le délai de calcul et l’état des capteurs, puis modifier le comportement normal. Les itinéraires de repli et d’urgence doivent être revalidés à chaque modification du planificateur principal.

9. L’évaluation ne se limite pas au taux de réussite

  • Sécurité : collisions, TTC minimal, temps de réaction, marge d’arrêt, manœuvres d’évitement graves.

  • Règles et interactions sociales : signalisation, lignes d’arrêt, priorité, cédez le passage, agressivité et prudence excessive.

  • Confort : accélération, accélération latérale, vitesse de lacet et à-coup.

  • Progression : taux d'arrivée, temps de trajet, embouteillages, arrêts inutiles et modifications d'itinéraire.

  • Robustesse : dégradation due à la pluie, aux reflets, aux occlusions, aux changements de carte, à la latence et aux pertes de capteurs.

  • Traçabilité : reproductibilité des actions sélectionnées, des alternatives rejetées, de l'ancienneté des données d'entrée, de la version des règles/du modèle et de la marge de sécurité.

Ne pas noyer les événements rares dans une moyenne. Même une simple estimation de la limite supérieure, traitant la probabilité de défaillance p comme des épreuves de Bernoulli indépendantes, ne permet pas de conclure à l'absence de défaillances observées p=0. Fixez à l'avance le niveau de confiance et l'exposition requis, et adaptez la difficulté du scénario à la distribution réelle de la conduite. Les kilomètres parcourus sur route ouverte offrent une exposition réaliste, mais échantillonnent mal les combinaisons dangereuses rares ; il est donc conseillé de les combiner avec des simulations, des circuits fermés et la relecture des journaux de bord.

10. Flux de travail expérimental

  1. Définir l'ODD et les responsabilités. Enregistrer la classe de route, la vitesse, les conditions météorologiques, l'éclairage, la cartographie, la connectivité, le rôle du conducteur et les limites de responsabilité des niveaux 0 à 5. Allouer la DDT, la détection et la réponse aux objets et aux événements, ainsi que le mécanisme de repli à l'aide du Guide des niveaux d'automatisation SAE.

  2. Définir le vocabulaire comportemental. Attribuer des conditions explicites d'entrée, de fin, d'annulation et de délai d'expiration aux actions suivantes : arrêt, suivi, cédez le passage, insertion, changement de voie et stationnement.

  3. Figer les interfaces. Versionner les trames, les horodatages, la covariance, les modes de prédiction, les identifiants de trajectoire, les accusés de réception d'annulation et les délais de calcul.

  4. Inspecter la structure de décision. Identifier les états inaccessibles, les cycles, les inversions de priorité, les gardes simultanément vraies et les chemins ne permettant pas d'atteindre une condition de risque minimal. 5. Vérification des invariants. Tester les propriétés du véhicule, par exemple : « ne pas franchir une ligne rouge d’arrêt accessible » et « ne pas accélérer après une perte de perception ».

  5. Relecture des journaux. Maintenir la sortie de perception constante et comparer les versions du planificateur. La conduite humaine est un élément de preuve utile, mais ne constitue pas la seule vérité.

  6. Exploration des limites du scénario. Faire varier la vitesse relative, l’occlusion, le frottement, l’éclairage et la latence de part et d’autre des seuils de transition ; utiliser des tests métamorphiques pour détecter les basculements irrationnels.

  7. Injection de défauts. Désactiver les caméras, inverser les identifiants de voie, désactiver le GNSS, décaler les cartes, falsifier les données V2X, interrompre le MPC et limiter les actionneurs ; vérifier la dégradation.

  8. Déploiement par étapes. Passer de la simulation à la simulation matérielle, au circuit fermé, à l’exploitation par un conducteur de sécurité et au service limité avec des critères d’arrêt explicites. 10. Comparer la relecture contrefactuelle et la relecture physique. Lorsque la simulation estime ce qui se passerait sans intervention, exposez les erreurs du modèle et reproduisez des cas représentatifs sur un circuit fermé.

  9. Suivre les modifications. Une mise à jour du modèle de perception modifie la distribution des comportements. Liez les exigences, la conception, le code, les tests et les arguments de sécurité, puis choisissez le périmètre de régression à partir du graphe de dépendances réel.

Le journal final doit contenir plus d'informations que « changement de voie sélectionné ». Associez les objets horodatés, les modes de croyance ou de prédiction, les actions candidates, les coûts, les marges de sécurité, les raisons de rejet, le comportement sélectionné, la faisabilité en aval, la commande réelle et l'erreur de suivi sous un seul identifiant de trace. Sans cela, une décision ponctuelle prise sur le terrain ne peut être reconstituée.

Un paradoxe utile : la conduite sûre implique parfois d'avancer

Un planificateur naïf peut éviter une collision sur une capture d'écran en attendant indéfiniment à une intersection. Dans la circulation, une hésitation excessive bloque les autres, contrevient aux attentes et peut provoquer des dépassements dangereux. L'erreur inverse consiste à considérer la légère décélération d'un autre véhicule comme un engagement ferme à céder le passage.

La planification comportementale est complexe car les autres usagers de la route anticipent et réagissent au véhicule conduit. Avancer progressivement modifie leur anticipation ; leur réaction modifie la perception du véhicule conduit. Cette rétroaction explique l’évolution de la recherche, des énoncés conditionnels aux processus décisionnels orientés vers la performance (POMDP), à la théorie des jeux et aux politiques apprises. Un système de production doit néanmoins traduire cette complexité en énoncés vérifiables : pourquoi a-t-il avancé, quelle observation l’aurait arrêté et quelle marge de manœuvre restait-il ?

Sources principales et connexes

Vérifiez votre compréhension
Faut-il exécuter une décision de dépassement ?