Contents — find the section you need

"Fermarsi al semaforo rosso, seguire il veicolo che precede più lento e cambiare corsia quando lo spazio adiacente è sicuro" sembra un programma breve. Una strada reale presenta tutti e tre i problemi con incertezza: il semaforo è parzialmente oscurato, il veicolo che precede potrebbe svoltare o parcheggiare e un conducente del veicolo adiacente sembra dare la precedenza ma non ha ancora decelerato. Un veicolo automatizzato deve selezionare una modalità di comportamento difendibile a partire da osservazioni incomplete, per poi continuarla a rivedere man mano che la scena reagisce.

La pianificazione del comportamento è il livello decisionale tra la percezione/previsione e il controllo continuo del movimento. I suoi input includono lo stato dell'ego, la topologia stradale, i segnali, gli oggetti tracciati, i futuri previsti, l'intento di percorso e il dominio di progettazione operativa (ODD). I suoi output sono intenzioni discrete – seguire, fermarsi, dare la precedenza, immettersi, cambiare corsia o entrare in una condizione di rischio minimo – oltre a vincoli su corsia, velocità, tempo e spazio libero. Non dovrebbe inventare direttamente un angolo di sterzata. Indica ai livelli di percorso, traiettoria e controllo successivi cosa deve essere raggiunto e cosa non deve mai essere violato.

Subaru WRX S4 equipaggiata con il sistema di assistenza alla guida EyeSight con telecamera stereoEsempio di un veicolo di produzione con assistenza alla guida

Immagine: Subaru WRX S4 2.0GT-S EyeSight (Tokumeigakarinoaoshima, CC BY-SA 4.0), Wikimedia Commons. Questa fotografia esterna non rivela la macchina a stati interni o l'implementazione di alcun prodotto qui discusso.

Conclusione pratica

  • La pianificazione del comportamento seleziona una manovra come arresto, seguire, immettersi, cambiare corsia o ripiegare; la pianificazione del percorso e della traiettoria determina il movimento continuo che lo comprende.

Una macchina a stati finiti è tracciabile ed efficace per funzioni limitate, ma le eccezioni possono causare un'esplosione di transizioni di stato. Un albero comportamentale esprime priorità e sottoalberi riutilizzabili, ma stati condivisi e azioni concorrenti possono nascondere la complessità.

Un POMDP rappresenta l'occlusione e l'intento latente come distribuzioni di probabilità, a costo di costosi aggiornamenti delle credenze e ricerche future. I sistemi di produzione combinano comunemente regole, macchine a stati, ottimizzazione e componenti appresi piuttosto che scegliere un metodo universale.

Un'etichetta di classe di percezione non deve diventare un comando. La pianificazione del comportamento necessita di timestamp, covarianza, probabilità di esistenza, cronologia delle tracce e ipotesi di previsione multiple.

La pianificazione del percorso risolve la raggiungibilità geometrica; l'MPC risolve il controllo continuo vincolato. La pianificazione del comportamento fornisce i loro obiettivi, vincoli, priorità, criteri di interruzione e scadenze, e deve reagire quando segnalano l'irrealizzabilità.

Le prove di sicurezza necessitano di requisiti tracciabili, copertura di scenari, scansioni dei confini, iniezione di guasti, analisi controfattuale, riproduzione del percorso chiuso e un monitor di sicurezza indipendente, non solo di dati accumulati senza incidenti. miglia.

1. Una macchina a stati finiti comportamentale rende le decisioni ispezionabili

La seguente macchina a stati finiti (FSM) semplifica l'assistenza alla guida in autostrada. Il sistema procede a velocità costante, segue un veicolo più lento che lo precede, prepara un cambio di corsia dopo aver verificato la necessità del percorso e uno spazio di sicurezza, lo esegue e torna alla velocità di crociera. Guasti ai sensori, uscita ODD o impossibilità di pianificazione possono portare da qualsiasi stato attivo a un degrado delle prestazioni o a una manovra a rischio minimo.

Diagram 1 · Use the button to switch views
Selezione del comportamento: transizioni normali e monitoraggio della sicurezza

Figura 1 — Macchina a stati finiti comportamentale concettuale di Duskcoil. Le transizioni sono volutamente semplificate a scopo didattico; Il diagramma non rappresenta l'implementazione o le specifiche di sicurezza di Subaru EyeSight o di qualsiasi altro prodotto menzionato.

Una macchina a stati finiti (FSM) ha un insieme di stati S, un insieme di eventi o input E e una funzione di transizione

s_{t+1}=\delta(s_t,e_t)

Il suo principale vantaggio è la tracciabilità. Un log può indicare che "la preparazione al cambio di corsia è stata interrotta perché il sistema di controllo della distanza di sicurezza posteriore ha superato la sua soglia". Le tabelle di transizione si mappano naturalmente ai requisiti e ai test. Questo rende le FSM preziose per funzioni circoscritte come il cruise control adattivo, il supporto alla corsia, l'attivazione e le modalità di degrado.

Il punto debole è la combinatoria. Cambi di corsia a destra e a sinistra, zone di lavoro, veicoli di emergenza, caselli autostradali, degrado dei sensori e interventi del conducente creano un insieme di stati e transizioni. Le FSM gerarchiche, la proprietà esplicita degli stati, le transizioni prioritarie, le soglie senza effetti collaterali e i timeout prevengono in parte questa esplosione. Un segnale di cambio corsia potrebbe essere:

g=ODD\land RouteNeed\land GapSafe\land PerceptionFresh\land TrajectoryFeasible

Questo valore booleano è utile per il controllo del flusso, ma gli ingegneri dovrebbero conservare la distanza relativa, la velocità, la covarianza, i pesi di previsione e l'attualità del segnale associato a GapSafe; altrimenti, una decisione modificata non può essere spiegata.

2. Gli alberi comportamentali esprimono priorità e riutilizzo

Un albero comportamentale (BT) valuta un albero di nodi di controllo e nodi foglia. Una Sequenza ha successo solo dopo che i suoi figli hanno avuto successo in ordine. Un Fallback/Selettore prova i figli finché uno non ha successo o rimane in esecuzione. I nodi foglia Condizione e Azione verificano un intervallo, richiedono una traiettoria o comandano un fallback.

La struttura ad albero rende visibile la "risposta di emergenza prima della gestione dell'intersezione prima della normale circolazione" e consente ai team di riutilizzare i sottoalberi per l'arresto sicuro, la svolta protetta o il parcheggio. È spesso più facile da estendere rispetto a un grafo di transizione da tutti a tutti.

Tuttavia, un albero non è automaticamente sicuro. Un albero reattivo, che parte dalla radice, può alternare i comportamenti quando una condizione di rumore supera la sua soglia. Sono necessari isteresi, tempo di permanenza minimo e criteri di completamento espliciti. Una lavagna condivisa può diventare uno stato globale nascosto. Se un'azione in corso viene interrotta, l'albero deve annullare la sua traiettoria a valle e verificare che i comandi obsoleti non possano sopravvivere. Anche i nodi paralleli necessitano di una politica di risorse definita: due azioni non possono detenere indipendentemente il controllo longitudinale.

3. I POMDP rappresentano intenzioni nascoste

L'intenzione di un conducente che si immette nel traffico – dare la precedenza o precedere – non è direttamente osservabile. Lo stesso vale per un pedone dietro un camion che ostruisce la strada. Un processo decisionale di Markov parzialmente osservabile utilizza lo stato s, l'azione a, l'osservazione o, il modello di transizione T(s'|s,a), il modello di osservazione O(o|s') e la ricompensa R(s,a).

Per lo stato non direttamente visibile, il pianificatore mantiene una distribuzione di credenze b_t(s)=P(s_t=s\mid o_{1:t},a_{1:t-1}). Dopo che un'osservazione o_{t+1} arriva a seguito di un'azione, l'aggiornamento concettuale è

b_{t+1}(s')=\eta O(o_{t+1}|s')\sum_s T(s'|s,a_t)b_t(s)

dove \eta normalizza la probabilità. Cerca una politica come

\pi^*=\arg\max_\pi E\left[\sum_{k=0}^{H}\gamma^k R(s_{t+k},a_{t+k})\right]

Cerca la politica \pi che massimizza questo valore. Una collisione può comportare una penalità molto elevata, mentre per violazioni delle regole, disagi e ritardi le penalità sono inferiori. Il vantaggio risiede nell'esplicitazione dell'incertezza; un'azione di "avanzata per aggirare l'ostacolo" può migliorare le informazioni. Il costo è rappresentato dal calcolo e dalla modellazione. Lo stato continuo del traffico, la presenza di numerosi attori e un orizzonte temporale lungo rendono le soluzioni esatte impraticabili. Ricompense insufficienti possono generare comportamenti aggressivi o un veicolo che non si muove mai. I sistemi pratici limitano i candidati con delle regole e utilizzano approssimazioni come la ricerca online, la ricerca ad albero Monte Carlo, le funzioni di valore apprese o i modelli di intento compatti.

4. I progetti ibridi dividono le responsabilità

Metodo Punti di forza Punti di debolezza Ruolo appropriato
FSM / FSM gerarchico deterministico e tracciabile esplosione delle transizioni modalità, ODD, degrado, ADAS limitati
Albero comportamentale priorità, riutilizzo, recupero semantica a lavagna e tick composizione dei compiti e gestione delle eccezioni
Regole / manuali di regole priorità legale e di sicurezza esplicita Impossibile enumerare il mondo vincoli rigidi e classificazione dei candidati
MDP / POMDP interazione futura in condizioni di incertezza modellazione e costo di calcolo fusione, intersezioni, negoziazione
Apprendimento per imitazione/rinforzo approssima interazioni complesse spostamento della distribuzione e garanzia previsione o generazione di candidati in un ODD limitato

Un ibrido plausibile utilizza una macchina a stati finiti (FSM) per le modalità di sistema e di guasto, un albero di vincolo (BT) per le priorità comportamentali, un POMDP o un modello appreso per valutare le opzioni di fusione e un intervallo di sicurezza verificabile per rifiutare output non sicuri. Un componente appreso propone; un livello di vincoli, esaminato separatamente, autorizza. Il confine esatto dipende dall'ODD e dal caso di sicurezza.

5. Collegare percezione e previsione con le distribuzioni

"Auto in posizione x,y" non è un'interfaccia sufficiente. La pianificazione del comportamento richiede tempo di misurazione, frame, ID della traccia, dimensioni, velocità, accelerazione, probabilità di esistenza, probabilità di classe, covarianza, occlusione e stato di salute dei sensori. Il movimento derivante dal Tracciamento delle Caratteristiche o dal Flusso Ottico non corrisponde automaticamente alla velocità dell'oggetto 3D.

Anziché basare la traiettoria futura dell'oggetto i su una singola ipotesi, la previsione può mantenere più modalità di ipotesi.

P(\tau_i|z_{1:t})=\sum_m w_m P(\tau_i|m,z_{1:t}),\quad \sum_m w_m=1

per la modalità m — rettilineo, svolta, cambio di corsia o arresto. Il pianificatore deve considerare i conflitti a bassa probabilità ma ad alta gravità, non solo il percorso più probabile. Dovrebbe ampliare il margine quando la covarianza aumenta e rallentare quando i dati diventano obsoleti. Uno scambio di ID di tracciamento non deve trasferire l'intento inferito da un conducente a un altro veicolo.

  1. Collegare comportamento, percorso, traiettoria e MPC in modo bidirezionale

"Cambia nella corsia di sinistra" non dimostra l'esistenza di una traiettoria dinamicamente fattibile e priva di collisioni. La Pianificazione del percorso ricerca nello spazio geometrico libero. La Generazione della traiettoria aggiunge tempo, velocità e accelerazione. Il Controllo predittivo del modello ottimizza il controllo continuo in base ai vincoli del veicolo e degli attuatori.

Un obiettivo MPC rappresentativo è:

J=\sum_{k=0}^{N-1}\left(\|x_k-x_k^{ref}\|_Q^2+\|u_k\|_R^2+\|\Delta u_k\|_S^2\right)+\|x_N-x_N^{ref}\|_P^2

La pianificazione del comportamento fornisce la corsia di destinazione, l'inviluppo di velocità, la linea di arresto, lo spazio interdetto, l'obiettivo di comfort e la scadenza di completamento, non solo x^{ref}. Se l'ottimizzazione della traiettoria segnala un percorso non fattibile, la pianificazione del comportamento deve selezionare un'altra opzione anziché imporre un comando. Il ciclo completo è il seguente:

  1. La percezione e la previsione aggiornano un modello probabilistico del mondo.

  2. La pianificazione del comportamento genera e assegna priorità alle possibili manovre.

  3. La pianificazione del percorso e della traiettoria verifica la fattibilità geometrica e dinamica.

  4. Il controllo predittivo basato su modello (MPC) calcola sterzo, propulsione e frenata, restituendo i limiti di tracciamento.

  5. Un sistema di supervisione indipendente della sicurezza verifica scadenze, validità, spazio libero e deviazioni.

Un ciclo di comportamento a 10 Hz non è valido se le tracce degli oggetti hanno già 300 ms. È necessario mantenere i timestamp di acquisizione e la data di scadenza lungo l'intera pipeline. Trasformazioni temporali non corrispondenti, risposte da richieste precedenti e traiettorie obsolete non annullate sono comuni errori di integrazione.

7. Cosa mostrano concretamente gli attuali esempi di ADAS e guida automatizzata

Subaru descrive EyeSight come una tecnologia di assistenza alla guida incentrata sulla percezione tramite telecamera stereoscopica, a supporto di funzioni quali l'assistenza alla prevenzione delle collisioni e il mantenimento della distanza di sicurezza. Le descrizioni pubbliche delle funzionalità non rivelano se un'implementazione interna utilizzi una macchina a stati finiti (FSM), un automa a stati finiti (BT) o componenti decisionali appresi. Il manuale d'uso, e non il nome del prodotto, definisce le condizioni meteorologiche, la visibilità, la velocità, le condizioni stradali e gli obblighi del conducente.

I sistemi di assistenza alla guida di livello 2 SAE possono controllare simultaneamente sterzo e velocità, mentre il conducente monitora costantemente la strada. La NHTSA distingue esplicitamente i sistemi ADAS di livello 2, che assistono un conducente umano impegnato, dai sistemi ADS di livello 3-5. In una funzione limitata di livello 3, come Mercedes-Benz DRIVE PILOT, il sistema esegue il compito di guida mentre il conducente è impegnato e può richiedere il ripristino del controllo al raggiungimento dei suoi limiti. Mercedes-Benz ha annunciato l'omologazione tedesca fino a 95 km/h in condizioni specifiche per l'aggiornamento del 2025; tale affermazione non deve essere generalizzata a strade, condizioni meteorologiche, veicoli o giurisdizioni diverse.

Un servizio di guida autonoma geograficamente limitato come Waymo combina la pianificazione del comportamento con sensori ridondanti, mappe, gestione della flotta, assistenza remota, gestione ODD e un'analisi di sicurezza. Waymo pubblica confronti sui tassi di incidenti e dati scaricabili, ma questi risultati non sono una prova di prestazioni universali. I lettori devono esaminare le città operative, l'esposizione stradale, i criteri di segnalazione, la costruzione del benchmark, il chilometraggio e gli intervalli di confidenza.

8. La sicurezza implica la limitazione dell'intelligenza

Anche un'azione candidata a con elevata utilità deve essere scartata quando viola un vincolo di sicurezza C_j:

a^*=\arg\max_{a\in A_{safe}} U(a),\qquad A_{safe}=\{a\in A\mid C_j(a)\le0,\ \forall j\}

Se A_{safe} è vuoto, il sistema deve rilevare un errore di pianificazione ed attivare una strategia a rischio minimo. I vincoli possono riguardare il margine di collisione, lo spazio di arresto garantito, l'uscita di strada, la stabilità del veicolo, la segnaletica, la precedenza e i limiti degli attuatori. I manuali aiutano a definire le priorità quando progresso, cortesia, legge e sicurezza non possono essere ottimizzati come un unico parametro opaco.

La norma ISO 26262 affronta i pericoli causati da malfunzionamenti elettrici/elettronici. La norma ISO 21448, SOTIF, affronta il rischio irragionevole derivante da insufficienze funzionali o di specifica, anche in assenza di un guasto a un componente, ad esempio una limitazione della percezione in caso di nebbia o un gesto di un operaio edile frainteso. La sicurezza informatica rappresenta un'ulteriore dimensione: una mappa falsificata o un input V2X fuorviante possono condurre un pianificatore senza errori verso il pericolo. Come spiegato nel V2X Primer, una firma valida autentica l'origine e l'integrità, non la veridicità fisica di un messaggio.

Un supervisore della sicurezza indipendente dovrebbe evitare di condividere ogni ipotesi e modalità di guasto con il pianificatore principale. Può monitorare il tempo di collisione, lo spazio percorribile, la velocità, l'errore di tracciamento, la scadenza di calcolo e lo stato di salute dei sensori, quindi sovrascrivere il comportamento normale. I percorsi di fallback e di emergenza richiedono una nuova validazione ogni volta che il pianificatore normale cambia.

9. La valutazione richiede più di un semplice tasso di successo

  • Sicurezza: collisioni, TTC minimo, tempo di reazione, margine di arresto, manovre evasive gravi.

  • Regole e interazione sociale: segnali, linee di arresto, priorità, precedenza, aggressività e eccessiva prudenza.

  • Comfort: accelerazione, accelerazione laterale, velocità di imbardata e jerk j=da/dt.

  • Avanzamento: tasso di arrivo, tempo di percorrenza, stallo, fermate non necessarie e ripianificazioni.

  • Robustezza: degrado in caso di pioggia, abbagliamento, occlusione, cambio di mappa, latenza e perdita di segnale del sensore.

  • Tracciabilità: azioni selezionate riproducibili, alternative scartate, età dell'input, versione della regola/modello e margine di sicurezza.

Non includere eventi rari in una media. Anche una semplice stima del limite superiore che considera la probabilità di guasto p come prove di Bernoulli indipendenti non permette di concludere che zero guasti osservati p=0. Definisci in anticipo il livello di confidenza e l'esposizione richiesti e adatta la difficoltà dello scenario alla reale distribuzione di guida. I percorsi su strade pubbliche offrono un'esposizione realistica, ma campionano in modo inefficiente le combinazioni pericolose rare; pertanto, è consigliabile combinarli con simulazioni, percorsi chiusi e replay dei log.

10. Un flusso di lavoro sperimentale

  1. Definire ODD e responsabilità. Registrare la classe stradale, la velocità, le condizioni meteorologiche, l'illuminazione, la mappatura, la connettività, il ruolo del conducente e il limite di responsabilità di livello 0-5. Assegnare DDT, rilevamento e risposta di oggetti ed eventi e fallback utilizzando il SAE Automation Levels Primer.

  2. Definire il vocabolario comportamentale. Fornire condizioni esplicite di ingresso, completamento, interruzione e timeout per stop, seguire, dare la precedenza, immettersi, cambiare corsia e accostare.

  3. Bloccare le interfacce. Versionare frame, timestamp, covarianza, modalità di previsione, ID di traiettoria, conferme di annullamento e scadenze di calcolo.

  4. Esaminare la struttura decisionale. Individuare stati irraggiungibili, cicli, inversioni di priorità, condizioni di guardia simultaneamente vere e percorsi che non possono raggiungere una condizione di rischio minimo.

  5. Verificare gli invarianti. Verificare le proprietà di affermazioni come "non oltrepassare una linea di arresto rossa raggiungibile" e "non accelerare dopo che la percezione è scaduta".

  6. Riprodurre i log. Mantenere costante l'output di percezione e confrontare le versioni del pianificatore. La guida umana è una prova utile, ma non rappresenta l'unica verità assoluta.

  7. Esplorare i limiti degli scenari. Variare velocità relativa, occlusione, attrito, illuminazione e latenza su entrambi i lati delle soglie di transizione; utilizzare test metamorfici per individuare inversioni irrazionali.

  8. Iniettare guasti. Disattivare le telecamere, scambiare gli ID delle tracce, saltare il GNSS, spostare le mappe, falsificare i dati V2X, mandare in timeout l'MPC e limitare gli attuatori; verificare il degrado.

  9. Implementazione a fasi. Passare dalla simulazione all'hardware-in-the-loop, al circuito chiuso, al funzionamento con guida sicura e al servizio limitato con criteri di arresto espliciti.

  10. Confrontare la simulazione controfattuale e la riproduzione fisica. Quando la simulazione stima cosa accadrebbe senza un intervento, evidenziare l'errore del modello e riprodurre casi rappresentativi su un circuito chiuso.

  11. Tracciare le modifiche. Un aggiornamento del modello di percezione modifica la distribuzione del comportamento. Collegare requisiti, progettazione, codice, test e dichiarazione di sicurezza, quindi scegliere l'ambito di regressione dal grafico delle dipendenze effettivo.

Il log finale dovrebbe contenere più di un semplice "cambio di corsia selezionato". Collegare gli oggetti con timestamp, le modalità di credenza o previsione, le azioni candidate, i costi, i margini di sicurezza, i motivi di rifiuto, il comportamento selezionato, la fattibilità a valle, il comando effettivo e l'errore di tracciamento sotto un unico ID di traccia. Altrimenti, una decisione presa una tantum sul campo non può essere ricostruita.

Un utile paradosso: la guida sicura a volte deve progredire

Un pianificatore ingenuo può evitare una collisione in uno screenshot aspettando all'infinito a un incrocio. Nel traffico, un'eccessiva esitazione blocca gli altri, viola le aspettative e può provocare sorpassi pericolosi. L'errore opposto è interpretare la leggera decelerazione di un altro veicolo come un impegno vincolante a dare la precedenza.

La pianificazione del comportamento è complessa perché gli altri utenti della strada prevedono e reagiscono al veicolo in questione. Avanzare lentamente modifica la loro previsione; la loro reazione modifica la convinzione del veicolo. Questo feedback spiega l'evoluzione della ricerca, dalle affermazioni ipotetiche ai POMDP (Processi di Manodopera a Fase Operativa), alla teoria dei giochi e alle politiche apprese. Un sistema di produzione deve comunque tradurre questa sofisticatezza in affermazioni verificabili: perché ha proseguito, quale osservazione lo avrebbe indotto a fermarsi e qual era il margine di sicurezza rimanente?

Fonti primarie e correlate

Verifica la tua comprensione

La decisione di sorpasso deve essere eseguita immediatamente?

Verifica le previsioni e la fattibilità della traiettoria. Il livello comportamentale deve gestire gli errori di esecuzione e tornare a uno stato di attesa quando necessario.

Related reading

Explore another aspect of this fieldMappatura della griglia di occupazione: trasformare i dati LiDAR e delle telecamere in informazioni di percorribilità.Explore another aspect of this fieldLivelli di automazione della guida SAE 0-5: il confine di responsabilità dietro i sistemi ADAS