Contents — find the section you need
L'apprendimento per rinforzo (RL) è un metodo che permette a un robot di apprendere quale azione sia più vantaggiosa nel lungo periodo, interagendo con l'ambiente circostante. A differenza della classificazione delle immagini, in cui un input e un'etichetta arrivano contemporaneamente, il robot osserva il mondo, muove un motore e riceve una ricompensa, spesso diversi secondi dopo. Il ciclo essenziale è: prova, osserva il risultato e aggiorna la politica.
Riepilogo in 30 secondi
-
La transizione RL più semplice è, al tempo t, lo stato (o osservazione) s_t, l'azione a_t, la ricompensa r_{t+1} e lo stato successivo s_{t+1}.
-
Un processo decisionale di Markov (MDP) modella come lo stato e l'azione attuali producono uno stato e una ricompensa successivi. Lo stato deve riassumere la storia in modo sufficientemente preciso per consentire la previsione.
-
Una politica \pi(a\mid s) sceglie le azioni; La funzione di valore V^\pi(s) rappresenta il rendimento futuro atteso quando tale politica viene seguita.
Il rendimento attualizza le ricompense future con \gamma. Un orizzonte temporale troppo lungo può destabilizzare l'apprendimento, mentre un orizzonte troppo breve produce un robot miope e insicuro.
L'esplorazione tenta azioni incerte; lo sfruttamento sceglie l'azione che al momento si ritiene essere la migliore. A livello hardware, i vincoli di sicurezza hanno la precedenza su entrambi.
1. Considera il robot come un agente
Figura 1 — Dopo l'azione di un agente, l'ambiente cambia e restituisce l'osservazione e la ricompensa successive. Un robot reale aggiunge a questo ciclo il ritardo di comunicazione, il rumore dei sensori e la saturazione degli attuatori.
Per un robot a trazione differenziale, l'agente può utilizzare i dati della telecamera, del LiDAR e dell'encoder come stato e inviare le velocità delle ruote sinistra e destra come azioni. L'ambiente include la dinamica del veicolo, l'attrito del pavimento, gli ostacoli e lo stato della batteria. Muoversi verso un obiettivo può generare una ricompensa positiva, mentre una collisione o un brusco cambio di sterzata possono essere penalizzati. Un singolo segnale "+1 all'obiettivo" è solitamente troppo sparso; distanza, velocità, margine di arresto ed energia devono essere considerati insieme.
2. MDP: scomposizione del problema in componenti
Un MDP è definito da uno spazio degli stati \mathcal{S}, uno spazio delle azioni \mathcal{A}, una probabilità di transizione P(s'\mid s,a), una funzione di ricompensa R(s,a,s') e un fattore di sconto \gamma:
Quando l'agente sceglie l'azione a_t nello stato s_t, l'ambiente passa allo stato successivo s_{t+1} secondo P e restituisce la ricompensa r_{t+1}=R(s_t,a_t,s_{t+1}).
"Markov" significa che, una volta noto lo stato corrente, il passato non aggiunge più informazioni necessarie per prevedere il futuro. Un robot mobile il cui stato contiene solo la posizione non può distinguere un robot fermo da uno che sta scorrendo nella stessa posizione. È necessario includere velocità, velocità angolare e affidabilità del sensore, oppure utilizzare un modello ricorrente che conservi la cronologia.
Quando lo stato completo s_t non può essere osservato direttamente, il problema è un MDP parzialmente osservabile (POMDP). Quasi tutti i robot reali sono POMDP a causa di occlusioni e segnali LiDAR mancanti. Uno stimatore di stato, come un filtro di Kalman esteso (EKF), un grafo fattoriale o un modello appreso, trasforma le osservazioni o_t in uno stato interno utile. L'articolo sulla fusione dei sensori spiega questo limite, e la guida introduttiva a ROS 2 mostra come realizzarlo come componente software riproducibile.
- Funzioni di valore e rendimento
La somma scontata dei premi dall'istante t è il rendimento G_t:
Il valore dello stato s sotto la politica \pi è:
e il valore stato-azione specifica anche la prima azione:
La selezione del valore Q più grande è un approccio di progettazione basato sul valore. L'aggiornamento diretto dei parametri \theta di una politica neurale \pi_\theta(a\mid s) è un approccio basato sulla politica. Gli angoli di sterzata e le coppie articolari continui spesso favoriscono i metodi basati sul gradiente di politica o sull'attore-critico, poiché enumerare ogni possibile azione è impossibile.
4. L'equazione di Bellman suddivide un orizzonte temporale lungo in un unico passaggio
Invece di valutare un intero futuro in una volta sola, lo si suddivide nella ricompensa immediata più il valore che si otterrà un passo dopo. L'equazione di Bellman per l'aspettativa è:
Il valore ottimale V^*(s) obbedisce all'equazione di ottimalità di Bellman:
Questo è il motivo per cui un valore target può essere generato da altre stime anziché da un'etichetta fornita dall'uomo. L'autoreferenzialità è anche una fonte di instabilità. Le reti target, la riproduzione dell'esperienza e la normalizzazione della ricompensa separano le vecchie stime dall'aggiornamento corrente e riducono le correlazioni dannose.
5. Bilanciare esplorazione e sfruttamento
Scegliere sempre l'azione con la stima più alta corrente può intrappolare l'agente in una fortunata soluzione locale. L'esplorazione tenta azioni sconosciute, ma il movimento casuale su una macchina reale può causare una collisione. Le scelte comuni sono:
| Metodo | Intuizione | Forza | Problematica hardware |
|---|---|---|---|
| ε-greedy | sceglie casualmente con probabilità ε | semplice | i cambiamenti bruschi sono pericolosi per la coppia continua |
| Boltzmann/softmax | campiona in proporzione al valore | privilegia le opzioni promettenti | la temperatura necessita di regolazione |
| UCB | prova le azioni con elevata incertezza | logica di esplorazione esplicita | necessita di stime di incertezza |
| Politica rumorosa | aggiunge rumore continuo alle azioni o ai pesi | esplorazione più fluida | necessita ancora di saturazione e limiti |
Su hardware, limita l'esplorazione a un inviluppo operativo validato. Imposta limiti di velocità, limiti flessibili per le giunzioni, limiti di forza/corrente, un watchdog e un arresto di emergenza al di fuori del sistema di apprendimento, in modo che ogni output della politica possa essere intercettato. La randomizzazione in un simulatore è utile; non è un'autorizzazione ad applicare comandi casuali a una macchina.
6. Verifica l'idea in un piccolo ambiente a griglia
Una griglia 5×5 rende visibili le dinamiche di apprendimento. Consideriamo una cella come lo stato, su/giù/sinistra/destra come le azioni, la ricompensa obiettivo come +1, un muro come -0,1 e ogni passo come -0,01. Inizializziamo Q a zero e ripetiamo l'aggiornamento della differenza temporale:
Il termine tra parentesi quadre rappresenta l'errore TD: la differenza tra la previsione e l'obiettivo a un passo. Se \alpha è troppo grande, le nuove esperienze prevalgono; se è troppo piccolo, la politica non riesce a seguire un ambiente in continua evoluzione. Registriamo il tasso di successo, il numero medio di passi, il tasso di collisione e la frazione di stati non visitati, non solo una singola curva di ricompensa.
7. Scrivi la ricompensa come una specifica
La progettazione della ricompensa spesso è più importante di un dettaglio algoritmico. Un robot per le consegne potrebbe utilizzare
per combinare progresso, collisioni, energia in ingresso e fluidità. Aumentare il peso di un w non sempre migliora il comportamento. Se la penalità di collisione è dominante, il robot potrebbe apprendere la politica sicura ma inutile di non muoversi mai. Registrare ogni termine separatamente e verificare quale termine la politica sta effettivamente ottimizzando.
L'hacking delle ricompense è un'altra modalità di errore: un bug nel rilevatore di obiettivi, un punto cieco del sensore o una regola di contatto valida solo per il simulatore possono produrre un punteggio elevato senza raggiungere il compito previsto. Obiettivi comprensibili all'uomo, vincoli basati sulla fisica e un ambiente di valutazione indipendente rendono più facile individuare queste scorciatoie.
8. Dove la ricerca incontra il prodotto
I metodi basati sul valore sono efficienti in termini di dati, ma spesso presuppongono stati e azioni discreti. I gradienti di policy e i metodi Actor-Critic gestiscono il controllo continuo; SAC aggiunge un obiettivo di entropia, mentre l'apprendimento per rinforzo basato su modelli pianifica con un modello dinamico appreso o analitico prima di muovere il robot. I metodi basati su modelli possono ridurre i campioni del mondo reale, ma devono tollerare gli errori del modello.
In produzione, l'apprendimento per rinforzo non viene necessariamente applicato a ogni livello, dal monitoraggio della sicurezza alla corrente del motore. Un PID o un MPC classico possono fornire l'inviluppo di sicurezza mentre l'apprendimento per rinforzo (RL) seleziona un contatto di presa, una preferenza di percorso o una pianificazione del guadagno. La panoramica VLA descrive un confine simile: un modello di linguaggio visivo può proporre blocchi di azioni mentre un controllore di basso livello verificato limita coppia e velocità.
9. Prima di passare all'hardware
-
Lo stato include velocità, ritardo e affidabilità del sensore, o l'ipotesi di Markov è stata implicitamente violata?
-
I termini di ricompensa vengono registrati separatamente, con tasso di collisione, energia, fluidità dell'input e distanza di arresto, oltre al tasso di successo?
-
I range di azione, i limiti di velocità, i watchdog e gli arresti di emergenza sono indipendenti dall'algoritmo di apprendimento?
-
L'attrito, la massa, il ritardo del sensore, l'illuminazione e la perdita di pacchetti sono stati randomizzati nella simulazione e il gap di distribuzione è stato misurato su log reali?
Un set di valutazione non visto viene mantenuto separato dai dati di addestramento? I fallimenti vengono inclusi anziché filtrati?
- Il riavvio di un processo porta a uno stato sicuro ed evita la ripetizione di un comando precedente?
Riepilogo
L'apprendimento per rinforzo non fa sì che un robot memorizzi un "movimento corretto". Definisce stati, azioni, transizioni e ricompense come un MDP (Model Decision Process), quindi stima il valore a lungo termine un passo alla volta con le equazioni di Bellman. Esplorazione, manipolazione delle ricompense e sicurezza hardware devono essere parte della progettazione del sistema prima che una politica appresa possa uscire dalla simulazione. I prossimi articoli di questa serie confronteranno Q-learning/DQN, gradienti di policy, PPO e SAC, apprendimento per imitazione e Sim-to-Real nello stesso quadro di riferimento.
L'azione con la ricompensa immediata più alta è sempre la migliore?
Ricompense e transizioni future possono cambiare la risposta.
Distinguere la ricompensa immediata dal rendimento scontato.Riferimenti
- Richard S. Sutton e Andrew G. Barto, Reinforcement Learning: An Introduction (2a ed.)
- OpenAI Spinning Up — Concetti chiave nell'apprendimento per rinforzo
- David Silver, Corso di apprendimento per rinforzo
- Documentazione ufficiale di ROS 2
- Robotics: Science and Systems — documenti di ricerca pubblici
Commenti
Accedi per continuare.
Nessun dato disponibile.