Contents — find the section you need

L'apprendimento per rinforzo (RL) è un metodo che permette a un robot di apprendere quale azione sia più vantaggiosa nel lungo periodo, interagendo con l'ambiente circostante. A differenza della classificazione delle immagini, in cui un input e un'etichetta arrivano contemporaneamente, il robot osserva il mondo, muove un motore e riceve una ricompensa, spesso diversi secondi dopo. Il ciclo essenziale è: prova, osserva il risultato e aggiorna la politica.

Riepilogo in 30 secondi

  • La transizione RL più semplice è, al tempo t, lo stato (o osservazione) s_t, l'azione a_t, la ricompensa r_{t+1} e lo stato successivo s_{t+1}.

  • Un processo decisionale di Markov (MDP) modella come lo stato e l'azione attuali producono uno stato e una ricompensa successivi. Lo stato deve riassumere la storia in modo sufficientemente preciso per consentire la previsione.

  • Una politica \pi(a\mid s) sceglie le azioni; La funzione di valore V^\pi(s) rappresenta il rendimento futuro atteso quando tale politica viene seguita.

Il rendimento attualizza le ricompense future con \gamma. Un orizzonte temporale troppo lungo può destabilizzare l'apprendimento, mentre un orizzonte troppo breve produce un robot miope e insicuro.

L'esplorazione tenta azioni incerte; lo sfruttamento sceglie l'azione che al momento si ritiene essere la migliore. A livello hardware, i vincoli di sicurezza hanno la precedenza su entrambi.

1. Considera il robot come un agente

Diagram 1 · Use the button to switch views
Observation, action, and reward loop in reinforcement learning An agent selects an action from an observation and the environment returns the next observation and a reward Agentcomputes π(a|s) Environmentphysics, simulator, or people action aₜ observation oₜ₊₁ and reward rₜ₊₁ state sₜ is an internal summary of the observation history

Figura 1 — Dopo l'azione di un agente, l'ambiente cambia e restituisce l'osservazione e la ricompensa successive. Un robot reale aggiunge a questo ciclo il ritardo di comunicazione, il rumore dei sensori e la saturazione degli attuatori.

Per un robot a trazione differenziale, l'agente può utilizzare i dati della telecamera, del LiDAR e dell'encoder come stato e inviare le velocità delle ruote sinistra e destra come azioni. L'ambiente include la dinamica del veicolo, l'attrito del pavimento, gli ostacoli e lo stato della batteria. Muoversi verso un obiettivo può generare una ricompensa positiva, mentre una collisione o un brusco cambio di sterzata possono essere penalizzati. Un singolo segnale "+1 all'obiettivo" è solitamente troppo sparso; distanza, velocità, margine di arresto ed energia devono essere considerati insieme.

2. MDP: scomposizione del problema in componenti

Un MDP è definito da uno spazio degli stati \mathcal{S}, uno spazio delle azioni \mathcal{A}, una probabilità di transizione P(s'\mid s,a), una funzione di ricompensa R(s,a,s') e un fattore di sconto \gamma:

\mathcal{M}=(\mathcal{S},\mathcal{A},P,R,\gamma),\qquad 0\le\gamma<1

Quando l'agente sceglie l'azione a_t nello stato s_t, l'ambiente passa allo stato successivo s_{t+1} secondo P e restituisce la ricompensa r_{t+1}=R(s_t,a_t,s_{t+1}).

"Markov" significa che, una volta noto lo stato corrente, il passato non aggiunge più informazioni necessarie per prevedere il futuro. Un robot mobile il cui stato contiene solo la posizione non può distinguere un robot fermo da uno che sta scorrendo nella stessa posizione. È necessario includere velocità, velocità angolare e affidabilità del sensore, oppure utilizzare un modello ricorrente che conservi la cronologia.

Quando lo stato completo s_t non può essere osservato direttamente, il problema è un MDP parzialmente osservabile (POMDP). Quasi tutti i robot reali sono POMDP a causa di occlusioni e segnali LiDAR mancanti. Uno stimatore di stato, come un filtro di Kalman esteso (EKF), un grafo fattoriale o un modello appreso, trasforma le osservazioni o_t in uno stato interno utile. L'articolo sulla fusione dei sensori spiega questo limite, e la guida introduttiva a ROS 2 mostra come realizzarlo come componente software riproducibile.

  1. Funzioni di valore e rendimento

La somma scontata dei premi dall'istante t è il rendimento G_t:

G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots

Il valore dello stato s sotto la politica \pi è:

V^\pi(s)=\mathbb{E}_\pi[G_t\mid s_t=s]

e il valore stato-azione specifica anche la prima azione:

Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid s_t=s,a_t=a]

La selezione del valore Q più grande è un approccio di progettazione basato sul valore. L'aggiornamento diretto dei parametri \theta di una politica neurale \pi_\theta(a\mid s) è un approccio basato sulla politica. Gli angoli di sterzata e le coppie articolari continui spesso favoriscono i metodi basati sul gradiente di politica o sull'attore-critico, poiché enumerare ogni possibile azione è impossibile.

4. L'equazione di Bellman suddivide un orizzonte temporale lungo in un unico passaggio

Invece di valutare un intero futuro in una volta sola, lo si suddivide nella ricompensa immediata più il valore che si otterrà un passo dopo. L'equazione di Bellman per l'aspettativa è:

V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^\pi(s')\right]

Il valore ottimale V^*(s) obbedisce all'equazione di ottimalità di Bellman:

V^*(s)=\max_a\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^*(s')\right]

Questo è il motivo per cui un valore target può essere generato da altre stime anziché da un'etichetta fornita dall'uomo. L'autoreferenzialità è anche una fonte di instabilità. Le reti target, la riproduzione dell'esperienza e la normalizzazione della ricompensa separano le vecchie stime dall'aggiornamento corrente e riducono le correlazioni dannose.

5. Bilanciare esplorazione e sfruttamento

Scegliere sempre l'azione con la stima più alta corrente può intrappolare l'agente in una fortunata soluzione locale. L'esplorazione tenta azioni sconosciute, ma il movimento casuale su una macchina reale può causare una collisione. Le scelte comuni sono:

Metodo Intuizione Forza Problematica hardware
ε-greedy sceglie casualmente con probabilità ε semplice i cambiamenti bruschi sono pericolosi per la coppia continua
Boltzmann/softmax campiona in proporzione al valore privilegia le opzioni promettenti la temperatura necessita di regolazione
UCB prova le azioni con elevata incertezza logica di esplorazione esplicita necessita di stime di incertezza
Politica rumorosa aggiunge rumore continuo alle azioni o ai pesi esplorazione più fluida necessita ancora di saturazione e limiti

Su hardware, limita l'esplorazione a un inviluppo operativo validato. Imposta limiti di velocità, limiti flessibili per le giunzioni, limiti di forza/corrente, un watchdog e un arresto di emergenza al di fuori del sistema di apprendimento, in modo che ogni output della politica possa essere intercettato. La randomizzazione in un simulatore è utile; non è un'autorizzazione ad applicare comandi casuali a una macchina.

6. Verifica l'idea in un piccolo ambiente a griglia

Una griglia 5×5 rende visibili le dinamiche di apprendimento. Consideriamo una cella come lo stato, su/giù/sinistra/destra come le azioni, la ricompensa obiettivo come +1, un muro come -0,1 e ogni passo come -0,01. Inizializziamo Q a zero e ripetiamo l'aggiornamento della differenza temporale:

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

Il termine tra parentesi quadre rappresenta l'errore TD: la differenza tra la previsione e l'obiettivo a un passo. Se \alpha è troppo grande, le nuove esperienze prevalgono; se è troppo piccolo, la politica non riesce a seguire un ambiente in continua evoluzione. Registriamo il tasso di successo, il numero medio di passi, il tasso di collisione e la frazione di stati non visitati, non solo una singola curva di ricompensa.

7. Scrivi la ricompensa come una specifica

La progettazione della ricompensa spesso è più importante di un dettaglio algoritmico. Un robot per le consegne potrebbe utilizzare

r=w_d\,\Delta d-w_c\,\mathbf{1}_{\mathrm{collision}}-w_u\,|u|^2-w_j\,\|\Delta u\|^2

per combinare progresso, collisioni, energia in ingresso e fluidità. Aumentare il peso di un w non sempre migliora il comportamento. Se la penalità di collisione è dominante, il robot potrebbe apprendere la politica sicura ma inutile di non muoversi mai. Registrare ogni termine separatamente e verificare quale termine la politica sta effettivamente ottimizzando.

L'hacking delle ricompense è un'altra modalità di errore: un bug nel rilevatore di obiettivi, un punto cieco del sensore o una regola di contatto valida solo per il simulatore possono produrre un punteggio elevato senza raggiungere il compito previsto. Obiettivi comprensibili all'uomo, vincoli basati sulla fisica e un ambiente di valutazione indipendente rendono più facile individuare queste scorciatoie.

8. Dove la ricerca incontra il prodotto

I metodi basati sul valore sono efficienti in termini di dati, ma spesso presuppongono stati e azioni discreti. I gradienti di policy e i metodi Actor-Critic gestiscono il controllo continuo; SAC aggiunge un obiettivo di entropia, mentre l'apprendimento per rinforzo basato su modelli pianifica con un modello dinamico appreso o analitico prima di muovere il robot. I metodi basati su modelli possono ridurre i campioni del mondo reale, ma devono tollerare gli errori del modello.

In produzione, l'apprendimento per rinforzo non viene necessariamente applicato a ogni livello, dal monitoraggio della sicurezza alla corrente del motore. Un PID o un MPC classico possono fornire l'inviluppo di sicurezza mentre l'apprendimento per rinforzo (RL) seleziona un contatto di presa, una preferenza di percorso o una pianificazione del guadagno. La panoramica VLA descrive un confine simile: un modello di linguaggio visivo può proporre blocchi di azioni mentre un controllore di basso livello verificato limita coppia e velocità.

9. Prima di passare all'hardware

  • Lo stato include velocità, ritardo e affidabilità del sensore, o l'ipotesi di Markov è stata implicitamente violata?

  • I termini di ricompensa vengono registrati separatamente, con tasso di collisione, energia, fluidità dell'input e distanza di arresto, oltre al tasso di successo?

  • I range di azione, i limiti di velocità, i watchdog e gli arresti di emergenza sono indipendenti dall'algoritmo di apprendimento?

  • L'attrito, la massa, il ritardo del sensore, l'illuminazione e la perdita di pacchetti sono stati randomizzati nella simulazione e il gap di distribuzione è stato misurato su log reali?

Un set di valutazione non visto viene mantenuto separato dai dati di addestramento? I fallimenti vengono inclusi anziché filtrati?

  • Il riavvio di un processo porta a uno stato sicuro ed evita la ripetizione di un comando precedente?

Riepilogo

L'apprendimento per rinforzo non fa sì che un robot memorizzi un "movimento corretto". Definisce stati, azioni, transizioni e ricompense come un MDP (Model Decision Process), quindi stima il valore a lungo termine un passo alla volta con le equazioni di Bellman. Esplorazione, manipolazione delle ricompense e sicurezza hardware devono essere parte della progettazione del sistema prima che una politica appresa possa uscire dalla simulazione. I prossimi articoli di questa serie confronteranno Q-learning/DQN, gradienti di policy, PPO e SAC, apprendimento per imitazione e Sim-to-Real nello stesso quadro di riferimento.

Verifica la tua comprensione
L'azione con la ricompensa immediata più alta è sempre la migliore?

Ricompense e transizioni future possono cambiare la risposta.

Distinguere la ricompensa immediata dal rendimento scontato.

Riferimenti

What to read next

Continue the seriesQ-Learning e DQN: dalla tabella Q all'apprendimento per rinforzo profondo.Explore another aspect of this fieldIntroduzione all'apprendimento per rinforzo multi-agente: ottimizzazione in un mondo in cui anche l'altra parte sta imparando.Explore another aspect of this fieldπ0 spiegato: come la corrispondenza del flusso ha cambiato la generazione delle azioni VLA