Contents — find the section you need

Insegnare a un robot a posizionare una tazza in sicurezza, a evitare una persona in un corridoio stretto o a utilizzare uno strumento complesso è spesso più difficile di quanto sembri, perché la ricompensa è difficile da specificare. Premiare la distanza da un obiettivo potrebbe incoraggiare a spostare gli oggetti; premiare solo il successo finale potrebbe non fornire alcun segnale utile all'esplorazione. L'apprendimento per imitazione utilizza dimostrazioni di persone, teleoperatori o una politica esistente per apprendere azioni dalle osservazioni. L'apprendimento per rinforzo inverso (IRL), invece, cerca di inferire l'obiettivo – o la ricompensa – che rende sensato il comportamento dimostrato, per poi derivare una politica per quell'obiettivo.

Nessuno dei due metodi diventa sicuro solo perché utilizza dati umani. Le domande centrali sono cosa fa una politica in stati assenti dalle dimostrazioni, come vengono temporizzate e attribuite le etichette, come vengono raccolti i fallimenti e cosa limita in modo indipendente un'azione fisica. Questo articolo collega la clonazione del comportamento (BC), il covariate shift, DAgger, IRL, i modelli Vision-Language-Action, la valutazione, la sicurezza e la provenienza dei dati. Per i concetti correlati, consultare Nozioni di base sull'apprendimento per rinforzo, PPO e SAC e Introduzione a VLA.

Conclusione pratica

  • BC è un apprendimento supervisionato che parte dallo stato dimostrato s per arrivare all'azione dell'esperto a. È veloce all'avvio, ma un piccolo errore iniziale può spostare la policy in una distribuzione di stati mai vista prima.

  • DAgger esegue la policy corrente in un ambiente controllato, chiede a un esperto l'azione da eseguire negli stati effettivamente visitati dalla policy, aggrega le etichette e riaddestra il modello. Trasforma le modalità di errore in dati, ma richiede un'esecuzione sicura e un intervento affidabile da parte dell'esperto.

  • IRL stima una ricompensa r_\theta(s,a) dalle dimostrazioni e quindi ottimizza una politica di conseguenza. La ricompensa non è identificata in modo univoco; valutarla in base al comportamento in condizioni di test e vincoli di sicurezza espliciti, non in base a una mappa di calore dall'aspetto plausibile.

  • Un VLA può essere una politica di imitazione condizionale di grandi dimensioni, ma il linguaggio e la scala dell'immagine non eliminano i limiti fisici, la temporizzazione, la sicurezza del contatto o un percorso di arresto sicuro.

Le dimostrazioni sono registrazioni operative, non semplici video

Una dimostrazione utilizzabile combina osservazioni (immagini, profondità, forza, stato delle articolazioni), azioni (comando delle articolazioni, velocità, pinza, arresto), timestamp, fotogrammi, istruzioni per il compito, successo/fallimento, operatore, condizioni ambientali ed eventi di intervento. Se il comando registrato è quello che è arrivato al robot dopo un ritardo di trasporto anziché quello previsto dall'operatore, il ritardo deve essere incluso nel dataset. Uno scostamento di 100 ms tra immagine e braccio trasforma il comportamento corretto in coppie di addestramento incoerenti.

La provenienza dei dati include il consenso del raccoglitore, l'autorizzazione per l'ambiente di registrazione, la privacy, le opere di terzi, la responsabilità per la sicurezza del robot e la possibilità di risalire all'origine di un campione. L'utilizzo di un dataset pubblico richiede la verifica della licenza, dei termini di utilizzo commerciale, della ridistribuzione, delle persone e dell'audio, nonché della calibrazione per l'uso previsto. "Trovato su Internet" non è sinonimo di provenienza; è l'assenza di consenso e termini di utilizzo tracciabili.

Diagram 1 · Use the button to switch views
Impara dalle dimostrazioni

Diagramma: Duskcoil, concettuale. Un'implementazione rappresenta una raccolta dati reale; il diagramma non implica che il monitoraggio della sicurezza, la logica di arresto o l'intervento dell'operatore possano essere omessi.

Clonazione del comportamento e spostamento delle covariate

Date le coppie di esperti D=\{(s_i,a_i^*)\}_{i=1}^N, la clonazione del comportamento ad azione continua può minimizzare

\min_\theta\;\mathcal L_{BC}(\theta)=\frac1N\sum_{i=1}^N\lVert\pi_\theta(s_i)-a_i^*\rVert_2^2

Le azioni discrete utilizzano l'entropia incrociata. Se più di un'azione è valida, una singola previsione dell'errore quadratico può mediare "passare a sinistra" e "passare a destra" in un'azione intermedia non sicura; distribuzioni condizionali, modelli di miscela o politiche di diffusione possono rappresentare più modalità. Il contesto, lo stile dell'operatore e le istruzioni del compito sono importanti.

La clonazione del comportamento è interessante perché può essere addestrata offline prima della progettazione o dell'esplorazione delle ricompense. Il suo punto debole principale è che le dimostrazioni provengono dalla distribuzione dello stato dell'esperto d_{\pi^*}(s) mentre l'implementazione produce d_{\pi_\theta}(s) . Piccoli errori modificano l'osservazione successiva e possono accumularsi. In analisi semplificate, un errore di un passo \epsilon può crescere fino all'ordine O(T^2\epsilon) su un orizzonte sequenziale T ; il limite esatto dipende dalle ipotesi, ma il punto causale è duraturo: una politica crea i propri input futuri.

DAgger: aggrega le etichette dove va l'apprendista

L'aggregazione del dataset esegue la politica appresa in condizioni controllate, richiede l'azione esperta desiderata a^* nello stato s effettivamente visitato, aggiunge la coppia a D e riaddestra. È possibile utilizzare combinazioni di politiche durante le iterazioni. Il metodo avvicina la distribuzione dell'addestramento alla distribuzione dell'implementazione.

DAgger non è un'autorizzazione incondizionata a lasciare che un robot fallisca in pubblico. Iniziare con la simulazione, bassa velocità, guardie fisiche, arresto di emergenza remoto, esperto immediato acquisizione e un filtro di sicurezza delle azioni. Le etichette possono essere azioni che l'esperto ha fisicamente eseguito o risposte controfattuali a "cosa sarebbe dovuto succedere qui?". Quest'ultimo può essere utile, ma aggiunge carico di lavoro per gli esperti, latenza e variabilità soggettiva. Pianifica la raccolta dati in base alle modalità di errore individuate, non solo in base al conteggio delle righe.

IRL: inferire l'obiettivo anziché copiare l'azione

IRL stima la ricompensa r_\theta(s,a) o r_\theta(s,a,s') dalla politica dell'esperto \pi_E. L'intuizione della massima entropia è che le traiettorie dell'esperto privilegiano una ricompensa elevata senza essere inutilmente deterministiche tra traiettorie altrettanto valide. Concettualmente, la probabilità della traiettoria \tau è

p_\theta(\tau)\propto\exp\left(\sum_t r_\theta(s_t,a_t)\right)

Aggiornare \theta per aumentare la probabilità della traiettoria dell'esperto produce una ricompensa che può essere abbinata a RL o al controllo ottimale. Questo può adattarsi meglio del controllo comportamentale diretto a nuovi stati iniziali o vincoli, perché l'obiettivo può essere riottimizzato.

Ma molte ricompense possono spiegare la stessa dimostrazioni; vincoli non osservati e abitudini dell'operatore possono essere assorbiti in una ricompensa appresa. Una ricompensa che spiega le traiettorie di addestramento può generalizzare pericolosamente. I metodi in stile GAIL, invece, abbinano le distribuzioni di occupazione di esperti e apprendisti tramite un discriminatore. Nessuna delle due formulazioni giustifica l'apprendimento di un divieto (collisione, forza di presa, zona di esclusione umana) solo per inferenza. Le regole di sicurezza esplicite rimangono esplicite.

Collegamento con VLA

Un modello Visione-Linguaggio-Azione condiziona l'azione successiva o un blocco di azioni su immagini, linguaggio e stato del robot. In senso lato, si tratta di imitazione condizionale su larga scala. La sua gamma di oggetti e linguaggio non garantisce l'estrapolazione a nuove condizioni di illuminazione, attrito, posizionamento della telecamera, istruzioni ambigue o limiti di forza di contatto. Un VLA che interpreta "metti la tazza sullo scaffale" non certifica di per sé forza, distanza di collisione, raggio d'azione delle articolazioni o distanza di arresto; vedi VLA Primer.

Convalidare il sistema di coordinate, le unità, la velocità, l'accelerazione e la validità prima Un'azione raggiunge un attuatore. Instradala attraverso la cinematica, il controllo delle collisioni e un controllore di impedenza o di posizione/velocità. Un linguaggio ambiguo dovrebbe attivare un chiarimento, un rifiuto o la modalità a bassa velocità; una percezione degradata dovrebbe interrompere l'esecuzione. La scala dei dati non sostituisce un limite di sicurezza fisico.

Valutazione, sicurezza e provenienza

Non approvare una policy basandoti solo su un errore di azione offline. Crea valutazioni di test su posizione iniziale, oggetti, illuminazione, sfondi, attrito, latenza, formulazione delle istruzioni e disturbi. Segnala successo, collisione, arresto, numero di interventi, forza di picco, tempo di completamento e casi peggiori osservati. Un'elevata percentuale di successo non assorbe i rari rischi umani o delle apparecchiature. Traccia ogni iterazione DAgger, dimostrazione sorgente, etichettatore, suddivisione, modello, soglie, errori e percorso di rollback.

Livello Verifica Risposta all'errore
Dati consenso, licenza, tempo, frame, provenienza successo/fallimento quarantena, rietichettatura, interruzione utilizzo
Policy stati di test, spostamento, incertezza dell'azione lento, interroga esperto, riepiloga

Attuazione | limiti, velocità, collisione, forza, comunicazione | filtro di sicurezza, arresto, arresto di emergenza |

Operazioni | supervisore, ripristino, registri, controllo delle modifiche | rollback e analisi delle cause principali |

Verifica la tua comprensione
L'imitazione recupera le motivazioni del dimostratore?

Riprodurre il comportamento e inferire la ricompensa sono compiti diversi. Ricompense multiple possono spiegare lo stesso comportamento, quindi esamina le ipotesi IRL.

Riferimenti

What to read next

Review the backgroundApprendimento per rinforzo basato su modelli e Sim-to-RealContinue the seriesπ0 spiegato: come la corrispondenza del flusso ha cambiato la generazione delle azioni VLAExplore another aspect of this fieldIntroduzione all'apprendimento per rinforzo multi-agente: ottimizzazione in un mondo in cui anche l'altra parte sta imparando.