Contents — find the section you need

In sintesi

L'apprendimento per rinforzo basato su modelli (MBRL) apprende un modello del mondo \hat f, che mappa lo stato e l'azione a uno stato successivo previsto, testa le sequenze di azioni al suo interno e applica all'hardware solo un'azione supervisionata. I metodi senza modello apprendono una politica direttamente dalla ricompensa; l'MBRL può essere più efficiente in termini di dati e può esprimere vincoli, ma un errore del modello può portare a un successo solo simulato. Vedi Nozioni di base sull'apprendimento per rinforzo, Q-learning, PPO/SAC e MPC.

Modelli mondiali e pianificazione

Diagram 1 · Use the button to switch views
observationsworld modelMPC/policysafety monitor

Figura 1 — SVG concettuale creato da Duskcoil, non dati di sistema misurati.

Apprendi \hat s_{t+1}=\hat f_\theta(s_t,a_t) e ottimizza un obiettivo a orizzonte mobile:

a_{t:t+H}^*=\arg\max\sum_{k=0}^{H-1}\gamma^k\hat r(\hat s_{t+k},a_{t+k})-\lambda C(\hat s,a)
Viene eseguita solo la prima azione, quindi il sistema viene osservato di nuovo. I vincoli C possono rappresentare limiti di collisione, giunzione, temperatura, velocità o corrente. Qui s è lo stato e a l'azione; il modello prevede lo stato successivo e \pi(a|s) può proporre azioni. La ricompensa appresa \hat r_\theta(s_t,a_t) viene valutata al tempo t su un orizzonte temporale H. Nell'esempio numerico seguente viene utilizzato un carrello con massa 1\,\mathrm{kg} e input u.

Simulazione-Realtà, identificazione e sicurezza

Gli errori a un passo si accumulano su lunghi rollout. Gli ensemble possono stimare l'incertezza; i pianificatori possono evitare regioni ad alta varianza e utilizzare orizzonti temporali brevi. La randomizzazione del dominio varia massa, attrito, ritardo, rumore del sensore, illuminazione e posizione della telecamera. L'identificazione del sistema misura inerzia, attrito, costanti del motore e latenza in modo che tali intervalli siano difendibili anziché arbitrari.

Passare dalla registrazione, al controllo shadow a bassa velocità, a prove supervisionate limitate. Mantenere l'arresto di emergenza, monitor indipendenti di velocità/forza/temperatura, arresto in caso di perdita di comunicazione, e separazione umana al di fuori della politica appresa. I guasti comuni includono simulazioni a attrito fisso che causano slittamento delle ruote, overfitting dell'illuminazione, hacking della ricompensa che crea vibrazioni e ritardo non modellato che causa instabilità. Segnala il numero di violazioni, la distanza di arresto, l'astensione innescata dall'incertezza e il comportamento nel caso peggiore, non solo la ricompensa media.

Ruoli senza modello e basati su modello

L'apprendimento per rinforzo senza modello (MBRL) aggiorna una politica o un valore direttamente dall'esperienza. È efficace quando le dinamiche di contatto sono difficili da modellare, ma ogni miglioramento può consumare prove reali. L'MBRL riutilizza ogni transizione per addestrare un predittore e valuta molte sequenze candidate in quel predittore. Se il predittore presenta una distorsione sistematica, il pianificatore ottimizza una scorciatoia solo per il simulatore.

Aspetto Senza modello Basato su modello
Dati hardware efficienza da bassa a media da media ad alta all'interno dell'intervallo del modello
Tempo di esecuzione spesso inferenza di politica leggera implementazioni e ottimizzazione ad ogni ciclo
Vincoli solitamente indiretti Strato di ricompensa/sicurezza Naturale da inserire nel problema di pianificazione

Guasto principale | Scarsa estrapolazione da dati sparsi | Errore del modello a lungo termine |

Adattamento tipico | Politiche di contatto e visive complesse | Pianificazione del movimento, dell'energia e termica a breve termine |

Gli stack ibridi sono comuni: una politica appresa propone candidati, un modello appreso prevede un orizzonte temporale breve e l'MPC impone vincoli di velocità, forza e corrente. Utilizzare gli articoli PPO/SAC e MPC per assegnare le responsabilità di temporizzazione e sicurezza, anziché trattare gli algoritmi come sostituti.

Non ridurre l'incertezza a un singolo numero

L'incertezza epistemica deriva dalla mancanza di dati di addestramento; l'incertezza aleatoria deriva da variazioni irriducibili dei sensori e dell'ambiente. La varianza di un ensemble è un segnale utile per la prima, ma un ensemble può comunque condividere lo stesso bias. Quando la varianza predittiva Se si supera una soglia, ridurre l'orizzonte temporale, diminuire la velocità, passare a un controllore classico o raccogliere un'altra osservazione prima della pianificazione. Questa politica di astensione deve essere specificata prima dell'implementazione.

Per il residuo a un passo e_t=s_{t+1}-\hat s_{t+1}, logaritmare i quantili e i casi peggiori oltre all'errore quadratico medio. Un errore medio basso può nascondere un errore elevato appena prima del contatto. Non interpretare mai un intervallo di previsione probabilistico come un certificato di sicurezza; mantenere monitor indipendenti per collisione, forza, temperatura e corrente.

Esperimenti di identificazione del progetto

L'identificazione del sistema è un problema di progettazione di esperimenti, non una singola calibrazione. Per un motore, misurare separatamente l'attrito statico, l'inerzia a diverse velocità, la coppia dipendente dal carico e il ritardo di andata e ritorno della comunicazione. Per un attuatore idraulico, registrare con timestamp pressione, flusso, velocità del cilindro, temperatura dell'olio e comando della valvola su un singolo orologio. Suddividere i dati per giorno, piano, carico utile, illuminazione e temperatura, non per fotogrammi vicini casuali, in modo che il set finale sia realmente non visto.

Una piccola intuizione numerica

Si consideri un carrello da 1 kg la cui velocità Variazioni di 0.1u ogni T_s=0.1\,\mathrm{s}. Un modello senza attrito prevede un aumento di velocità di 0.5\,\mathrm{m/s} per u=1 su cinque passi. Se il carrello reale perde 0.02\,\mathrm{m/s} per passo a causa dell'attrito, l'errore su cinque passi raggiunge 0.1\,\mathrm{m/s}. Un orizzonte temporale più breve, l'identificazione online, il margine nel vincolo di velocità e la ripianificazione basata sulla misurazione mantengono utile questo semplice modello.

Prove da pubblicare

Insieme alle equazioni, conservare il periodo di addestramento, la frequenza del sensore, il ritardo, il seed casuale, i parametri ambientali, la scadenza del risolutore e la politica di fallback. Rappresentare graficamente i residui di previsione, le violazioni dei vincoli, la distanza di arresto e l'astensione innescata dall'incertezza con lo stesso ID dell'esperimento della ricompensa. Se i log grezzi non possono essere condivisi, pubblicare statistiche anonimizzate, impostazioni di simulazione, unità e una data di riferimento in modo che l'ambito della rivendicazione rimanga Verificabile.

Verifica la tua comprensione
Un modello appreso garantisce implementazioni a lungo termine affidabili?

Piccoli errori del modello si accumulano nelle previsioni. Verifica la durata dell'implementazione, gli stati non familiari e la validazione nell'ambiente reale.

Riferimenti

Tipi di modelli del mondo e pianificatori

I modelli fisici sono interpretabili ma possono avere difficoltà con il contatto; i modelli latenti e di ensemble possono essere efficienti ma richiedono la validazione rispetto alla sicurezza nello spazio reale. Le azioni candidate possono utilizzare il tiro, il CEM o l'MPC differenziabile, con un fallback di scadenza.

Dataset Igiene

Segnalare i sensori saturi, gli errori temporali, gli interventi dei limitatori, i valori interpolati e le cause terminali. Mantenere immutabile il set di valutazione in modo che un aggiornamento del modello non possa nascondere una regressione.

Limiti delle evidenze

L'accuratezza della previsione, la ricompensa e il comportamento sicuro dell'hardware sono affermazioni separate. Pubblicare la metrica, la condizione di test e il livello di sicurezza responsabile per ciascuna.

What to read next

Review the backgroundGuida introduttiva alla progettazione delle ricompense: perché "cosa massimizzare" è la parte più difficile dell'apprendimento per rinforzo.Continue the seriesIntroduzione all'apprendimento per rinforzo: apprendimento per imitazione e apprendimento per rinforzo inversoExplore another aspect of this fieldIntroduzione all'apprendimento per rinforzo multi-agente: ottimizzazione in un mondo in cui anche l'altra parte sta imparando.