Contents — find the section you need
In sintesi
L'apprendimento per rinforzo basato su modelli (MBRL) apprende un modello del mondo \hat f, che mappa lo stato e l'azione a uno stato successivo previsto, testa le sequenze di azioni al suo interno e applica all'hardware solo un'azione supervisionata. I metodi senza modello apprendono una politica direttamente dalla ricompensa; l'MBRL può essere più efficiente in termini di dati e può esprimere vincoli, ma un errore del modello può portare a un successo solo simulato. Vedi Nozioni di base sull'apprendimento per rinforzo, Q-learning, PPO/SAC e MPC.
Modelli mondiali e pianificazione
Figura 1 — SVG concettuale creato da Duskcoil, non dati di sistema misurati.
Apprendi \hat s_{t+1}=\hat f_\theta(s_t,a_t) e ottimizza un obiettivo a orizzonte mobile:
Simulazione-Realtà, identificazione e sicurezza
Gli errori a un passo si accumulano su lunghi rollout. Gli ensemble possono stimare l'incertezza; i pianificatori possono evitare regioni ad alta varianza e utilizzare orizzonti temporali brevi. La randomizzazione del dominio varia massa, attrito, ritardo, rumore del sensore, illuminazione e posizione della telecamera. L'identificazione del sistema misura inerzia, attrito, costanti del motore e latenza in modo che tali intervalli siano difendibili anziché arbitrari.
Passare dalla registrazione, al controllo shadow a bassa velocità, a prove supervisionate limitate. Mantenere l'arresto di emergenza, monitor indipendenti di velocità/forza/temperatura, arresto in caso di perdita di comunicazione, e separazione umana al di fuori della politica appresa. I guasti comuni includono simulazioni a attrito fisso che causano slittamento delle ruote, overfitting dell'illuminazione, hacking della ricompensa che crea vibrazioni e ritardo non modellato che causa instabilità. Segnala il numero di violazioni, la distanza di arresto, l'astensione innescata dall'incertezza e il comportamento nel caso peggiore, non solo la ricompensa media.
Ruoli senza modello e basati su modello
L'apprendimento per rinforzo senza modello (MBRL) aggiorna una politica o un valore direttamente dall'esperienza. È efficace quando le dinamiche di contatto sono difficili da modellare, ma ogni miglioramento può consumare prove reali. L'MBRL riutilizza ogni transizione per addestrare un predittore e valuta molte sequenze candidate in quel predittore. Se il predittore presenta una distorsione sistematica, il pianificatore ottimizza una scorciatoia solo per il simulatore.
| Aspetto | Senza modello | Basato su modello |
|---|---|---|
| Dati hardware | efficienza da bassa a media | da media ad alta all'interno dell'intervallo del modello |
| Tempo di esecuzione | spesso inferenza di politica leggera | implementazioni e ottimizzazione ad ogni ciclo |
| Vincoli | solitamente indiretti Strato di ricompensa/sicurezza | Naturale da inserire nel problema di pianificazione |
Guasto principale | Scarsa estrapolazione da dati sparsi | Errore del modello a lungo termine |
Adattamento tipico | Politiche di contatto e visive complesse | Pianificazione del movimento, dell'energia e termica a breve termine |
Gli stack ibridi sono comuni: una politica appresa propone candidati, un modello appreso prevede un orizzonte temporale breve e l'MPC impone vincoli di velocità, forza e corrente. Utilizzare gli articoli PPO/SAC e MPC per assegnare le responsabilità di temporizzazione e sicurezza, anziché trattare gli algoritmi come sostituti.
Non ridurre l'incertezza a un singolo numero
L'incertezza epistemica deriva dalla mancanza di dati di addestramento; l'incertezza aleatoria deriva da variazioni irriducibili dei sensori e dell'ambiente. La varianza di un ensemble è un segnale utile per la prima, ma un ensemble può comunque condividere lo stesso bias. Quando la varianza predittiva Se si supera una soglia, ridurre l'orizzonte temporale, diminuire la velocità, passare a un controllore classico o raccogliere un'altra osservazione prima della pianificazione. Questa politica di astensione deve essere specificata prima dell'implementazione.
Per il residuo a un passo e_t=s_{t+1}-\hat s_{t+1}, logaritmare i quantili e i casi peggiori oltre all'errore quadratico medio. Un errore medio basso può nascondere un errore elevato appena prima del contatto. Non interpretare mai un intervallo di previsione probabilistico come un certificato di sicurezza; mantenere monitor indipendenti per collisione, forza, temperatura e corrente.
Esperimenti di identificazione del progetto
L'identificazione del sistema è un problema di progettazione di esperimenti, non una singola calibrazione. Per un motore, misurare separatamente l'attrito statico, l'inerzia a diverse velocità, la coppia dipendente dal carico e il ritardo di andata e ritorno della comunicazione. Per un attuatore idraulico, registrare con timestamp pressione, flusso, velocità del cilindro, temperatura dell'olio e comando della valvola su un singolo orologio. Suddividere i dati per giorno, piano, carico utile, illuminazione e temperatura, non per fotogrammi vicini casuali, in modo che il set finale sia realmente non visto.
Una piccola intuizione numerica
Si consideri un carrello da 1 kg la cui velocità Variazioni di 0.1u ogni T_s=0.1\,\mathrm{s}. Un modello senza attrito prevede un aumento di velocità di 0.5\,\mathrm{m/s} per u=1 su cinque passi. Se il carrello reale perde 0.02\,\mathrm{m/s} per passo a causa dell'attrito, l'errore su cinque passi raggiunge 0.1\,\mathrm{m/s}. Un orizzonte temporale più breve, l'identificazione online, il margine nel vincolo di velocità e la ripianificazione basata sulla misurazione mantengono utile questo semplice modello.
Prove da pubblicare
Insieme alle equazioni, conservare il periodo di addestramento, la frequenza del sensore, il ritardo, il seed casuale, i parametri ambientali, la scadenza del risolutore e la politica di fallback. Rappresentare graficamente i residui di previsione, le violazioni dei vincoli, la distanza di arresto e l'astensione innescata dall'incertezza con lo stesso ID dell'esperimento della ricompensa. Se i log grezzi non possono essere condivisi, pubblicare statistiche anonimizzate, impostazioni di simulazione, unità e una data di riferimento in modo che l'ambito della rivendicazione rimanga Verificabile.
Un modello appreso garantisce implementazioni a lungo termine affidabili?
Piccoli errori del modello si accumulano nelle previsioni. Verifica la durata dell'implementazione, gli stati non familiari e la validazione nell'ambiente reale.
Riferimenti
Tipi di modelli del mondo e pianificatori
I modelli fisici sono interpretabili ma possono avere difficoltà con il contatto; i modelli latenti e di ensemble possono essere efficienti ma richiedono la validazione rispetto alla sicurezza nello spazio reale. Le azioni candidate possono utilizzare il tiro, il CEM o l'MPC differenziabile, con un fallback di scadenza.
Dataset Igiene
Segnalare i sensori saturi, gli errori temporali, gli interventi dei limitatori, i valori interpolati e le cause terminali. Mantenere immutabile il set di valutazione in modo che un aggiornamento del modello non possa nascondere una regressione.
Limiti delle evidenze
L'accuratezza della previsione, la ricompensa e il comportamento sicuro dell'hardware sono affermazioni separate. Pubblicare la metrica, la condizione di test e il livello di sicurezza responsabile per ciascuna.
Commenti
Accedi per continuare.
Nessun dato disponibile.