Contents — find the section you need
Il Q-learning e il DQN scelgono da un insieme finito di azioni. La velocità di una ruota, la spinta di un drone o la coppia di un manipolatore sono tuttavia continue. I metodi basati sul gradiente di policy aggiornano una policy \pi_\theta che produce una distribuzione sulle azioni continue. L'algoritmo Actor-Critic aggiunge un Critic che valuta tali azioni; PPO e SAC aggiungono una stabilizzazione pratica ampiamente utilizzata nella ricerca robotica.
Riepilogo in 30 secondi
-
I gradienti di policy aumentano direttamente il rendimento atteso J(\theta). Gestiscono le azioni continue in modo naturale, ma le stime di traiettorie singole presentano un'elevata varianza.
-
L'algoritmo Actor-Critic utilizza una stima del valore come base di riferimento. Il vantaggio misura se un'azione è stata migliore dell'azione media nello stesso stato.
-
PPO limita il rapporto di probabilità tra le vecchie e le nuove policy in modo che un singolo aggiornamento non possa discostarsi troppo. È semplice, ma i dati on-policy sono difficili da riutilizzare.
-
SAC massimizza sia la ricompensa che l'entropia della policy. È un sistema off-policy, utilizza la riproduzione dei dati ed è adatto al controllo continuo.
Nessuno dei due metodi fornisce limiti di sicurezza. Limiti di azione, limiti di velocità, PID/MPC di basso livello e arresti di emergenza devono rimanere al di fuori del sistema di apprendimento.
1. Ottimizzazione diretta di una politica
Figura 1 — L'Attore propone una distribuzione continua e il Critico valuta il rendimento. Sull'hardware, l'azione passa attraverso un controller di livello inferiore verificato anziché direttamente alla coppia.
Per una politica stocastica \pi_\theta(a\mid s) , il gradiente del rendimento atteso J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] può essere scritto utilizzando il gradiente della probabilità logaritmica:
Le azioni che hanno prodotto un rendimento elevato diventano più probabili. Poiché G_t è rumoroso e ritardato, sottraendo un La baseline dipendente dallo stato b(s_t) riduce la varianza senza modificare il gradiente atteso:
2. Vantaggio e Attore-Critico
Il Critico apprende V_\phi(s) e stima se un'azione è stata migliore della media dello stato con A_t=Q(s_t,a_t)-V(s_t) . Un'approssimazione TD a un passo è
La stima del vantaggio generalizzato (GAE) combina diversi passaggi con un iperparametro di bias-varianza \lambda . Quando \lambda si avvicina a uno, utilizza un orizzonte temporale più lungo e un bias inferiore ma una varianza maggiore. Per un ciclo di atteggiamento veloce, utilizzare il ritardo e la scala temporale effettivi del compito anziché copiare un'impostazione di riferimento.
La perdita dell'Attore è
e il Il critico minimizza l'errore quadratico medio
Quando un codificatore di immagini è condiviso, un gradiente modifica entrambe le stime. Tassi di apprendimento separati, clipping del gradiente e un record di normalizzazione dell'osservazione fisso semplificano la diagnosi dei guasti.
3. PPO: non modificare la policy in modo eccessivo in una sola volta
I gradienti della policy on-policy raccolgono un rollout con la policy corrente. Riutilizzarlo per troppi aggiornamenti allontana la nuova policy dalla distribuzione dei dati. Il PPO forma un rapporto di probabilità tra la vecchia policy \pi_{\theta_{old}} e la nuova policy,
e massimizza la funzione obiettivo troncata
I vantaggi positivi non possono aumentare la loro probabilità illimitatamente e i vantaggi negativi non possono diminuirla illimitatamente. Un \epsilon piccolo è conservativo; un valore grande consente aggiornamenti più audaci. Il clipping non è un vincolo di sicurezza, quindi articolazione, velocità e forza I limiti rimangono comunque separati.
Un'implementazione raccoglie un rollout fisso, normalizza Advantage e addestra diversi mini-batch epoch. Salva le vecchie probabilità di log, distingue un timeout da un vero stato terminale e blocca le statistiche di normalizzazione in fase di valutazione. Altrimenti, due esecuzioni con gli stessi pesi potrebbero comportarsi in modo diverso.
4. SAC: ricompensa più entropia
Soft Actor-Critic (SAC) aggiunge l'entropia della policy \mathcal{H}(\pi) alla ricompensa futura come obiettivo:
Il termine di entropia impedisce che azioni ugualmente valide collassino in una troppo presto, agendo come una temperatura \alpha che mantiene viva l'esplorazione. SAC è off-policy e utilizza un buffer di replay, quindi ogni transizione del mondo reale può essere riutilizzata. Ciò migliora l'efficienza del campionamento, ma i dati obsoleti, la scala della ricompensa e la regolazione della temperatura sono importanti.
Per un'azione continua, l'Actor restituisce la media \mu_\theta(s) e la deviazione standard \sigma_\theta(s) di una gaussiana, quindi la mappa in limiti con tanh o un'altra trasformazione. La probabilità logaritmica necessita della correzione jacobiana di tale trasformazione. Le reti Twin Q e la stima Q più piccola riducono la sovrastima. Decidere se l'implementazione utilizza la media deterministica o conserva il rumore di esplorazione.
5. Scelta tra PPO e SAC
| Aspetto | PPO | SAC |
|---|---|---|
| Dati | implementazioni on-policy | replay off-policy |
| Esplorazione | distribuzione delle policy e bonus di entropia | l'entropia fa parte dell'obiettivo |
| Efficienza del campione | da bassa a media | spesso più alta |
| Bug principali | probabilità logaritmica, flag terminali, clipping | sovrastima di Q, scala di ricompensa, correzione tanh |
| Adattamento tipico | molti simulatori paralleli | coppia continua e dati hardware scarsi |
PPO è spesso stabile quando molti ambienti simulati possono essere eseguiti in parallelo. SAC può essere interessante quando ogni transizione reale è costosa. Nessuno dei due metodi modella automaticamente il ritardo del sensore, le zone morte del motore o la saturazione dell'attuatore.
6. Sim-Real è un confine, non un interruttore
Il divario tra simulazione e realtà deriva da massa e attrito, gioco meccanico, esposizione e rumore del sensore, ritardo di rete, calo di tensione della batteria, materiale del pavimento e illuminazione. La randomizzazione del dominio campiona questi parametri in modo che la policy non si adatti eccessivamente a un valore ideale. L'intervallo dovrebbe essere misurato dall'hardware; randomizzare mondi impossibili rende solo più difficile l'addestramento.
Un trasferimento a fasi è più sicuro: (1) pura simulazione, (2) riproduzione di log di sensori reali senza movimento, (3) test a basso consumo con le ruote sollevate, (4) velocità e forza limitate su un pavimento libero e (5) l'attività stessa. Registrare l'azione richiesta separatamente dall'azione effettivamente superata dal limitatore di sicurezza. Sim-Real è un ciclo iterativo di identificazione e valutazione, non un singolo pulsante di implementazione.
7. Sicurezza e valutazione
Il clipping PPO e l'entropia SAC non impediscono le collisioni. Monitor indipendenti dovrebbero verificare Velocità, accelerazione, angolo di giunzione, forza di contatto, pressione idraulica, corrente e temperatura. In caso di osservazione non valida, NaN, timestamp scaduto o interruzione della comunicazione, il monitor dovrebbe comandare un arresto sicuro. Eseguirlo in un processo separato o in una MCU quando il rischio lo giustifica.
Oltre alla ricompensa, misurare il successo, il tasso di collisione, la deviazione massima, la distanza di arresto, l'energia, la fluidità dell'azione, la latenza di inferenza e la frequenza di intervento del limitatore di sicurezza. Un'elevata percentuale di successo con frequenti interventi significa che la politica dipende dal limitatore. Ripetere le esecuzioni con diversi seed casuali e riportare la varianza e i casi peggiori, non solo la media.
Lista di controllo per l'implementazione
-
Testare le unità di azione, i limiti, l'ordinamento tanh/clip e le correzioni della probabilità logaritmica.
-
Per PPO, salvare le vecchie probabilità logaritmiche, il vantaggio e i flag di timeout rispetto al terminale.
-
Per SAC, monitorare la distribuzione del replay, i valori Q gemelli, la temperatura \alpha e la scala di ricompensa.
-
Bloccare la preelaborazione, la normalizzazione, i seed, pesi e parametri ambientali per ID esperimento.
-
Mantenere PID/MPC di basso livello, limiti di velocità, watchdog e arresto di emergenza indipendenti dall'algoritmo di apprendimento.
-
Definire le condizioni di arresto per i log passivi, il basso consumo e il funzionamento normale prima di ogni transizione.
-
Registrare insieme successo, collisione, intervento del limitatore, latenza, energia e deviazione massima.
Riepilogo
I gradienti di policy ottimizzano direttamente una distribuzione continua di azioni. L'algoritmo Actor-Critic utilizza il vantaggio per ridurre la varianza; il PPO limita l'aggiornamento; il SAC utilizza l'entropia e il replay per migliorare l'esplorazione e l'efficienza dei dati. Nessuno di questi algoritmi risolve da solo l'incertezza hardware o i problemi di sicurezza. Un controller di livello inferiore verificato, un monitor indipendente, il trasferimento a fasi e la valutazione del caso peggiore fanno parte dell'algoritmo quando una policy appresa esce dalla simulazione.
Il clipping PPO garantisce un comportamento sicuro?
Modera l'obiettivo di ottimizzazione, non i vincoli di sicurezza fisica. Valutare separatamente la stabilità dell'addestramento e la sicurezza delle azioni.
Commenti
Accedi per continuare.
Nessun dato disponibile.