Apprendimento per rinforzo — Guida allo studio
Apprendimento per rinforzo — Un percorso strutturato in robotica, controllo, agricoltura in ambiente controllato, energia ed elettronica di potenza.
Un percorso strutturato in robotica, controllo, agricoltura in ambiente controllato, energia ed elettronica di potenza.
- Fundamentals · 7 min di lettura
Nozioni di base sull'apprendimento per rinforzo: MDP, equazioni di Bellman ed esplorazione per i robot
L'apprendimento per rinforzo è un ciclo chiuso in cui un agente sceglie le azioni in base alle osservazioni e massimizza le ricompense ritardate. Questa introduzione spiega i processi decisionali di Markov (MDP), le funzioni di valore, le politiche, le equazioni di Bellman, la differenza tra esplorazione e sfruttamento, la progettazione delle ricompense e il percorso dalla simulazione a un robot reale.
- Fundamentals · 6 min di lettura
Q-Learning e DQN: dalla tabella Q all'apprendimento per rinforzo profondo.
L'apprendimento Q aggiorna i valori delle azioni con l'obiettivo di ottimalità di Bellman. Questa introduzione illustra il percorso da una tabella Q tabellare a una rete Q profonda, spiegando la riproduzione dell'esperienza, le reti target, la sovrastima e il posizionamento sicuro in una pila di robot.
- Fundamentals · 6 min di lettura
Gradienti di policy, PPO e SAC: controllo continuo stabile per robot
I gradienti di policy aggiornano direttamente una policy in modo che sterzo, spinta e coppia articolare possano rimanere continui. Questo articolo collega Actor-Critic, PPO e SAC, quindi tratta il clipping, la regolarizzazione dell'entropia, la valutazione e il confine di sicurezza per il trasferimento Sim-Real.
- Fundamentals · 9 min di lettura
Guida introduttiva alla progettazione delle ricompense: perché "cosa massimizzare" è la parte più difficile dell'apprendimento per rinforzo.
Nelle implementazioni dell'apprendimento per rinforzo, la progettazione della funzione di ricompensa determina più spesso il risultato rispetto all'algoritmo. Questo articolo analizza la differenza tra ricompensa sparsa e densa, l'invarianza di policy della modellazione della ricompensa basata sul potenziale, casi reali di manipolazione della ricompensa, l'apprendimento per rinforzo inverso e l'apprendimento per rinforzo vincolato.
- Fundamentals · 5 min di lettura
Apprendimento per rinforzo basato su modelli e Sim-to-Real
Modelli globali, errore di predizione, MPC, randomizzazione del dominio, identificazione del sistema e monitoraggio della sicurezza per macchine reali.
- Fundamentals · 6 min di lettura
Introduzione all'apprendimento per rinforzo: apprendimento per imitazione e apprendimento per rinforzo inverso
Il Behavior Cloning, DAgger e l'apprendimento per rinforzo inverso utilizzano dimostrazioni quando è difficile definire le ricompense. Questa introduzione tratta lo spostamento delle covariate, l'inferenza delle ricompense, le connessioni VLA, la valutazione, la sicurezza e la provenienza dei dati.
- Fundamentals · 12 min di lettura
π0 spiegato: come la corrispondenza del flusso ha cambiato la generazione delle azioni VLA
Una guida tecnica basata sul codice sorgente per π0 dell'Intelligenza Fisica: il VLM PaliGemma e l'Action Expert dedicato, la generazione continua di azioni con corrispondenza del flusso condizionale, l'addestramento cross-incarnazione su sette tipi di robot e la differenza rispetto ai modelli VLA autoregressivi come RT-2 e OpenVLA.
- Fundamentals · 9 min di lettura
Introduzione all'apprendimento per rinforzo multi-agente: ottimizzazione in un mondo in cui anche l'altra parte sta imparando.
Quando più agenti apprendono contemporaneamente, un MDP a singolo agente non è più valido. Questo articolo organizza, con equazioni e diagrammi, i concetti di non stazionarietà, contesti cooperativi/competitivi/misti, CTDE, il problema dell'assegnazione del credito, MADDPG e QMIX.