Articoli
Costruire, provare e analizzare la tecnologia. Esperimenti, realizzazione e ricerca spiegano perché funziona.
← Indietro · Apprendimento automatico
8

Apprendimento per rinforzo

Apprendimento per rinforzo — Un percorso strutturato in robotica, controllo, agricoltura in ambiente controllato, energia ed elettronica di potenza.

Apprendimento per rinforzo September 4, 2026

Introduzione all'apprendimento per rinforzo multi-agente: ottimizzazione in un mondo in cui anche l'altra parte sta imparando.

Quando più agenti apprendono contemporaneamente, un MDP a singolo agente non è più valido. Questo articolo organizza, con equazioni e diagrammi, i concetti di non stazionarietà, contesti cooperativi/competitivi/misti, CTDE, il problema dell'assegnazione del credito, MADDPG e QMIX.

Fundamentals · 9 min di lettura
Apprendimento per rinforzo September 4, 2026

π0 spiegato: come la corrispondenza del flusso ha cambiato la generazione delle azioni VLA

Una guida tecnica basata sul codice sorgente per π0 dell'Intelligenza Fisica: il VLM PaliGemma e l'Action Expert dedicato, la generazione continua di azioni con corrispondenza del flusso condizionale, l'addestramento cross-incarnazione su sette tipi di robot e la differenza rispetto ai modelli VLA autoregressivi come RT-2 e OpenVLA.

Fundamentals · 12 min di lettura
Apprendimento per rinforzo September 4, 2026

Guida introduttiva alla progettazione delle ricompense: perché "cosa massimizzare" è la parte più difficile dell'apprendimento per rinforzo.

Nelle implementazioni dell'apprendimento per rinforzo, la progettazione della funzione di ricompensa determina più spesso il risultato rispetto all'algoritmo. Questo articolo analizza la differenza tra ricompensa sparsa e densa, l'invarianza di policy della modellazione della ricompensa basata sul potenziale, casi reali di manipolazione della ricompensa, l'apprendimento per rinforzo inverso e l'apprendimento per rinforzo vincolato.

Fundamentals · 9 min di lettura
Apprendimento per rinforzo September 3, 2026

Introduzione all'apprendimento per rinforzo: apprendimento per imitazione e apprendimento per rinforzo inverso

Il Behavior Cloning, DAgger e l'apprendimento per rinforzo inverso utilizzano dimostrazioni quando è difficile definire le ricompense. Questa introduzione tratta lo spostamento delle covariate, l'inferenza delle ricompense, le connessioni VLA, la valutazione, la sicurezza e la provenienza dei dati.

Fundamentals · 6 min di lettura
Apprendimento per rinforzo September 3, 2026

Nozioni di base sull'apprendimento per rinforzo: MDP, equazioni di Bellman ed esplorazione per i robot

L'apprendimento per rinforzo è un ciclo chiuso in cui un agente sceglie le azioni in base alle osservazioni e massimizza le ricompense ritardate. Questa introduzione spiega i processi decisionali di Markov (MDP), le funzioni di valore, le politiche, le equazioni di Bellman, la differenza tra esplorazione e sfruttamento, la progettazione delle ricompense e il percorso dalla simulazione a un robot reale.

Fundamentals · 7 min di lettura
Apprendimento per rinforzo September 3, 2026

Apprendimento per rinforzo basato su modelli e Sim-to-Real

Modelli globali, errore di predizione, MPC, randomizzazione del dominio, identificazione del sistema e monitoraggio della sicurezza per macchine reali.

Fundamentals · 5 min di lettura
Apprendimento per rinforzo September 3, 2026

Gradienti di policy, PPO e SAC: controllo continuo stabile per robot

I gradienti di policy aggiornano direttamente una policy in modo che sterzo, spinta e coppia articolare possano rimanere continui. Questo articolo collega Actor-Critic, PPO e SAC, quindi tratta il clipping, la regolarizzazione dell'entropia, la valutazione e il confine di sicurezza per il trasferimento Sim-Real.

Fundamentals · 6 min di lettura
Apprendimento per rinforzo September 3, 2026

Q-Learning e DQN: dalla tabella Q all'apprendimento per rinforzo profondo.

L'apprendimento Q aggiorna i valori delle azioni con l'obiettivo di ottimalità di Bellman. Questa introduzione illustra il percorso da una tabella Q tabellare a una rete Q profonda, spiegando la riproduzione dell'esperienza, le reti target, la sovrastima e il posizionamento sicuro in una pila di robot.

Fundamentals · 6 min di lettura