#Sim-to-Real
Nozioni di base sull'apprendimento per rinforzo: MDP, equazioni di Bellman ed esplorazione per i robot
L'apprendimento per rinforzo è un ciclo chiuso in cui un agente sceglie le azioni in base alle osservazioni e massimizza le ricompense ritardate. Questa introduzione spiega i processi decisionali di Markov (MDP), le funzioni di valore, le politiche, le equazioni di Bellman, la differenza tra esplorazione e sfruttamento, la progettazione delle ricompense e il percorso dalla simulazione a un robot reale.
Fundamentals · 7 min di lettura Apprendimento per rinforzo September 3, 2026Apprendimento per rinforzo basato su modelli e Sim-to-Real
Modelli globali, errore di predizione, MPC, randomizzazione del dominio, identificazione del sistema e monitoraggio della sicurezza per macchine reali.
Fundamentals · 5 min di letturaGradienti di policy, PPO e SAC: controllo continuo stabile per robot
I gradienti di policy aggiornano direttamente una policy in modo che sterzo, spinta e coppia articolare possano rimanere continui. Questo articolo collega Actor-Critic, PPO e SAC, quindi tratta il clipping, la regolarizzazione dell'entropia, la valutazione e il confine di sicurezza per il trasferimento Sim-Real.
Fundamentals · 6 min di lettura