Articoli
Costruire, provare e analizzare la tecnologia. Esperimenti, realizzazione e ricerca spiegano perché funziona.
7

#Reinforcement Learning

Apprendimento per rinforzo September 4, 2026

Introduzione all'apprendimento per rinforzo multi-agente: ottimizzazione in un mondo in cui anche l'altra parte sta imparando.

Quando più agenti apprendono contemporaneamente, un MDP a singolo agente non è più valido. Questo articolo organizza, con equazioni e diagrammi, i concetti di non stazionarietà, contesti cooperativi/competitivi/misti, CTDE, il problema dell'assegnazione del credito, MADDPG e QMIX.

Fundamentals · 9 min di lettura
Apprendimento per rinforzo September 4, 2026

Guida introduttiva alla progettazione delle ricompense: perché "cosa massimizzare" è la parte più difficile dell'apprendimento per rinforzo.

Nelle implementazioni dell'apprendimento per rinforzo, la progettazione della funzione di ricompensa determina più spesso il risultato rispetto all'algoritmo. Questo articolo analizza la differenza tra ricompensa sparsa e densa, l'invarianza di policy della modellazione della ricompensa basata sul potenziale, casi reali di manipolazione della ricompensa, l'apprendimento per rinforzo inverso e l'apprendimento per rinforzo vincolato.

Fundamentals · 9 min di lettura
Tendenze tecnologiche September 4, 2026

Tendenze tecnologiche nei modelli mondiali

Un 'modello del mondo' apprende le dinamiche di un ambiente e simula il futuro al suo interno. Dal VAE+RNN di Ha e Schmidhuber, passando per DreamerV3, Genie 3 e Sora, fino all'architettura JEPA promossa da Yann LeCun, questo articolo traccia la linea di demarcazione tra approcci generativi e non generativi, e il comune ostacolo della coerenza fisica che entrambi incontrano.

Trends · 9 min di lettura
Apprendimento per rinforzo September 3, 2026

Introduzione all'apprendimento per rinforzo: apprendimento per imitazione e apprendimento per rinforzo inverso

Il Behavior Cloning, DAgger e l'apprendimento per rinforzo inverso utilizzano dimostrazioni quando è difficile definire le ricompense. Questa introduzione tratta lo spostamento delle covariate, l'inferenza delle ricompense, le connessioni VLA, la valutazione, la sicurezza e la provenienza dei dati.

Fundamentals · 6 min di lettura
Apprendimento per rinforzo September 3, 2026

Nozioni di base sull'apprendimento per rinforzo: MDP, equazioni di Bellman ed esplorazione per i robot

L'apprendimento per rinforzo è un ciclo chiuso in cui un agente sceglie le azioni in base alle osservazioni e massimizza le ricompense ritardate. Questa introduzione spiega i processi decisionali di Markov (MDP), le funzioni di valore, le politiche, le equazioni di Bellman, la differenza tra esplorazione e sfruttamento, la progettazione delle ricompense e il percorso dalla simulazione a un robot reale.

Fundamentals · 7 min di lettura
Apprendimento per rinforzo September 3, 2026

Apprendimento per rinforzo basato su modelli e Sim-to-Real

Modelli globali, errore di predizione, MPC, randomizzazione del dominio, identificazione del sistema e monitoraggio della sicurezza per macchine reali.

Fundamentals · 5 min di lettura
Tendenze tecnologiche August 20, 2026

Tendenze tecnologiche nella navigazione

Dalla classica pipeline di mappe, mappe dei costi e pianificazione del percorso, agli approcci end-to-end tramite apprendimento per rinforzo, fino ai modelli di base costruiti su modelli di visione e linguaggio. Un'analisi dello stato attuale della navigazione autonoma dei robot mobili.

Trends · 8 min di lettura