Articles
Construire, tester et examiner la technologie. L’expérimentation, la réalisation et la recherche expliquent son fonctionnement.
7

#Reinforcement Learning

Apprentissage par renforcement September 4, 2026

Introduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi

Lorsque plusieurs agents apprennent simultanément, un processus de décision markovien (MDP) à agent unique n'est plus valable. Cet article présente, à l'aide d'équations et de diagrammes, la non-stationnarité, les contextes coopératifs, compétitifs et mixtes, l'algorithme CTDE, le problème d'attribution de crédit, ainsi que les algorithmes MADDPG et QMIX.

Fundamentals · 9 min de lecture
Apprentissage par renforcement September 4, 2026

Introduction à la conception des récompenses — Pourquoi « Que maximiser » est la partie la plus difficile de l'apprentissage par renforcement

Dans les implémentations d'apprentissage par renforcement, la conception de la fonction de récompense détermine plus souvent le résultat que l'algorithme lui-même. Cet article aborde la question des récompenses éparses et denses, l'invariance de la politique de mise en forme des récompenses basée sur le potentiel, des cas concrets de manipulation des récompenses, l'apprentissage par renforcement inverse et l'apprentissage par renforcement contraint.

Fundamentals · 10 min de lecture
Tendances technologiques September 4, 2026

Tendances technologiques dans les modèles mondiaux

« Un « modèle du monde » apprend la dynamique d'un environnement et simule l'avenir en interne. De VAE+RNN de Ha et Schmidhuber, en passant par DreamerV3, Genie 3 et Sora, jusqu'à l'architecture JEPA défendue par Yann LeCun, cet article cartographie la fracture entre les approches génératives et non génératives, ainsi que le problème commun de la cohérence physique auquel les deux camps se heurtent. »

Trends · 10 min de lecture
Apprentissage par renforcement September 3, 2026

Introduction à l'apprentissage par renforcement : apprentissage par imitation et apprentissage par renforcement inverse

Le clonage comportemental, DAgger et l'apprentissage par renforcement inverse utilisent des démonstrations lorsque la programmation des récompenses est complexe. Ce guide aborde le décalage de covariables, l'inférence des récompenses, les connexions VLA, l'évaluation, la sécurité et la provenance des données.

Fundamentals · 7 min de lecture
Apprentissage par renforcement September 3, 2026

Principes fondamentaux de l'apprentissage par renforcement — Processus de décision markoviens, équations de Bellman et exploration pour les robots

L'apprentissage par renforcement est un processus en boucle fermée où un agent choisit ses actions à partir d'observations et maximise les récompenses différées. Ce guide explique les processus de décision markoviens (MDP), les fonctions de valeur, les politiques, les équations de Bellman, l'exploration et l'exploitation, la conception des récompenses et le passage de la simulation à un robot réel.

Fundamentals · 8 min de lecture
Apprentissage par renforcement September 3, 2026

Apprentissage par renforcement basé sur un modèle et passage de la simulation au réel

Modèles du monde, erreur de prédiction, MPC, randomisation de domaine, identification de système et surveillance de la sécurité pour les machines réelles.

Fundamentals · 5 min de lecture
Tendances technologiques August 20, 2026

Tendances technologiques en matière de navigation

Du processus classique de création de cartes, de cartes de coûts et de planification de trajectoires, aux approches de bout en bout via l'apprentissage par renforcement, jusqu'aux modèles de base construits sur des modèles Vision-Langage : état actuel de la navigation des robots mobiles autonomes.

Trends · 9 min de lecture