Articles
Construire, tester et examiner la technologie. L’expérimentation, la réalisation et la recherche expliquent son fonctionnement.
16

Apprentissage automatique

Apprentissage automatique — Un parcours structuré en robotique, commande, agriculture en environnement contrôlé, énergie et électronique de puissance.

Tous les domaines

Apprentissage automatique September 8, 2026 Lab

Évaluation comparative des LLM locaux : temps de réponse initial, taux de génération et mémoire

Mesurer le contenu de la première réponse séparément du taux de génération et du contrôle residency, caching and memory conditions.

Hands-on · 3 min de lecture
Apprentissage automatique September 5, 2026

Introduction à la détection d'objets et à la segmentation sémantique — Interpréter « Qu'est-ce qui est où » à partir d'une image

La détection d'objets encadre les éléments ; la segmentation sémantique colore chaque pixel selon sa signification. De la différence entre les deux, en passant par la segmentation par instance et la segmentation panoptique, et l'évolution de R-CNN à YOLO, DETR et DINO, jusqu'à leurs équivalents en nuages de points 3D : un tour d'horizon systématique des principes fondamentaux de la compréhension des scènes.

Fundamentals · 18 min de lecture
Apprentissage automatique September 4, 2026

Introduction à l'apprentissage automatique : Modèles génératifs

Les modèles génératifs représentent les distributions de données et produisent des résultats conditionnels. Apprenez la vraisemblance, les VAE, les GAN, la diffusion, l'évaluation, la provenance et la sécurité.

Fundamentals · 6 min de lecture
Apprentissage automatique September 4, 2026

Introduction à l'apprentissage automatique : Fondements — Conception des données, fonction de perte et généralisation

« L’apprentissage automatique ne se limite pas à la sélection du modèle : il faut définir la tâche, la division des données, la fonction de perte, l’évaluation et le déploiement. »

Fundamentals · 6 min de lecture
Apprentissage automatique September 4, 2026

Guide complet de SegFormer — Pourquoi un transformateur sans encodage positionnel fonctionne pour la segmentation

Cet article présente SegFormer, introduit par NVIDIA, l'Université de Hong Kong et leurs collaborateurs lors de la conférence NeurIPS 2021, en s'appuyant sur l'article original. Nous examinons l'encodeur MiT hiérarchique sans encodage positionnel, le décodeur All-MLP à faible nombre de paramètres, le champ réceptif effectif, ainsi que le mIoU mesuré, le nombre de paramètres et les calculs de B0 à B5 à l'aide d'équations.

Fundamentals · 11 min de lecture
Apprentissage automatique September 4, 2026

YOLO11 expliqué en détail — Qu'est-ce que C3k2 et C2PSA ont changé par rapport à YOLOv8 ?

Analysez en détail Ultralytics YOLO11 en utilisant la documentation officielle et les sources primaires : C3k2, C2PSA, détection sans ancre, pertes DFL/CIoU et benchmarks mesurés pour n/s/m/l/x.

Fundamentals · 13 min de lecture
Apprentissage automatique September 4, 2026

Introduction à l'apprentissage automatique : Notions de base des réseaux neuronaux

Les réseaux neuronaux empilent des transformations affines et des activations non linéaires, puis réduisent la perte par rétropropagation et optimisation basée sur le gradient.

Fundamentals · 6 min de lecture
Apprentissage automatique September 4, 2026

Introduction à l'apprentissage automatique : estimation de la pose

L'estimation de pose déduit les points clés et la pose 6D d'une personne ou d'un objet à partir d'images. Ce guide aborde les coordonnées, les pertes, l'occlusion, l'évaluation et la sécurité.

Fundamentals · 6 min de lecture
Apprentissage par renforcement September 4, 2026

Introduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi

Lorsque plusieurs agents apprennent simultanément, un processus de décision markovien (MDP) à agent unique n'est plus valable. Cet article présente, à l'aide d'équations et de diagrammes, la non-stationnarité, les contextes coopératifs, compétitifs et mixtes, l'algorithme CTDE, le problème d'attribution de crédit, ainsi que les algorithmes MADDPG et QMIX.

Fundamentals · 9 min de lecture
Apprentissage par renforcement September 4, 2026

π0 expliqué — Comment la correspondance des flux a changé la génération d'actions VLA

Un guide technique basé sur les sources pour π0 de Physical Intelligence : le VLM PaliGemma et l'expert en actions dédié, la génération d'actions continues avec correspondance de flux conditionnelle, l'entraînement inter-incarnation sur sept types de robots et la différence avec les modèles VLA autorégressifs tels que RT-2 et OpenVLA.

Fundamentals · 13 min de lecture
Apprentissage par renforcement September 4, 2026

Introduction à la conception des récompenses — Pourquoi « Que maximiser » est la partie la plus difficile de l'apprentissage par renforcement

Dans les implémentations d'apprentissage par renforcement, la conception de la fonction de récompense détermine plus souvent le résultat que l'algorithme lui-même. Cet article aborde la question des récompenses éparses et denses, l'invariance de la politique de mise en forme des récompenses basée sur le potentiel, des cas concrets de manipulation des récompenses, l'apprentissage par renforcement inverse et l'apprentissage par renforcement contraint.

Fundamentals · 10 min de lecture
Apprentissage par renforcement September 3, 2026

Introduction à l'apprentissage par renforcement : apprentissage par imitation et apprentissage par renforcement inverse

Le clonage comportemental, DAgger et l'apprentissage par renforcement inverse utilisent des démonstrations lorsque la programmation des récompenses est complexe. Ce guide aborde le décalage de covariables, l'inférence des récompenses, les connexions VLA, l'évaluation, la sécurité et la provenance des données.

Fundamentals · 7 min de lecture
Apprentissage par renforcement September 3, 2026

Principes fondamentaux de l'apprentissage par renforcement — Processus de décision markoviens, équations de Bellman et exploration pour les robots

L'apprentissage par renforcement est un processus en boucle fermée où un agent choisit ses actions à partir d'observations et maximise les récompenses différées. Ce guide explique les processus de décision markoviens (MDP), les fonctions de valeur, les politiques, les équations de Bellman, l'exploration et l'exploitation, la conception des récompenses et le passage de la simulation à un robot réel.

Fundamentals · 8 min de lecture
Apprentissage par renforcement September 3, 2026

Apprentissage par renforcement basé sur un modèle et passage de la simulation au réel

Modèles du monde, erreur de prédiction, MPC, randomisation de domaine, identification de système et surveillance de la sécurité pour les machines réelles.

Fundamentals · 5 min de lecture
Apprentissage par renforcement September 3, 2026

Gradient de politique, PPO et SAC — Contrôle continu stable pour les robots

Les gradients de politique mettent à jour directement une politique afin d'assurer la continuité de la direction, de la poussée et du couple articulaire. Cet article établit un lien entre Actor-Critic, PPO et SAC, puis aborde le clipping, la régularisation entropique, l'évaluation et la limite de sécurité pour le transfert de la simulation vers le réel.

Fundamentals · 7 min de lecture
Apprentissage par renforcement September 3, 2026

Q-Learning et DQN — De la table Q à l'apprentissage par renforcement profond

L'apprentissage par renforcement (Q-learning) met à jour les valeurs des actions en fonction de l'optimalité de Bellman. Ce guide retrace le cheminement d'une table Q classique à un réseau de neurones profond (Deep Q Network), en expliquant la réutilisation de l'expérience, les réseaux cibles, la surestimation et le placement sûr dans une pile de robots.

Fundamentals · 7 min de lecture