Apprentissage automatique
Apprentissage automatique — Un parcours structuré en robotique, commande, agriculture en environnement contrôlé, énergie et électronique de puissance.
Find a reading order in the learning guides → Search this field →
Tous les domaines
Évaluation comparative des LLM locaux : temps de réponse initial, taux de génération et mémoire
Mesurer le contenu de la première réponse séparément du taux de génération et du contrôle residency, caching and memory conditions.
Hands-on · 3 min de lecture
Apprentissage automatique
September 5, 2026
Introduction à la détection d'objets et à la segmentation sémantique — Interpréter « Qu'est-ce qui est où » à partir d'une image
La détection d'objets encadre les éléments ; la segmentation sémantique colore chaque pixel selon sa signification. De la différence entre les deux, en passant par la segmentation par instance et la segmentation panoptique, et l'évolution de R-CNN à YOLO, DETR et DINO, jusqu'à leurs équivalents en nuages de points 3D : un tour d'horizon systématique des principes fondamentaux de la compréhension des scènes.
Fundamentals · 18 min de lectureIntroduction à l'apprentissage automatique : Modèles génératifs
Les modèles génératifs représentent les distributions de données et produisent des résultats conditionnels. Apprenez la vraisemblance, les VAE, les GAN, la diffusion, l'évaluation, la provenance et la sécurité.
Fundamentals · 6 min de lecture Apprentissage automatique September 4, 2026Introduction à l'apprentissage automatique : Fondements — Conception des données, fonction de perte et généralisation
« L’apprentissage automatique ne se limite pas à la sélection du modèle : il faut définir la tâche, la division des données, la fonction de perte, l’évaluation et le déploiement. »
Fundamentals · 6 min de lecture Apprentissage automatique September 4, 2026Guide complet de SegFormer — Pourquoi un transformateur sans encodage positionnel fonctionne pour la segmentation
Cet article présente SegFormer, introduit par NVIDIA, l'Université de Hong Kong et leurs collaborateurs lors de la conférence NeurIPS 2021, en s'appuyant sur l'article original. Nous examinons l'encodeur MiT hiérarchique sans encodage positionnel, le décodeur All-MLP à faible nombre de paramètres, le champ réceptif effectif, ainsi que le mIoU mesuré, le nombre de paramètres et les calculs de B0 à B5 à l'aide d'équations.
Fundamentals · 11 min de lecture Apprentissage automatique September 4, 2026YOLO11 expliqué en détail — Qu'est-ce que C3k2 et C2PSA ont changé par rapport à YOLOv8 ?
Analysez en détail Ultralytics YOLO11 en utilisant la documentation officielle et les sources primaires : C3k2, C2PSA, détection sans ancre, pertes DFL/CIoU et benchmarks mesurés pour n/s/m/l/x.
Fundamentals · 13 min de lecture Apprentissage automatique September 4, 2026Introduction à l'apprentissage automatique : Notions de base des réseaux neuronaux
Les réseaux neuronaux empilent des transformations affines et des activations non linéaires, puis réduisent la perte par rétropropagation et optimisation basée sur le gradient.
Fundamentals · 6 min de lecture Apprentissage automatique September 4, 2026Introduction à l'apprentissage automatique : estimation de la pose
L'estimation de pose déduit les points clés et la pose 6D d'une personne ou d'un objet à partir d'images. Ce guide aborde les coordonnées, les pertes, l'occlusion, l'évaluation et la sécurité.
Fundamentals · 6 min de lectureIntroduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi
Lorsque plusieurs agents apprennent simultanément, un processus de décision markovien (MDP) à agent unique n'est plus valable. Cet article présente, à l'aide d'équations et de diagrammes, la non-stationnarité, les contextes coopératifs, compétitifs et mixtes, l'algorithme CTDE, le problème d'attribution de crédit, ainsi que les algorithmes MADDPG et QMIX.
Fundamentals · 9 min de lecture Apprentissage par renforcement September 4, 2026π0 expliqué — Comment la correspondance des flux a changé la génération d'actions VLA
Un guide technique basé sur les sources pour π0 de Physical Intelligence : le VLM PaliGemma et l'expert en actions dédié, la génération d'actions continues avec correspondance de flux conditionnelle, l'entraînement inter-incarnation sur sept types de robots et la différence avec les modèles VLA autorégressifs tels que RT-2 et OpenVLA.
Fundamentals · 13 min de lectureIntroduction à la conception des récompenses — Pourquoi « Que maximiser » est la partie la plus difficile de l'apprentissage par renforcement
Dans les implémentations d'apprentissage par renforcement, la conception de la fonction de récompense détermine plus souvent le résultat que l'algorithme lui-même. Cet article aborde la question des récompenses éparses et denses, l'invariance de la politique de mise en forme des récompenses basée sur le potentiel, des cas concrets de manipulation des récompenses, l'apprentissage par renforcement inverse et l'apprentissage par renforcement contraint.
Fundamentals · 10 min de lectureIntroduction à l'apprentissage par renforcement : apprentissage par imitation et apprentissage par renforcement inverse
Le clonage comportemental, DAgger et l'apprentissage par renforcement inverse utilisent des démonstrations lorsque la programmation des récompenses est complexe. Ce guide aborde le décalage de covariables, l'inférence des récompenses, les connexions VLA, l'évaluation, la sécurité et la provenance des données.
Fundamentals · 7 min de lecture Apprentissage par renforcement September 3, 2026Principes fondamentaux de l'apprentissage par renforcement — Processus de décision markoviens, équations de Bellman et exploration pour les robots
L'apprentissage par renforcement est un processus en boucle fermée où un agent choisit ses actions à partir d'observations et maximise les récompenses différées. Ce guide explique les processus de décision markoviens (MDP), les fonctions de valeur, les politiques, les équations de Bellman, l'exploration et l'exploitation, la conception des récompenses et le passage de la simulation à un robot réel.
Fundamentals · 8 min de lecture Apprentissage par renforcement September 3, 2026Apprentissage par renforcement basé sur un modèle et passage de la simulation au réel
Modèles du monde, erreur de prédiction, MPC, randomisation de domaine, identification de système et surveillance de la sécurité pour les machines réelles.
Fundamentals · 5 min de lectureGradient de politique, PPO et SAC — Contrôle continu stable pour les robots
Les gradients de politique mettent à jour directement une politique afin d'assurer la continuité de la direction, de la poussée et du couple articulaire. Cet article établit un lien entre Actor-Critic, PPO et SAC, puis aborde le clipping, la régularisation entropique, l'évaluation et la limite de sécurité pour le transfert de la simulation vers le réel.
Fundamentals · 7 min de lectureQ-Learning et DQN — De la table Q à l'apprentissage par renforcement profond
L'apprentissage par renforcement (Q-learning) met à jour les valeurs des actions en fonction de l'optimalité de Bellman. Ce guide retrace le cheminement d'une table Q classique à un réseau de neurones profond (Deep Q Network), en expliquant la réutilisation de l'expérience, les réseaux cibles, la surestimation et le placement sûr dans une pile de robots.
Fundamentals · 7 min de lecture