L'apprentissage automatique est la technique qui consiste à optimiser, à partir de données, une fonction transformant une entrée x en une prédiction \hat y=f_\theta(x). L'important n'est pas le nom d'un modèle de haute précision, mais de définir ce qu'il faut prédire, comment mesurer le coût des erreurs et si les mêmes conditions peuvent être maintenues lors du déploiement.

Principes fondamentaux et répartition des données

Minimiser la perte empirique sur l'ensemble d'entraînement :

\hat\theta=\arg\min_\theta\frac1n\sum_{i=1}^n\ell(f_\theta(x_i),y_i)+\lambda\Omega(\theta).

L'entropie croisée est représentative de la classification, l'erreur quadratique de la régression. Répartissez les ensembles d'entraînement, de validation et de test final par entité, vidéo ou période afin d'éviter les doublons et les fuites d'informations futures. Dès que vous examinez l'ensemble de test et modifiez ses paramètres, il devient un ensemble de validation et ne permet plus de mesurer la généralisation.

Diagram 1 · Use the button to switch views
Machine learning lifecycleCollection, audit, training, evaluation, deployment, and monitoring form a feedback loop.collectaudit/splittrain/validatedeploy/evaluatemonitor

Diagramme : Duskcoil, résultat conceptuel plutôt que mesuré.

Échec Cause Réponse
Succès de l'entraînement seul Surapprentissage ou fuite Audit, division et régularisation
Déclin post-déploiement Décalage Surveillance des entrées et réévaluation
Erreurs inégales Déséquilibre des données Évaluation et collecte stratifiées

Évaluation et sécurité

La précision seule est insuffisante pour les risques rares ; examinez la précision, le rappel, l'étalonnage, les performances des sous-groupes, la latence, les données manquantes et le décalage de distribution. Les résultats à haut risque doivent être transmis à une personne ou à un système de repli sûr plutôt que de devenir l'autorité finale.

Vérifiez votre compréhension
Une précision d'entraînement élevée garantit-elle des performances réelles ?

Mesurez la généralisation séparément. Division Les données sont traitées selon les conditions de déploiement afin d'éviter les fuites dues à des sujets répétés ou à des périodes qui se chevauchent.

## Références - [Évaluation du modèle scikit-learn](https://scikit-learn.org/stable/modules/model_evaluation.html) - [Règles de Google pour le ML](https://developers.google.com/machine-learning/guides/rules-of-ml) ## De la définition du problème aux caractéristiques « Prévoir la demande » et « détecter les anomalies » ne constituent pas des spécifications. Définissez qui, quelles informations sont disponibles et à quelle date limite, la date limite et les erreurs acceptables. Une caractéristique enregistrée après la date cible t représente une fuite. Ajustez les statistiques de prétraitement, l'imputation et le vocabulaire uniquement sur les données d'entraînement. La standardisation x'=(x-\mu)/\sigma n'est valide que si les \mu,\sigma sont apprises à partir de l'ensemble d'entraînement. Une base de référence est essentielle : la valeur d'hier, une règle, une régression linéaire ou un petit arbre de décision qu'un modèle complexe ne peut surpasser ne justifient pas les coûts opérationnels. Comparez la disponibilité des caractéristiques, la latence, la taille du modèle, les responsables de la maintenance et les mécanismes de repli en cas d'échec. Même tableau que pour la précision. ## Généralisation, biais et changement Une faible perte empirique n'implique pas une faible perte attendue lors du déploiement (distribution \mathbb E_{(x,y)\sim p_{deploy}}[\ell]). Le décalage des covariables modifie les entrées ; la dérive conceptuelle modifie la signification des étiquettes. Les saisons, les révisions matérielles, les règles d'utilisation, le comportement des utilisateurs et les défaillances des capteurs sont autant de facteurs qui peuvent influencer ces deux éléments. Il est recommandé de procéder à une évaluation stratifiée par période, région, attribut et appareil, plutôt qu'à un test unique. | Évaluation | Question | Facile à manquer | | --- | --- | --- | | Précision | Combien de réponses correctes au total ? | Erreurs de classes rares | | Précision/rappel | Les alertes sont-elles fiables et correctement enregistrées ? | Coût du seuil | | Calibrage | La probabilité correspond-elle à la fréquence ? | Erreurs à haute confiance | | Validation temporelle | Fonctionne-t-il à l'avenir ? | Variations saisonnières et changements de politique | | Tranches d'attributs | Qui reçoit les erreurs ? | Incertitude liée à la petite taille de l'échantillon | ## Déploiement et gestion des pannes Avant le déploiement, validez le schéma d'entrée, les unités, les plages, les données manquantes et les fonctionnalités. Distributions. Déterminez si une sortie inutilisable doit être ramenée à une prédiction antérieure, une règle ou à l'intervention humaine. Surveillez les boucles de rétroaction : les recommandations modifient l'exposition et les détecteurs ajustent la fréquence d'inspection, de sorte que les nouvelles données ne sont pas échantillonnées naturellement. Utilisez des contrats de données, un entraînement versionné et reproductible, un fonctionnement en parallèle, un déploiement progressif, une surveillance des performances, de l'équité et de la latence, ainsi qu'une restauration instantanée. Pour les décisions à haut risque, présentez les preuves, le niveau de confiance et les données manquantes à une personne plutôt que de laisser le modèle faire autorité. 1. Auditez le seuil de prédiction et les fonctionnalités disponibles. 2. Définissez une configuration de référence et un test indépendant. 3. Associez les métriques au coût des erreurs et aux exigences de sécurité. 4. Testez les données manquantes, les décalages et les entrées adverses. 5. Intégrez les seuils de surveillance, l'arrêt et l'approbation du réentraînement dans les opérations. - [Fiches techniques pour les jeux de données](https://arxiv.org/abs/1803.09010) - [Fiches de modèle pour le reporting des modèles](https://arxiv.org/abs/1810.03993) ## Distinguer l'incertitude des décisions La probabilité d'un modèle est Il ne s'agit pas d'une action. Pour une alerte de maintenance, évaluez la probabilité de défaillance en fonction des pertes critiques, des pertes non détectées et du coût d'inspection avant de définir un seuil. Si le taux de défaillance de base change, le seuil optimal doit également être ajusté. Consultez les diagrammes de fiabilité et le score de Brier, et effectuez un étalonnage Platt ou isotonique uniquement sur les données de validation ; mettez à jour le calibrateur avec le modèle. Les intervalles de prédiction et la dispersion de l'ensemble sont utiles, mais ne constituent pas des garanties. Des entrées hors distribution, des défaillances de capteurs et des exemples adverses peuvent compromettre l'estimation de l'incertitude. Transmettez la validité des entrées, l'indicateur OOD, le niveau de confiance et les règles métier sous forme de signaux distincts ; privilégiez une vérification humaine ou une valeur par défaut sécurisée en cas de risque. ## Choix d'un régime d'apprentissage | Régime | Informations sur l'enseignant | Cas approprié | Avertissement d'évaluation | | --- | --- | --- | --- | | Supervisé | Étiquette pour chaque entrée | Classification/régression claire | Qualité et fuite des étiquettes | | Non supervisé | Généralement sans étiquette | Structure et anomalies candidates | Ne pas attribuer de signification après le clustering | | Auto-supervisé | Tâche de substitution à partir des données | Grand nombre de données non étiquetées Corpus | Évaluation en aval et chevauchement | | Semi-supervisé | Peu d'étiquettes et données non étiquetées | Annotation coûteuse | Amplification des erreurs des pseudo-étiquettes | | Renforcement | Récompense et interaction | Décisions séquentielles | Écart du simulateur et exploration sécurisée | Comparer le coût de l'ajout d'étiquettes à celui de la complexification du modèle. Les clusters non supervisés ne correspondent pas automatiquement à des attributs humains, et les pseudo-étiquettes faibles peuvent amplifier les biais. Suivre qui a mesuré chaque étiquette, quand et selon quelle procédure. ### Cas d'échec : la division aléatoire révèle l'avenir La division aléatoire de fenêtres de vibration chevauchantes d'une même machine crée des quasi-doublons dans les ensembles d'entraînement et de test. Un code de maintenance attribué après une panne ou une moyenne calculée sur toute la période divulgue également des informations futures. Diviser par ID machine et par heure, et recalculer les caractéristiques à partir des enregistrements disponibles au moment de la prédiction. Un score plus faible, mais plus réaliste, est plus proche du déploiement qu'un score gonflé par les fuites d'informations. ## Procédure d'implémentation minimale 1. Intégrer les utilisateurs, la cible, le seuil d'observation, l'action et le coût d'erreur dans Un tableau de spécifications. 2. Auditer la provenance, le consentement/les droits, la raison des données manquantes, les unités, la fréquence et la procédure d'étiquetage. 3. Corriger la division groupe/temps dans le code et vérifier automatiquement les hachages dupliqués et les intersections d'identifiants. 4. Conserver les règles et les modèles simples comme références et signaler les intervalles de confiance conditionnels. 5. Enregistrer le prétraitement, le modèle, l'étalonnage et le seuillage dans un seul pipeline ; évaluer les données finales une seule fois. 6. Déploiement progressif, limité et par étapes, tout en surveillant la qualité des données d'entrée, la latence, les refus et les résultats en aval. 7. Documenter le déclencheur de réentraînement, l'approbateur, la version de restauration, la notification d'incident et la condition de mise hors service. Le réentraînement n'est pas une amélioration automatique. Comparer les anciennes et les nouvelles données sur le même ensemble fixe et ajouter un ensemble de test pour les nouvelles périodes et les nouveaux appareils. Examiner conjointement les performances, l'incertitude statistique, le coût de calcul, la sécurité et la charge opérationnelle. - [Cadre de gestion des risques liés à l'IA du NIST](https://www.nist.gov/itl/ai-risk-management-framework) - [Dette technique cachée dans les systèmes d'apprentissage automatique](https://papers.nips.cc/paper/5656-hidden-technical-debt-in-machine-learning-systems)

What to read next

Continue the seriesIntroduction à l'apprentissage automatique : Notions de base des réseaux neuronauxExplore another aspect of this fieldÉvaluation comparative des LLM locaux : temps de réponse initial, taux de génération et mémoireExplore another aspect of this fieldIntroduction à la détection d'objets et à la segmentation sémantique — Interpréter « Qu'est-ce qui est où » à partir d'une image