Contents — find the section you need
La caméra événementielle (capteur de vision dynamique, DVS) est un capteur qui capture la lumière selon une méthode fondamentalement différente de celle des caméras conventionnelles à images fixes, qui photographient la scène entière à intervalles réguliers : chaque pixel fonctionne indépendamment et de manière asynchrone, ne signalant que l’instant où sa luminosité varie de plus d’une valeur prédéfinie, avec une résolution temporelle de l’ordre de la microseconde.
Principe : chaque pixel ne signale que les variations
Un capteur d’image CMOS/CCD conventionnel lit tous les pixels simultanément à chaque intervalle d’exposition et produit les valeurs de luminosité absolue sous forme de grille. À l’inverse, chaque pixel d’une caméra événementielle conserve la valeur logarithmique de luminosité de sa dernière mesure, servant de référence. Dès que la luminosité actuelle s’écarte de cette référence de plus d’un seuil (C), ce pixel déclenche un événement. L'événement correspondant au déclenchement du pixel (x, y) à l'instant t est généré.
dès que cette condition est remplie, la sortie devient une séquence asynchrone de quadruplets e_k = (x_k, y_k, t_k, p_k) (coordonnées, horodatage, polarité). Ce schéma, qui ne produit à chaque fois que des coordonnées et un horodatage, est appelé AER (Représentation Adresse-Événement). Il distingue les variations de luminosité (augmentation : ON ; diminution : OFF) par la polarité p_k. Comme la notion d'image n'existe pas, aucune sortie n'est générée en l'absence de mouvement dans la scène. Plus le mouvement est rapide, plus le nombre d'événements déclenchés est élevé et les intervalles plus courts.
Les deux propriétés fondamentales de ce schéma découlent directement de la conception de son circuit à réponse logarithmique. Le premier avantage est la résolution temporelle : chaque pixel prenant sa décision de seuil indépendamment, les changements peuvent en principe être détectés à la microseconde près – même la première puce DVS, annoncée en 2008 (voir ci-dessous), atteignait une latence de 15 microsecondes. N'étant pas liée à la fréquence d'images, elle élimine le flou de mouvement inhérent aux caméras à images fixes. Le second avantage est la plage dynamique : chaque pixel prenant sa décision de seuil indépendamment sur une échelle logarithmique, alors que les capteurs conventionnels plafonnent à environ 60-70 dB (limite de la capacité du puits de potentiel, soit la charge maximale qu'une photodiode peut accumuler), les capteurs d'événements dépassent les 100 dB, et atteignent même 140 dB pour certains produits. C'est pourquoi, même dans des scènes présentant des contrastes extrêmes entre lumière et obscurité – par exemple, une route ensoleillée et l'entrée d'un tunnel ombragée dans la même scène – les changements peuvent être capturés en continu, sans surexposition des hautes lumières ni excès de noirs.
Il existe deux grandes familles d'implémentation. Il existe le DVS « pur », qui se limite à la détection de changements, comme dans les modules DVS128, iniVation DVXplorer et Prophesee GenX320, et l'approche hybride, comme dans les modules iniVation DAVIS346 et ATIS (décrits ci-dessous), qui ajoute un circuit mesurant la luminosité (niveaux de gris) des pixels où un changement a été détecté, en plus du circuit de détection de changements. Cette dernière approche produit simultanément une sortie d'événements asynchrone et, à faible fréquence d'images, une image en niveaux de gris classique. Elle exploite ainsi les avantages de la détection d'événements tout en restant compatible avec les chaînes de traitement d'images existantes, mais elle hérite de la contrainte selon laquelle la luminosité des pixels inchangés ne peut être mesurée.
Différence entre les données produites par une caméra à images fixes (en haut) et une caméra événementielle (en bas) pour la même scèneImage : Event camera comparison (TimoStoffregen, CC BY-SA 4.0), Wikimedia Commons.
Comme le montre l'image comparative ci-dessus, alors qu'une caméra à images fixes produit une « photographie de la scène entière » à intervalles réguliers, une caméra événementielle ne produit qu'un petit ensemble d'événements dispersés le long des contours en mouvement. Puisqu'un arrière-plan immobile ne produit aucune donnée, on peut dire que le capteur transmet des données débarrassées de la redondance de la scène dès le départ. Pour sa propre solution de vision industrielle événementielle, Prophesee affirme que, dans des applications telles que l'inspection visuelle sur les lignes de production de briques de boissons et les robots de soudage laser, elle peut mesurer des objets se déplaçant à plus de 10 mètres par seconde à une cadence de plus de 1 000 par seconde, tout en réduisant le volume de données à traiter d'environ un centième par rapport aux méthodes conventionnelles basées sur les images. Ceci est une conséquence directe du fait que le capteur ne génère jamais de données pour les pixels qui n'ont pas changé.
Comparaison des spécifications des produits clés
| Produit | Résolution | Plage dynamique | Latence / Résolution temporelle | Remarques |
|---|---|---|---|---|
| iniVation DVXplorer | 640×480 (VGA) | Jusqu'à 110 dB | Latence inférieure à la milliseconde, résolution temporelle de 200 µs | Débit jusqu'à 165 millions d'événements/s, centrale inertielle 6 axes intégrée (gyroscope jusqu'à 3,2 kHz), consommation inférieure à 140 mA sous 5 V |
| iniVation DAVIS346 | 346 × 260 (événements), sortie d'images à la même résolution | 120 dB pour la sortie d'événements, 55 dB pour la sortie d'images | Résolution temporelle de 1 µs et latence inférieure à 1 ms pour les événements, 40 images/s pour les images | Conception hybride permettant la sortie simultanée de la détection de changement et d'images en niveaux de gris. Jusqu'à 12 millions d'événements/s, pas de pixel de 18,5 µm |
| Sony IMX636 (Prophesee Metavision) | 1280 × 720 (0,92 mégapixels) | Plus de 86 dB à 5-100 000 lux, plus de 120 dB avec coupure basse lumière à 0,08-100 000 lux | Réponse rapide et faible latence (les valeurs dépendent de l'application) | Capteur empilé développé conjointement par Sony et Prophesee, pas de pixel de 4,86 µm, sortie parallèle numérique 16 lignes |
| Prophesee GenX320 | 320 × 320 | Plus de 140 dB | Latence de pixel inférieure à 150 µs à 1 000 lux | Consommation réduite à 36 µW en mode ultra basse consommation, pixel de 6,3 × 6,3 µm, format ultra-compact de 3 × 4 mm, suppression du scintillement et contrôle de la fréquence d'événements intégrés |
| Samsung DVS-Gen4 | 1280 × 960 | 100 dB | 150 µs | Avec un pas de pixel de 4,95 µm, cette caméra offre à la fois une haute résolution et une faible consommation d'énergie grâce à la technologie Cu-Cu intégrée et à un circuit de suppression des interférences GIDL. |
Kit d'évaluation de caméra événementielle PropheseeImage : Prophesee Kit d'évaluation de caméra événementielle (Auledas, CC BY 4.0), Wikimedia Commons.
La caméra iniVation DVXplorer possède une résolution équivalente VGA de 640 × 480 et une centrale inertielle (IMU) 6 axes intégrée. C'est une caméra DVS pure, largement utilisée en recherche robotique. La DAVIS346 est une conception hybride intégrant un circuit de détection de changement et une sortie d'images en niveaux de gris sur une seule puce : la sortie événementielle offre une plage dynamique de 120 dB, mais le nombre d'images qu'elle peut produire simultanément est limité à 55 dB et 40 images/s. Ce produit illustre clairement le compromis entre les avantages du DVS pur et la compatibilité avec le traitement par images. La Sony IMX636 combine la technologie de fabrication de capteurs empilés de Sony avec le savoir-faire de Prophesee (présenté ci-dessous) en matière de détection d'événements et, avec une résolution de 1280 × 720, se classe dans la catégorie haute résolution pour une caméra événementielle. Elle a également été intégrée à la série « uEye EVS » annoncée en 2025 par le fabricant de caméras industrielles IDS Imaging Development Systems. La GenX320 offre une résolution légèrement inférieure (320 × 320 pixels), mais dispose d'un mode ultra basse consommation permettant de réduire la consommation à 36 µW. Elle est ainsi conçue pour les dispositifs portables toujours actifs et la détection périphérique dans l'Internet des objets (IoT). La Samsung DVS-Gen4, quant à elle, affiche la plus haute résolution (1280 × 960 pixels). Son procédé de liaison Cu-Cu au sein des pixels (une technique d'empilement qui relie directement le cuivre au cuivre) associé à une conception de circuit qui supprime les fuites de courant induites par la grille (GIDL) permet de limiter l'augmentation du courant de fuite liée à la haute résolution.
D'où vient l'œil électronique : de la rétine en silicium à l'industrie des caméras événementielles
1988, la rétine en silicium à Caltech — L'origine directe de la caméra événementielle remonte à l'article de 1988 intitulé « A Silicon Model of Early Visual Processing », publié par Carver Mead, considéré comme l'un des pères du circuit intégré, en collaboration avec Misha Mahowald, alors doctorant. Les deux chercheurs ont construit une « rétine en silicium » imitant le traitement visuel précoce de la rétine à l'aide de circuits CMOS analogiques, ouvrant ainsi la voie à l'ingénierie neuromorphique : la tentative de reproduire le traitement de l'information par le cerveau grâce à un dispositif matériel. Mead a par la suite reçu un prix pour l'ensemble de sa carrière en ingénierie neuromorphique de la part de Caltech pour ces travaux.
2008, un capteur DVS entièrement asynchrone développé par l'ETH Zurich / Université de Zurich — Patrick Lichtsteiner, Christoph Posch et Tobi Delbrück ont publié dans l'IEEE Journal of Solid-State Circuits l'article intitulé « A 128×128 120 dB 15 μs Latency Asynchronous Temporal Contrast Vision Sensor », présentant un capteur entièrement asynchrone de 128×128 pixels, offrant une plage dynamique de 120 dB et une latence de 15 microsecondes — le prototype de ce que l'on appelle aujourd'hui « DVS ». Cet article, largement cité, se classe au 4e rang des articles les plus cités de la revue au cours de la décennie précédente et est depuis devenu la référence en matière de recherche sur les caméras événementielles.
2011, ATIS combine détection de changement et mesure de luminosité — Christoph Posch rejoint l'Institut autrichien de technologie (AIT) et présente ATIS (capteur d'image asynchrone basé sur le temps). Ce capteur associe un circuit de détection de changement à un circuit mesurant la luminosité réelle (niveau de gris) en temps réel, mais uniquement pour les pixels ayant subi une modification. ATIS atteint une plage dynamique supérieure à 143 dB et, répondant au besoin concret de détecter non seulement les changements, mais aussi les images, il constitue la base technique du DAVIS et d'autres produits hybrides.
2014, création de Chronocam et de deux spin-offs de l'ETH Zurich/Université de Zurich — En 2014, Posch fonde Chronocam avec Ryad Benosman, Bernard Gilly et Luca Verre au sein de l'incubateur parisien iBionext, avec pour objectif de commercialiser la technologie ATIS développée à l'AIT. Chronocam devient Prophesee en 2018, suite à une levée de fonds de série B de 19 millions de dollars. Parallèlement, quatre personnes issues de l'Institut de neuroinformatique (INI) de l'Université de Zurich/ETH Zurich, qui avait développé le DVS128, — Tobi Delbrück, Rodney Douglas, Kynan Eng et Sven-Erik Jacobsen — ont créé iniVation en 2015, et une autre équipe a fondé SynSense en 2017. Ces deux entreprises, partageant le même institut, ont fusionné en 2024 lorsque SynSense a acquis la totalité des parts d'iniVation. En Chine, CelePixel, basée à Shanghai, a été fondée en 2017 par Chen Shoushun et d'autres, puis rachetée en 2019 par Will Semiconductor, maison mère d'OmniVision. Enfin, en 2020, Sony a mis en commun sa technologie de fabrication de capteurs d'image empilés et le savoir-faire de Prophesee en matière de détection d'événements pour développer conjointement le capteur IMX636 mentionné précédemment. Une technologie de niche issue d'un laboratoire de neurosciences, qui, en un peu plus d'une décennie, aboutit à un partenariat avec un grand fabricant de capteurs d'image comme Sony : tel est le parcours de ce capteur jusqu'à présent.
Un exemple concret : le système de caméras stéréo « DSEC » testé à Zurich
Les caméras événementielles ne sont pas encore intégrées aux chaînes de production des constructeurs automobiles, mais il existe des prototypes à plusieurs unités, en phase de recherche et développement. Le jeu de données DSEC (A Stereo Event Camera Dataset for Driving Scenarios), publié en 2021 par le groupe Robotique et Perception de l'ETH Zurich/Université de Zurich, a été collecté à l'aide d'un véhicule équipé d'un système stéréo composé de deux caméras événementielles Prophesee Gen3.1 (640 × 480) montées de part et d'autre avec une base de 60 cm. Ce système était synchronisé avec deux caméras couleur FLIR Blackfly S, un LiDAR et un GPS RTK. Le véhicule a ainsi parcouru plusieurs villes suisses, dont Zurich, Thoune et Interlaken, afin de collecter plus d'une heure de données de conduite. Ce système est remarquable car il a été spécifiquement conçu pour capturer des scènes à grande gamme dynamique, là où les caméras standard atteignent souvent leurs limites en matière de contrôle d'exposition (entrées et sorties de tunnels, fort contre-jour au lever et au coucher du soleil). De plus, à l'instar des systèmes monoculaires, il est conçu avec une large base de référence en stéréo, afin de garantir la précision de la disparité à grande distance et de vérifier si la caméra d'événement continue de capturer les changements, même dans des scènes où la caméra principale sature les hautes lumières ou sous-expose les noirs. DSEC reste aujourd'hui une référence pour la recherche sur la robustesse des algorithmes d'auto-localisation tels que Visual-SLAM dans des environnements à faible luminosité, où les caméras ordinaires rencontrent des difficultés.
DSEC ## Recherche sur la reconnaissance faciale dans des séquences vidéo saturées de bruit et SLAM embarqué sur un drone
Un jeu de données de détection faciale sur des flux d'événements, développé au Kazakhstan — L'ISSAI (Institut des systèmes intelligents et de l'intelligence artificielle) de l'Université Nazarbayev a publié en 2024 l'article « Faces in Event Streams (FES) : un jeu de données de visages annotés pour caméras événementielles », par Bissarinova, Rakhimzhanova, Kenzhebalin et Varol, dans la revue Sensors (volume 24, numéro 5, article 1409). Premier jeu de données à grande échelle de ce type, il annote 1,6 million de visages et cinq points de repère faciaux sur 689 minutes de flux d'événements. Les douze modèles associés détectent les visages et les points de repère faciaux avec une précision supérieure à 90 % (mAP50). L'image ci-dessous est l'image de couverture de son dépôt GitHub. Elle montre les visages et les silhouettes de plusieurs personnes émergeant par accumulation d'événements d'une séquence vidéo qui, autrement, ne ressemblerait qu'à un simple bruit de points. Le principe même de la caméra événementielle — à savoir que rien n'est enregistré en l'absence de mouvement — produit des images composées uniquement de contours et de mouvements, sans texture photographique. Ses applications potentielles dans le domaine de la surveillance et du contrôle respectueux de la vie privée ont également été soulignées.
Visages et cadres de détection émergeant dans un flux d'événements (image de couverture du jeu de données FES)Image : Faces dans Event Streams (Ulzhanbis, CC BY 4.0), Wikimedia Commons. Image de couverture GitHub pour l'article sur le jeu de données FES par l'ISSAI (Université Nazarbayev) (Bissarinova et al., Sensors 2024, 24(5):1409).
SLAM événementiel stéréo embarqué sur un drone et expérience d'esquive d'« objets lancés » — C'est en robotique que la faible latence et la plage dynamique élevée de la caméra événementielle sont les plus avantageuses. L'article « AERO-VIS : SLAM visuel-inertiel embarqué en temps réel et asynchrone basé sur les événements » (arXiv:2605.07885), publié en mai 2026, combine une caméra stéréo événementielle avec une centrale inertielle (IMU), implémente un détecteur de caractéristiques qui traite le flux d'événements de manière asynchrone, et rapporte avoir atteint une précision supérieure à celle des systèmes SLAM événementiels conventionnels, grâce à son intégration sur un drone (véhicule aérien sans pilote) et son exécution embarquée. Par ailleurs, le groupe Robotique et Perception de l'Université de Zurich, dirigé par Davide Scaramuzza, rapporte qu'une expérience menée avec un quadricoptère évitant des obstacles à l'aide d'une simple caméra événementielle monoculaire a permis de détecter les objets entrants avec une probabilité de 81 à 97 % en 3,5 millisecondes, et d'esquiver des objets lancés à 3 mètres de distance à 10 mètres par seconde avec une probabilité supérieure à 90 %. Le même groupe indique également que l'utilisation de caméras événementielles pourrait décupler la vitesse de vol des drones. Des recherches sont en cours pour déterminer la portée de la perception permise par ces caméras à des vitesses que les caméras classiques ne peuvent, par principe, suivre.
Paramètres déterminant les performances
- Compromis résolution/bande passante : La résolution 320 × 320 du GenX320 privilégie une faible consommation d'énergie pour les applications embarquées et portables, tandis que les résolutions 1280 × 960 du Samsung DVS-Gen4 et 1280 × 720 du Sony IMX636 sont destinées à des applications haute fidélité. Cependant, comme une caméra événementielle génère davantage d'événements lorsque le mouvement est rapide et que la résolution est élevée, la bande passante requise pour le traitement en aval augmente également de façon plus marquée ; un point qui diffère de la conception classique de la fréquence d'images.
- Plage dynamique : Comparée aux plus de 140 dB de la GenX320 et aux plus de 120 dB de l'IMX636 (avec coupure en basse lumière), la Samsung DVS-Gen4 est légèrement plus modeste avec 100 dB. Dans des applications comme la DSEC, où les scènes à grande gamme dynamique (tunnels, contre-jours, etc.) sont cruciales, cette valeur détermine directement l'utilisabilité pratique.
- Latence / résolution temporelle : Alors que le DVS128 de 2008 atteignait déjà 15 microsecondes, la latence du GenX320 et du Samsung DVS-Gen4 est annoncée à environ 150 microsecondes à 1 000 lux. Attention toutefois, car il ne s'agit pas d'une simple amélioration d'une génération à l'autre, mais d'une valeur déterminée par un compromis entre les conditions d'éclairage et la conception du circuit de traitement (par exemple, la priorité accordée à la très faible consommation).
- Seuil de contraste : Comme pour le seuil nominal de 25 % du GenX320, le réglage du seuil de détection des variations de luminosité représente un compromis entre bruit et sensibilité. Abaisser le seuil permet de détecter même des variations infimes, au prix d'un bruit accru. Augmenter la puissance réduit le bruit, mais peut entraîner la perte de certaines variations rapides.
- Consommation électrique : Comparée à la DVXplorer (moins de 140 mA à 5 V, soit environ 700 mW), la GenX320 affiche une consommation ultra-basse de 36 µW en mode ultra-basse consommation. Des produits présentant des différences de près de quatre ordres de grandeur coexistent au sein de la même catégorie de « caméra événementielle ». Le choix du produit dépend entièrement de l’utilisation prévue : surveillance continue sur un appareil portable/IoT ou montage sur un robot pour le traitement rapide d’un grand nombre d’événements.
- DVS pur ou hybride : Un modèle hybride comme la DAVIS346, capable également de produire simultanément des images en niveaux de gris, présente l’avantage de réutiliser directement un pipeline de reconnaissance d’images existant. Cependant, sa résolution à 55 dB/40 images/s est inférieure aux performances de la sortie événementielle seule. Le DVS pur (DVXplorer, GenX320 et autres) sacrifie la compatibilité avec les pipelines existants au profit d'une exploitation optimale des événements.
Comment un objet immobile apparaît-il à une caméra événementielle ?
Les événements réagissent aux variations de luminosité.
Sans modification, l'apparence statique n'est pas rafraîchie en continu comme dans les images conventionnelles. ## Références - [Capteur de vision à contraste temporel asynchrone 128×128, 120 dB, latence de 15 µs (IEEE JSSC, Lichtsteiner, Posch, Delbrück, 2008)](https://www.researchgate.net/publication/2983746_A_128_128_120_dB_15_ms_Latency_Asynchronous_Temporal_Contrast_Vision_Sensor) - [Caméra événementielle à capteur de vision dynamique (Groupe Capteurs de l'Université de Zurich)](http://sensors.ini.uzh.ch/sensors-21.html) - [Commentaire sur « Un modèle silicium du traitement visuel précoce » (Histoire de l'information)](https://historyofinformation.com/detail.php?id=3871) - [Démonstration en direct : Caméra à capteur d'image temporel asynchrone (ATIS) avec processeur AE entièrement personnalisé (Posch et al.)](https://ieeexplore.ieee.org/document/5537265/) - [Présentation de Prophesee (anciennement Chronocam) et de son histoire] iBionext](https://www.prophesee.ai/2018/02/21/prophesee-19-million-funding-round/) - [Historique de la spin-off iniVation (Institut de neuroinformatique, UZH)](https://www.ini.uzh.ch/en/institute/spin-offs.html) - [Acquisition d'iniVation par SynSense (Région de Zurich)](https://www.greaterzuricharea.com/en/news/synsense-acquires-inivation) - [Acquisition de Celepixel (DVS) par Will Semiconductor (Image Sensors World)](http://image-sensors-world.blogspot.com/2020/09/dvs-company-celepixel-acquired-by-will.html) - [Fiche technique iniVation DVXplorer](https://docs.inivation.com/_static/hardware_guides/dvxplorer.pdf) - [Fiche technique iniVation DAVIS346](https://docs.inivation.com/_static/hardware_guides/davis346.pdf) - [Informations produit Sony/Prophesee IMX636](https://www.prophesee.ai/event-based-sensor-imx636-sony-prophesee/) - [Annonce de la série IDS uEye EVS (Prophesee)](https://www.prophesee.ai/2025/03/05/ids-launches-new-industrial-camera-series-featuring-prophesee-event-based-metavision-sensing-and-processing-technologies/) - Informations produit Prophesee GenX320 - Documentation technique sur Samsung DVS-Gen4 (Samsung, atelier CVPR2019) - DSEC : un jeu de données de caméras événementielles stéréo pour les scénarios de conduite (arXiv:2103.06011) - Page du projet DSEC (Université de Zurich) - Faces in Event Streams (FES) : un jeu de données de visages annotés pour les caméras événementielles (ISSAI) - Article sur Faces in Event Streams (PMC) - AERO-VIS : SLAM visuel-inertiel embarqué temps réel asynchrone basé sur les événements (arXiv:2605.07885)](https://arxiv.org/abs/2605.07885) - [Vol agile de drone (Groupe de robotique et de perception de l'Université de Zurich)](https://rpg.ifi.uzh.ch/aggressive_flight.html) - [Un drone détecte et évite les obstacles en quelques millisecondes grâce à des caméras événementielles (The Robot Report)](https://www.therobotreport.com/drone-detects-and-avoids-obstacles-in-just-milliseconds-event-cameras/) - [Fichier : Comparaison de caméras événementielles.jpg (Wikimedia Commons)](https://commons.wikimedia.org/wiki/File:Event_camera_comparison.jpg) - [Fichier : Kit d'évaluation de caméras événementielles Prophesee.jpg (Wikimedia Commons)](https://commons.wikimedia.org/wiki/File:Prophesee_Event_Camera_Evaluation_Kit.jpg) - [Fichier : Visages dans les flux d'événements.png (Wikimedia Commons)](https://commons.wikimedia.org/wiki/File:Faces_in_Event_Streams.png)
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.