Contents — find the section you need
La telecamera a eventi (Dynamic Vision Sensor, DVS) è un sensore che cattura la luce con un metodo fondamentalmente diverso dalle telecamere convenzionali basate su frame, che fotografano l'intera scena a intervalli fissi: ogni pixel opera in modo indipendente e asincrono rispetto agli altri, segnalando solo l'istante in cui la propria luminosità cambia di oltre una determinata soglia, con una risoluzione temporale dell'ordine dei microsecondi.
Principio: ogni pixel segnala in modo indipendente solo la "variazione"
Un sensore di immagine CMOS/CCD convenzionale legge tutti i pixel simultaneamente a ogni intervallo di esposizione e restituisce i valori assoluti di luminosità come un frame a griglia. I pixel di una telecamera a eventi, al contrario, memorizzano ciascuno il valore logaritmico di luminosità dell'ultima volta che quel pixel ha segnalato un valore come riferimento, e nell'istante in cui il valore logaritmico di luminosità corrente cambia rispetto a tale riferimento di oltre una soglia C, quel singolo pixel genera un "evento". L'evento che il pixel (x, y) si attiva all'istante t viene generato
nell'istante in cui questa condizione è soddisfatta, e l'output diventa una sequenza asincrona di 4-uple e_k = (x_k, y_k, t_k, p_k) (coordinate, timestamp, polarità). Questo schema di output, che prevede solo coordinate e timestamp per ogni evento, è chiamato AER (Address-Event Representation) e distingue le variazioni di luminosità (ON) da quelle di luminosità (OFF) tramite la polarità p_k. Poiché il concetto di frame non esiste, non viene emesso nulla in assenza di movimento nella scena e, maggiore è la velocità del movimento, maggiore è il numero di eventi generati a intervalli più brevi.
Le due proprietà distintive di questo schema derivano direttamente dalla progettazione del circuito a risposta logaritmica. La prima caratteristica è la risoluzione temporale: poiché ogni pixel prende la sua decisione di soglia in modo indipendente, i cambiamenti possono in linea di principio essere rilevati nell'ordine dei microsecondi – persino il primo chip DVS annunciato nel 2008 (di cui si parlerà più avanti) raggiungeva una latenza di 15 microsecondi. Non essendo legato al concetto di frame rate, non si verifica, in linea di principio, la sfocatura da movimento che le telecamere basate su frame rate non possono evitare. La seconda caratteristica è la gamma dinamica: poiché ogni pixel prende la sua decisione di soglia in modo indipendente su una scala logaritmica, mentre i sensori convenzionali raggiungono un massimo di circa 60-70 dB, limitati dalla capacità del pozzo (il limite superiore della carica che un fotodiodo può accumulare), i sensori di eventi superano i 100 dB e in alcuni prodotti raggiungono i 140 dB. Questo è il motivo per cui, anche in scene con differenze estreme tra luce e ombra – ad esempio, una superficie stradale illuminata dal sole e l'ingresso di una galleria in ombra che coesistono nella stessa scena – i cambiamenti possono essere catturati in modo continuo senza sovraesposizioni o sottoesposizioni.
Esistono sostanzialmente due famiglie di implementazione. Esiste il "DVS puro", che esegue solo il rilevamento delle variazioni, come nel caso di DVS128, iniVation DVXplorer e Prophesee GenX320, e l'approccio ibrido, come in iniVation DAVIS346 e ATIS (di cui si parlerà più avanti), che aggiunge un circuito che misura anche il valore di luminosità effettivo (scala di grigi) solo per i pixel in cui è stata rilevata una variazione, oltre al circuito di rilevamento delle variazioni. Quest'ultimo approccio produce sia un output di eventi asincrono sia, a una bassa frequenza di fotogrammi, un'immagine convenzionale in scala di grigi contemporaneamente, il che consente di sfruttare i vantaggi degli eventi pur rimanendo compatibile con le pipeline di elaborazione delle immagini esistenti, ma eredita anche la limitazione che non è possibile ottenere un valore di luminosità dai pixel che non hanno subito variazioni.
La differenza tra i dati prodotti da una telecamera a fotogrammi fissi (in alto) e da una event camera (in basso) della stessa scenaImmagine: Event camera comparison (TimoStoffregen, CC BY-SA 4.0), Wikimedia Commons.
Come mostra l'immagine comparativa qui sopra, mentre una telecamera a fotogrammi fissi produce una "fotografia dell'intera scena" a intervalli fissi, una event camera produce solo un gruppo sparso di eventi sparsi lungo i contorni in movimento. Poiché uno sfondo statico non produce alcun dato, si può anche descrivere il sensore come se trasmettesse dati eliminando fin dall'inizio la ridondanza della scena. Per la sua visione industriale basata sugli eventi, Prophesee afferma che in applicazioni come l'ispezione visiva su linee di produzione di cartoni per bevande e robot di saldatura laser, è in grado di misurare oggetti che si muovono a velocità superiori a 10 metri al secondo a una frequenza di oltre 1.000 al secondo, riducendo al contempo il volume di dati da elaborare a circa un centesimo rispetto ai metodi convenzionali basati su fotogrammi: una diretta conseguenza del fatto che il sensore non genera mai dati per i "pixel che non sono cambiati".
Confronto delle specifiche dei prodotti principali
| Prodotto | Risoluzione | Gamma dinamica | Latenza / Risoluzione temporale | Note |
|---|---|---|---|---|
iniVation DVXplorer | 640×480 (VGA) | Fino a 110 dB | Latenza inferiore al millisecondo, risoluzione temporale di 200 µs | Throughput fino a 165 milioni di eventi/sec, IMU a 6 assi integrata (giroscopio fino a 3,2 kHz), consumo inferiore a 140 mA a 5 V |
iniVation DAVIS346 | 346×260 (eventi), uscita frame alla stessa risoluzione | 120 dB per l'uscita eventi, 55 dB per l'uscita frame | Risoluzione temporale di 1 µs e latenza inferiore a 1 ms per gli eventi, 40 fps per i frame | Design ibrido che emette simultaneamente rilevamento del cambiamento e frame in scala di grigi. Fino a 12 milioni di eventi/sec, pixel pitch di 18,5 µm |
Sony IMX636 (Prophesee Metavision) | 1280×720 (0,92 megapixel) | Oltre 86 dB a 5-100.000 lux, oltre 120 dB con soglia di luminosità a 0,08-100.000 lux | Risposta rapida e a bassa latenza (i valori dipendono dall'applicazione) | Sensore stacked sviluppato congiuntamente da Sony e Prophesee, passo pixel di 4,86 µm, uscita parallela completamente digitale a 16 linee |
Prophesee GenX320 | 320×320 | Oltre 140 dB | Latenza pixel inferiore a 150 µs a 1000 lux | Consumo energetico riducibile a 36 µW in modalità a bassissimo consumo, pixel da 6,3×6,3 µm, package ultracompatto da 3×4 mm, soppressione dello sfarfallio e controllo della frequenza eventi integrati |
Samsung DVS-Gen4 | 1280×960 | 100 dB | 150 µs | Pixel pitch di 4,95 µm, che garantisce alta risoluzione e basso consumo energetico grazie al collegamento Cu-Cu in-pixel e a un circuito di soppressione GIDL.
Un kit di valutazione della telecamera di eventi PropheseeImmagine: Prophesee Event Camera Evaluation Kit (Auledas, CC BY 4.0), Wikimedia Commons.
La iniVation DVXplorer ha una risoluzione equivalente VGA di 640×480 e un'IMU a 6 assi integrata, ed è una telecamera DVS pura ampiamente utilizzata nella ricerca robotica. Il DAVIS346 è un design ibrido che integra su un singolo chip sia un circuito di rilevamento del cambiamento che un'uscita di frame in scala di grigi: l'uscita eventi stessa offre una gamma dinamica di 120 dB, ma i frame che può emettere simultaneamente sono limitati a 55 dB e 40 fps. Questo prodotto dimostra chiaramente che i vantaggi del DVS puro e la compatibilità con l'elaborazione basata su frame sono in un rapporto di compromesso. Il Sony IMX636 combina la tecnologia di produzione di sensori impilati di Sony con il know-how di Prophesee (di cui si parlerà più avanti) nel rilevamento degli eventi e, con una risoluzione di 1280×720, rientra nella categoria ad alta risoluzione per una event camera. È stata adottata anche nella serie "uEye EVS" che il produttore di telecamere industriali IDS Imaging Development Systems ha annunciato nel 2025. La GenX320 ha una risoluzione leggermente inferiore, pari a 320×320, ma dispone di una modalità a bassissimo consumo energetico che può ridurre i consumi a 36 µW, rendendola ideale per dispositivi indossabili always-on e per il rilevamento edge per l'IoT. La Samsung DVS-Gen4 ha il numero di pixel più elevato, pari a 1280×960, e il suo bonding Cu-Cu in-pixel (una tecnica di impilamento che unisce direttamente il rame al rame) insieme a un design del circuito che sopprime il GIDL (Gate-Induced Drain Leakage) limita l'aumento della corrente di dispersione che si verifica con una risoluzione più elevata.
Da dove proviene l'occhio elettronico: dalla retina di silicio all'industria delle event camera
1988, la retina di silicio al Caltech — L'origine diretta della event camera risale all'articolo del 1988 "A Silicon Model of Early Visual Processing", pubblicato da Carver Mead, considerato uno dei padri del circuito integrato, insieme a Misha Mahowald, all'epoca studente laureato. I due realizzarono una "retina di silicio" che simulava l'elaborazione visiva iniziale della retina utilizzando circuiti CMOS analogici, aprendo così la strada al campo dell'"ingegneria neuromorfica", ovvero il tentativo di riprodurre l'elaborazione delle informazioni del cervello tramite hardware. Mead ricevette in seguito un premio alla carriera per l'ingegneria neuromorfica dal Caltech per questo lavoro.
Nel 2008, un DVS completamente asincrono sviluppato presso l'ETH di Zurigo / Università di Zurigo — Patrick Lichtsteiner, Christoph Posch e Tobi Delbrück pubblicarono "A 128×128 120 dB 15 μs Latency Asynchronous Temporal Contrast Vision Sensor" sull'IEEE Journal of Solid-State Circuits, dimostrando un sensore completamente asincrono con 128×128 pixel, 120 dB di gamma dinamica e una latenza di 15 microsecondi: il prototipo di quello che oggi viene chiamato "DVS". L'articolo è stato citato così ampiamente da classificarsi al quarto posto per numero di citazioni nel decennio precedente in quella rivista, ed è diventato di fatto il punto di partenza per la ricerca sulle event camera.
2011, ATIS combina il rilevamento del cambiamento con la misurazione della luminosità — Christoph Posch si trasferì all'Istituto Austriaco di Tecnologia (AIT) e presentò ATIS (Asynchronous Time-based Image Sensor), che combinava un circuito di rilevamento del cambiamento con un circuito che misurava anche la luminosità effettiva (valore in scala di grigi) nel tempo, ma solo per i pixel in cui veniva rilevato un cambiamento. ATIS raggiunse una gamma dinamica superiore a 143 dB e, in quanto progetto che rispondeva all'esigenza applicativa reale di "non solo rilevare cambiamenti, ma anche immagini", divenne la base tecnica per il successivo DAVIS e altri prodotti ibridi.
2014, viene fondata Chronocam e nascono due spin-off dell'ETH/Università di Zurigo — Nel 2014, Posch fondò Chronocam insieme a Ryad Benosman, Bernard Gilly e Luca Verre all'interno dello studio di startup parigino iBionext, con l'obiettivo di commercializzare la tecnologia ATIS sviluppata all'AIT. Nel 2018 Chronocam ha cambiato nome in Prophesee, in concomitanza con un round di finanziamento di Serie B da 19 milioni di dollari. Nel frattempo, dall'Istituto di Neuroinformatica (INI) dell'Università di Zurigo/ETH di Zurigo, che aveva sviluppato DVS128, quattro persone – Tobi Delbrück, Rodney Douglas, Kynan Eng e Sven-Erik Jacobsen – hanno dato vita a iniVation nel 2015, e un team separato ha creato SynSense nel 2017. Queste due società, condividendo lo stesso istituto come fonte comune, si sono riunite nel 2024 quando SynSense ha acquisito tutte le azioni di iniVation. In Cina, CelePixel, con sede a Shanghai, è stata fondata nel 2017 da Chen Shoushun e altri, ed è stata acquisita nel 2019 da Will Semiconductor, la società madre di OmniVision. Nel 2020, Sony ha unito la sua tecnologia di produzione di sensori di immagine multistrato e Prophesee il suo know-how nel rilevamento di eventi in uno sforzo di sviluppo congiunto, che ha portato alla commercializzazione del sensore IMX636 menzionato in precedenza. Una tecnologia di nicchia nata in un laboratorio di neuroscienze, arrivata in poco più di un decennio al punto di collaborare con un importante produttore di sensori di immagine come Sony: questa è la storia di questo sensore fino ad ora.
Un esempio concreto: il sistema di telecamere stereoscopiche per eventi "DSEC" che ha attraversato Zurigo
Le telecamere per eventi non sono ancora sensori utilizzati nelle linee di produzione di massa delle case automobilistiche, ma esistono esempi di sistemi multi-unità che rappresentano un passo avanti, nella fase di ricerca e sviluppo. Il dataset DSEC (A Stereo Event Camera Dataset for Driving Scenarios), pubblicato nel 2021 dal gruppo di Robotica e Percezione dell'ETH di Zurigo/Università di Zurigo, è stato raccolto con un veicolo dotato di un sistema stereo composto da due telecamere di eventi Prophesee Gen3.1 (640×480) montate a sinistra e a destra con una base di 60 cm, sincronizzate con due telecamere a colori FLIR Blackfly S, LiDAR e RTK-GPS, durante un percorso attraverso diverse città svizzere, tra cui Zurigo, Thun e Interlaken, per raccogliere oltre un'ora di dati di guida. È degno di nota il fatto di essere stato registrato specificamente per riprendere scene ad alta gamma dinamica (HDR) in cui le telecamere standard tendono a raggiungere i limiti del controllo dell'esposizione, come ingressi e uscite di gallerie o forti controluce al tramonto e all'alba. Inoltre, proprio come nelle configurazioni monoculari, è stato progettato con un'ampia base di riferimento anche in stereo, per garantire la precisione della disparità a distanze considerevoli e per verificare se la telecamera di evento è in grado di continuare a catturare i cambiamenti anche in scene in cui la telecamera principale sovraespone le alte luci o sovraespone le ombre. Come base per la ricerca su come algoritmi di autolocalizzazione come Visual-SLAM possano essere eseguiti in modo robusto in ambienti con scarsa illuminazione, in cui le telecamere tradizionali faticano, DSEC continua a essere un punto di riferimento ancora oggi.
Ricerca sulla lettura dei volti in filmati che sembrano solo rumore e SLAM in esecuzione a bordo di un UAV
Un dataset per il rilevamento dei volti in flussi di eventi, dal Kazakistan — L'ISSAI (Istituto di Sistemi Intelligenti e Intelligenza Artificiale) dell'Università Nazarbayev ha pubblicato l'articolo "Faces in Event Streams (FES): An Annotated Face Dataset for Event Cameras", di Bissarinova, Rakhimzhanova, Kenzhebalin e Varol, sulla rivista Sensors (Volume 24, Numero 5, articolo numero 1409) nel 2024. Si tratta del primo dataset su larga scala di questo tipo, che annota 1,6 milioni di volti e 5 punti di riferimento facciali su 689 minuti di flussi di eventi, e i 12 modelli associati rilevano volti e punti di riferimento facciali con una precisione superiore al 90% a mAP50. L'immagine qui sotto è l'immagine di copertina del repository GitHub, e mostra i volti e i contorni di diverse persone che emergono come accumuli di eventi da un filmato che altrimenti sembrerebbe solo rumore puntinato. Il principio stesso della event camera – ovvero che nulla che non sia in movimento venga registrato – produce filmati di "soli contorni e movimento" senza texture fotografica, e sono state evidenziate le sue potenziali applicazioni in casi d'uso di sorveglianza e monitoraggio sensibili alla privacy.
Volti e riquadri di rilevamento che emergono in un flusso di eventi (immagine di copertina del dataset FES)Immagine: Faces in Event Streams (Ulzhanbis, CC BY 4.0), Wikimedia Commons. Immagine di copertina di GitHub per l'articolo sul dataset FES di ISSAI (Nazarbayev University) (Bissarinova et al., Sensors 2024, 24(5):1409).
SLAM di eventi stereo in esecuzione a bordo di un UAV e un esperimento per schivare "oggetti lanciati" — La robotica è il campo in cui la bassa latenza e l'elevata gamma dinamica della telecamera di eventi si rivelano più utili. L'articolo "AERO-VIS: Asynchronous Event-based Real-time Onboard Visual-Inertial SLAM" (arXiv:2605.07885), pubblicato a maggio 2026, combina una telecamera stereo per eventi con un'IMU, implementa un rilevatore di caratteristiche che elabora il flusso di eventi mantenendolo asincrono e dichiara di aver raggiunto un'accuratezza che il SLAM convenzionale basato su eventi non poteva eguagliare, montandolo su un UAV (veicolo aereo senza pilota) e facendolo funzionare a bordo. Separatamente, il gruppo di Robotica e Percezione dell'Università di Zurigo, guidato da Davide Scaramuzza, riporta che in un esperimento con un quadricottero che evitava gli ostacoli affidandosi esclusivamente a una telecamera monoculare per eventi, questo ha rilevato oggetti in arrivo con una probabilità dell'81-97% entro 3,5 millisecondi ed è riuscito a schivare oggetti lanciati da 3 metri di distanza a 10 metri al secondo con una probabilità superiore al 90%. Lo stesso gruppo afferma inoltre che l'utilizzo di event camera potrebbe aumentare la velocità di volo dei droni fino a 10 volte, e la ricerca su quanto le event camera possano effettivamente estendere la percezione a velocità che le telecamere basate su frame non sono in linea di principio in grado di raggiungere è tuttora in corso.
Parametri che determinano le prestazioni
- Il compromesso tra risoluzione e larghezza di banda: la risoluzione 320×320 del GenX320 è un design che privilegia il basso consumo energetico per l'utilizzo in ambienti edge e indossabili, mentre le risoluzioni 1280×960 del Samsung DVS-Gen4 e 1280×720 del Sony IMX636 sono pensate per applicazioni ad alta fedeltà. Tuttavia, poiché una event camera genera più eventi quanto più veloce è il movimento, tanto più alta è la risoluzione, tanto più forte è il picco di larghezza di banda richiesto dall'elaborazione a valle, un punto che differisce dal modo convenzionale di pensare alla frequenza dei fotogrammi.
- Gamma dinamica: rispetto agli oltre 140 dB di GenX320 e agli oltre 120 dB di IMX636 (con cutoff in condizioni di scarsa illuminazione), Samsung DVS-Gen4 è un po' più modesta con 100 dB. In applicazioni come DSEC, dove le scene ad alta gamma dinamica come tunnel e controluce sono il principale campo di battaglia, questo valore determina direttamente se è praticamente utilizzabile.
- Latenza / risoluzione temporale: mentre il DVS128 del 2008 aveva già raggiunto i 15 microsecondi, la latenza del GenX320 e del Samsung DVS-Gen4 si aggira intorno ai 150 microsecondi a 1000 lux: qui è necessaria cautela, poiché non si tratta di una semplice corsa al miglioramento da una generazione all'altra, ma di un valore determinato da un compromesso con le condizioni di illuminazione e la politica di progettazione del circuito di elaborazione (come ad esempio se viene data priorità al consumo energetico ultra-basso).
- Soglia di contrasto: come per la soglia nominale del 25% del GenX320, l'impostazione della soglia che rileva una variazione di luminosità come evento è di per sé un compromesso tra rumore e sensibilità. Abbassando la soglia si rilevano anche minime variazioni a costo di un maggior numero di eventi di rumore; Alzando il livello si riduce il rumore ma si perdono alcuni cambiamenti rapidi.
- Consumo energetico: Rispetto ai meno di 140 mA a 5 V (circa 700 mW) del DVXplorer, la modalità a bassissimo consumo del GenX320 è di 36 µW: prodotti che differiscono di quasi quattro ordini di grandezza coesistono nella stessa categoria di "event camera". Che si tratti di un utilizzo indossabile/IoT sempre attivo o di un montaggio su un robot per elaborare grandi volumi di eventi ad alta velocità, cambia completamente il prodotto da scegliere.
- DVS puro o ibrido: Un tipo ibrido come il DAVIS346, che può anche emettere simultaneamente fotogrammi in scala di grigi, ha la comodità di riutilizzare direttamente una pipeline di riconoscimento delle immagini esistente, ma la sua uscita di fotogrammi a 55 dB/40 fps è inferiore a quella che è in grado di fare l'uscita eventi stessa. Il DVS puro (DVXplorer, GenX320 e altri) sacrifica la compatibilità con le pipeline esistenti in cambio della possibilità di sfruttare appieno i vantaggi degli eventi.
Come appare un oggetto statico a una telecamera a eventi?
Gli eventi rispondono alle variazioni di luminosità.
Senza modifiche, l'aspetto statico non viene aggiornato continuamente come avviene nei frame convenzionali.Riferimenti
- Un sensore di visione a contrasto temporale asincrono 128×128 120 dB 15 µs di latenza (IEEE JSSC, Lichtsteiner, Posch, Delbrück, 2008)
- Camera a eventi con sensore di visione dinamica (Gruppo Sensori dell'Università di Zurigo)
- Commento su un modello al silicio dell'elaborazione visiva iniziale (Storia dell'informazione)
- Dimostrazione dal vivo: telecamera con sensore di immagine asincrono basato sul tempo (ATIS) con processore AE completamente personalizzato (Posch et al.)
- [Panoramica di Prophesee] (precedentemente Chronocam) e la storia della sua fondazione presso iBionext](https://www.prophesee.ai/2018/02/21/prophesee-19-million-funding-round/)
- Storia dello spin-off iniVation (Istituto di Neuroinformatica, UZH)
- Acquisizione di iniVation da parte di SynSense (Area metropolitana di Zurigo)
- Acquisita l'azienda DVS Celepixel da Will Semiconductor (Image Sensors World)
- Scheda tecnica di iniVation DVXplorer
- Scheda tecnica di iniVation DAVIS346
- Informazioni sul prodotto Sony/Prophesee IMX636 )
- Annuncio della serie IDS uEye EVS (Prophesee)
- Informazioni sul prodotto Prophesee GenX320
- Materiale tecnico su Samsung DVS-Gen4 (Samsung, workshop CVPR2019)
- DSEC: un dataset di telecamere di eventi stereo per scenari di guida (arXiv:2103.06011)
- Pagina del progetto DSEC (Università di Zurigo)
- Faces in Event Streams (FES): un dataset di volti annotati per telecamere di eventi (ISSAI)
- [Articolo su Faces in Event Streams] (PMC)](https://pmc.ncbi.nlm.nih.gov/articles/PMC10935361/)
- AERO-VIS: SLAM visivo-inerziale di bordo asincrono basato su eventi in tempo reale (arXiv:2605.07885)
- Volo agile del drone (Gruppo di robotica e percezione dell'Università di Zurigo)
- Il drone rileva ed evita gli ostacoli in millisecondi grazie alle telecamere a eventi (The Robot Report)
- File:Event camera comparison.jpg (Wikimedia Commons)
- File:Prophesee Event Camera Evaluation Kit.jpg (Wikimedia Commons)
- File:Faces in Event Streams.png (Wikimedia Commons)
Commenti
Accedi per continuare.
Nessun dato disponibile.