Contents — find the section you need

Kamera peristiwa (Dynamic Vision Sensor, DVS) adalah sensor yang menangkap cahaya dengan metode yang sangat berbeda dari kamera berbasis bingkai konvensional, yang memotret seluruh adegan pada interval tetap: setiap piksel beroperasi secara independen dan asinkron dari piksel lainnya, hanya melaporkan saat kecerahannya sendiri berubah lebih dari jumlah tertentu, dengan resolusi waktu orde mikrodetik.

Prinsip: setiap piksel secara independen hanya melaporkan "perubahan"

Sensor gambar CMOS/CCD konvensional membaca semua piksel secara bersamaan pada setiap interval eksposur dan mengeluarkan nilai kecerahan absolut sebagai bingkai berbentuk kisi. Sebaliknya, piksel kamera peristiwa masing-masing menyimpan nilai log-kecerahan dari terakhir kali piksel tersebut melaporkan nilai sebagai referensi, dan saat log-kecerahan saat ini telah berubah dari referensi tersebut lebih dari ambang batas C, piksel tunggal tersebut saja yang memicu "peristiwa." Peristiwa bahwa piksel (x, y) aktif pada waktu t dihasilkan

\left| \ln I(x, y, t) - \ln I(x, y, t_{\text{last}}) \right| \geq C

pada saat kondisi ini terpenuhi, dan output menjadi urutan asinkron 4-tuple e_k = (x_k, y_k, t_k, p_k) (koordinat, stempel waktu, polaritas). Skema output hanya koordinat dan stempel waktu setiap kali ini disebut AER (Address-Event Representation), dan membedakan perubahan peningkatan kecerahan (ON) dari perubahan penurunan kecerahan (OFF) berdasarkan polaritas p_k. Karena konsep frame sama sekali tidak ada, tidak ada output jika tidak ada gerakan dalam adegan, dan semakin cepat gerakannya, semakin banyak peristiwa yang diaktifkan dalam interval yang lebih pendek.

Dua properti utama skema ini berasal langsung dari desain sirkuit respons logaritmiknya. Pertama adalah resolusi waktu: karena setiap piksel membuat keputusan ambang batasnya secara independen, perubahan pada prinsipnya dapat dideteksi dalam orde mikrodetik — bahkan chip DVS awal yang diumumkan pada tahun 2008 (dibahas di bawah) mencapai latensi 15 mikrodetik. Karena tidak terikat pada konsep frame rate, blur gerakan yang tidak dapat dihindari oleh kamera berbasis frame pada prinsipnya tidak terjadi. Kedua adalah rentang dinamis: karena setiap piksel membuat keputusan ambang batasnya secara independen pada skala logaritmik, sedangkan sensor konvensional mencapai batas atas sekitar 60-70dB, dibatasi oleh kapasitas sumur (batas atas muatan yang dapat diakumulasikan oleh fotodioda), sensor event melebihi 100dB, dan pada beberapa produk mencapai 140dB. Inilah sebabnya mengapa, bahkan dalam adegan dengan perbedaan ekstrem antara terang dan gelap — misalnya, permukaan jalan yang diterangi matahari dan pintu masuk terowongan yang teduh yang ada dalam adegan yang sama — perubahan masih dapat ditangkap secara terus menerus tanpa highlight yang terlalu terang atau black yang terlalu gelap.

Secara umum terdapat dua keluarga implementasi. Terdapat "DVS murni," yang hanya melakukan deteksi perubahan, seperti pada DVS128, iniVation DVXplorer, dan Prophesee GenX320, dan terdapat pendekatan hibrida, seperti pada iniVation DAVIS346 dan ATIS (dibahas di bawah), yang menambahkan sirkuit yang juga mengukur nilai kecerahan aktual (skala abu-abu) hanya untuk piksel di mana perubahan terdeteksi, di atas sirkuit deteksi perubahan. Pendekatan hibrida menghasilkan keluaran peristiwa asinkron dan, pada kecepatan bingkai rendah, gambar skala abu-abu konvensional secara bersamaan, yang memungkinkannya memanfaatkan keunggulan peristiwa sambil tetap kompatibel dengan alur pemrosesan gambar yang ada — tetapi juga mewarisi batasan bahwa nilai kecerahan tidak dapat diperoleh dari piksel tanpa perubahan.

Gambar perbandingan dengan rekaman seekor cheetah yang berlari yang diambil oleh kamera berbasis bingkai konvensional di atas, dan awan titik peristiwa yang ditangkap oleh kamera peristiwa dari adegan yang sama di bawahPerbedaan antara data yang dihasilkan oleh kamera berbasis bingkai (atas) dan kamera peristiwa (bawah) dari adegan yang sama

Gambar: Event perbandingan kamera (TimoStoffregen, CC BY-SA 4.0), Wikimedia Commons.

Seperti yang ditunjukkan oleh gambar perbandingan di atas, di mana kamera berbasis bingkai menghasilkan "foto seluruh adegan" pada interval tetap, kamera peristiwa hanya menghasilkan kumpulan peristiwa yang jarang tersebar di sepanjang kontur yang bergerak. Karena latar belakang statis tidak menghasilkan data sama sekali, hal ini juga dapat digambarkan sebagai sensor yang menyerahkan data dengan redundansi adegan yang sudah dihilangkan sejak awal. Untuk visi industri berbasis peristiwa miliknya sendiri, Prophesee menyatakan bahwa dalam aplikasi seperti inspeksi visual pada jalur produksi karton minuman dan robot pengelasan laser, ia dapat mengukur objek yang bergerak lebih cepat dari 10 meter per detik dengan kecepatan lebih dari 1.000 per detik sambil mengurangi volume data yang akan diproses menjadi sekitar seperseratus dibandingkan dengan metode berbasis bingkai konvensional — konsekuensi langsung dari fakta bahwa sensor tidak pernah menghasilkan data untuk "piksel yang belum berubah" sejak awal.

Membandingkan spesifikasi produk utama

Produk Resolusi Rentang Dinamis Latensi / Resolusi Waktu Catatan
iniVation DVXplorer 640×480 (VGA) Hingga 110dB Latensi sub-milidetik, resolusi waktu 200µs Throughput hingga 165 juta kejadian/detik, IMU 6-sumbu bawaan (giroskop hingga 3,2kHz), di bawah 140mA pada 5V
iniVation DAVIS346 346×260 (kejadian), output frame pada resolusi yang sama 120dB untuk output kejadian, 55dB untuk output frame Resolusi waktu 1µs dan latensi di bawah 1ms untuk kejadian, 40fps untuk frame Desain hibrida yang menghasilkan deteksi perubahan + frame skala abu-abu secara bersamaan. Hingga 12 juta kejadian/detik, pitch piksel 18,5µm
Sony IMX636 (Prophesee Metavision) 1280×720 (0,92 megapiksel) Lebih dari 86dB pada 5-100.000 lux, lebih dari 120dB dengan batas cahaya rendah pada 0,08-100.000 lux Respons kecepatan tinggi, latensi rendah (angka tergantung aplikasi) Sensor bertumpuk yang dikembangkan bersama oleh Sony dan Prophesee, jarak piksel 4,86µm, output paralel 16 baris digital penuh
Prophesee GenX320 320×320 Lebih dari 140dB Latensi piksel di bawah 150µs pada 1000 lux Dapat dikurangi hingga 36µW dalam mode daya ultra-rendah, piksel 6,3×6,3µm, paket ultra-kompak 3×4mm, penekan kedip bawaan dan kontrol laju kejadian
Samsung DVS-Gen4 1280×960 100dB 150µs Jarak antar piksel 4,95µm, mencapai resolusi tinggi dan konsumsi daya rendah melalui pengikatan Cu-Cu dalam piksel dan sirkuit penekan GIDL
Kit evaluasi kamera event Prophesee yang dipasang pada tripod, dengan lensa dan slot kartu microSD terlihatKit evaluasi kamera event Prophesee

Gambar: Prophesee Kit Evaluasi Kamera Event (Auledas, CC BY 4.0), Wikimedia Commons.

iniVation DVXplorer memiliki resolusi setara VGA 640×480 dan IMU 6-sumbu bawaan, dan merupakan kamera DVS murni yang banyak digunakan dalam penelitian robotika. DAVIS346 adalah desain hibrida yang menggabungkan sirkuit deteksi perubahan dan output frame skala abu-abu pada satu chip: output peristiwa itu sendiri memiliki rentang dinamis 120dB, tetapi frame yang dapat dikeluarkannya secara bersamaan terbatas pada 55dB dan 40fps — produk ini menunjukkan dengan jelas bahwa keunggulan DVS murni dan kompatibilitas dengan pemrosesan berbasis frame berada dalam hubungan timbal balik. Sony IMX636 menggabungkan teknologi manufaktur sensor bertumpuk Sony dengan keahlian penginderaan peristiwa Prophesee (dibahas di bawah), dan pada resolusi 1280×720 termasuk dalam kelas resolusi tinggi untuk kamera peristiwa; Teknologi ini juga telah diadopsi dalam seri "uEye EVS" yang diumumkan oleh produsen kamera industri IDS Imaging Development Systems pada tahun 2025. GenX320 memiliki resolusi yang agak lebih rendah yaitu 320×320, tetapi memiliki mode daya ultra rendah yang dapat mengurangi konsumsi hingga 36µW, menjadikannya desain yang ditujukan untuk perangkat wearable yang selalu aktif dan penginderaan tepi untuk IoT. Samsung DVS-Gen4 memiliki jumlah piksel tertinggi yaitu 1280×960, dan pengikatan Cu-Cu dalam piksel (teknik penumpukan yang langsung menggabungkan tembaga ke tembaga) bersama dengan desain sirkuit yang menekan GIDL (Gate-Induced Drain Leakage) menahan peningkatan arus bocor yang terjadi dengan resolusi yang lebih tinggi.

Dari Mana Mata Elektronik Berasal: Dari Retina Silikon Hingga Industri Kamera Peristiwa

1988, Retina Silikon di Caltech — Asal mula langsung kamera peristiwa dapat ditelusuri kembali ke makalah tahun 1988 "A Silicon Model of Early Visual Processing," yang diterbitkan oleh Carver Mead, yang dikenal sebagai salah satu bapak sirkuit terpadu, bersama dengan Misha Mahowald, yang saat itu masih mahasiswa pascasarjana. Keduanya benar-benar membangun "retina silikon" yang meniru pemrosesan visual awal retina menggunakan sirkuit CMOS analog, dan dengan demikian membuka bidang "rekayasa neuromorfik" itu sendiri — upaya untuk mereproduksi pemrosesan informasi otak dalam perangkat keras. Mead kemudian menerima penghargaan prestasi seumur hidup dalam rekayasa neuromorfik dari Caltech atas karyanya ini.

2008, DVS yang sepenuhnya asinkron dari ETH Zurich / Universitas Zurich — Patrick Lichtsteiner, Christoph Posch, dan Tobi Delbrück menerbitkan "A 128×128 120 dB 15 μs Latency Asynchronous Temporal Contrast Vision Sensor" di IEEE Journal of Solid-State Circuits, yang mendemonstrasikan sensor yang sepenuhnya asinkron dengan 128×128 piksel, rentang dinamis 120 dB, dan latensi 15 mikrodetik — prototipe dari apa yang sekarang disebut "DVS." Makalah ini dirujuk secara luas hingga menempati peringkat ke-4 dalam jumlah kutipan selama dekade sebelumnya di jurnal tersebut, dan sejak itu menjadi titik awal de facto untuk penelitian kamera peristiwa.

2011, ATIS menggabungkan deteksi perubahan dengan pengukuran kecerahan — Christoph Posch pindah ke Institut Teknologi Austria (AIT) dan mempresentasikan ATIS (Asynchronous Time-based Image Sensor), yang menggabungkan sirkuit deteksi perubahan dengan sirkuit yang juga mengukur kecerahan aktual (nilai skala abu-abu) berdasarkan waktu, tetapi hanya untuk piksel di mana perubahan terdeteksi. ATIS mencapai rentang dinamis melebihi 143dB, dan sebagai desain yang menjawab kebutuhan aplikasi dunia nyata untuk "tidak hanya perubahan, tetapi juga gambar," ia menjadi dasar teknis untuk DAVIS dan produk tipe hibrida lainnya di kemudian hari.

2014, Chronocam didirikan, dan dua perusahaan spin-off ETH/Universitas Zurich — Pada tahun 2014, Posch mendirikan Chronocam bersama Ryad Benosman, Bernard Gilly, dan Luca Verre di dalam studio startup Paris iBionext, dengan tujuan mengkomersialkan teknologi ATIS yang dikembangkan di AIT. Chronocam berganti nama menjadi Prophesee pada tahun 2018, bersamaan dengan putaran pendanaan Seri B sebesar $19 juta. Sementara itu, dari Institut Neuroinformatika (INI) Universitas Zurich/ETH Zurich, yang telah menghasilkan DVS128, empat orang — Tobi Delbrück, Rodney Douglas, Kynan Eng, dan Sven-Erik Jacobsen — mendirikan iniVation pada tahun 2015, dan tim terpisah mendirikan SynSense pada tahun 2017. Kedua perusahaan ini, yang memiliki institut yang sama sebagai sumber bersama mereka, kembali bersatu pada tahun 2024 ketika SynSense mengakuisisi semua saham iniVation. Di Tiongkok, CelePixel yang berbasis di Shanghai didirikan pada tahun 2017 oleh Chen Shoushun dan lainnya, dan diakuisisi pada tahun 2019 oleh Will Semiconductor, perusahaan induk OmniVision. Kemudian pada tahun 2020, Sony menggabungkan teknologi manufaktur sensor gambar bertumpuknya dan Prophesee dengan keahlian penginderaan peristiwanya dalam upaya pengembangan bersama, yang kemudian diproduksi sebagai IMX636 yang disebutkan di atas. Sebuah teknologi khusus dari laboratorium ilmu saraf, yang muncul dalam waktu sedikit lebih dari satu dekade pada saat bermitra dengan produsen sensor gambar utama seperti Sony — itulah kisah sensor ini sejauh ini.

Contoh nyata: perangkat kamera peristiwa stereo "DSEC" yang melintasi Zurich

Kamera peristiwa belum menjadi sensor yang digunakan dalam jalur produksi massal produsen mobil, tetapi ada beberapa contoh multi-unit yang selangkah lebih maju, dalam penelitian dan pengembangan. Dataset DSEC (A Stereo Event Camera Dataset for Driving Scenarios), yang dirilis pada tahun 2021 oleh ETH Zurich/University of Zurich's Robotics and Perception Group, dikumpulkan dengan kendaraan yang membawa perangkat stereo berupa dua kamera event Prophesee Gen3.1 (640×480) yang dipasang di kiri dan kanan dengan baseline 60cm, disinkronkan dengan dua kamera frame warna FLIR Blackfly S, LiDAR, dan RTK-GPS, yang melaju melalui beberapa kota di Swiss termasuk Zurich, Thun, dan Interlaken untuk mengumpulkan data berkendara selama lebih dari satu jam. Hal ini penting karena direkam secara khusus untuk menargetkan adegan dengan rentang dinamis tinggi di mana kamera standar cenderung mencapai batas kontrol eksposur — pintu masuk dan keluar terowongan, cahaya latar yang kuat saat matahari terbenam dan terbit — dan, seperti halnya pengaturan monokular, dirancang dengan mengambil garis dasar yang lebar dalam stereo juga, untuk memastikan akurasi disparitas hingga jarak jauh sekaligus memverifikasi apakah sisi kamera peristiwa dapat terus menangkap perubahan bahkan dalam adegan di mana kamera bingkai menghasilkan sorotan yang terlalu terang atau warna hitam yang terlalu gelap. Sebagai dasar untuk penelitian tentang seberapa kuat algoritma lokalisasi mandiri seperti Visual-SLAM dapat dijalankan di lingkungan pencahayaan buruk yang sulit ditangani oleh kamera biasa, DSEC terus dirujuk hingga saat ini.

Penelitian membaca wajah dari rekaman yang tampak seperti hanya noise, dan SLAM yang berjalan di atas UAV

Dataset deteksi wajah pada aliran peristiwa, dari Kazakhstan — ISSAI (Institut Sistem Cerdas dan Kecerdasan Buatan) Universitas Nazarbayev menerbitkan makalah "Faces in Event Streams (FES): An Annotated Face Dataset for Event Cameras," karya Bissarinova, Rakhimzhanova, Kenzhebalin, dan Varol, dalam jurnal Sensors (Volume 24, Edisi 5, nomor artikel 1409) pada tahun 2024. Ini adalah dataset skala besar pertama dari jenisnya, yang memberi anotasi pada 1,6 juta wajah dan 5 titik penanda wajah di seluruh 689 menit aliran peristiwa, dan 12 model yang menyertainya dilaporkan mendeteksi wajah dan penanda wajah dengan akurasi lebih dari 90% pada mAP50. Gambar di bawah ini adalah gambar sampul dari repositori GitHub-nya, yang menunjukkan wajah dan garis luar beberapa orang yang muncul sebagai akumulasi peristiwa dari rekaman yang jika tidak demikian hanya terlihat seperti bintik-bintik noise. Prinsip dasar kamera peristiwa — bahwa tidak ada yang tidak bergerak yang pernah direkam — menghasilkan rekaman "garis luar dan gerakan saja" tanpa tekstur fotografi, dan potensi aplikasinya dalam kasus penggunaan pengawasan dan pemantauan yang sensitif terhadap privasi juga telah dikemukakan.

Empat wajah yang ditangkap oleh kamera peristiwa. Garis luar wajah, kotak pembatas, dan penanda muncul dari noise berbintikWajah dan kotak deteksi muncul dalam aliran peristiwa (gambar sampul dari dataset FES)

Gambar: Faces dalam Aliran Peristiwa (Ulzhanbis, CC BY 4.0), Wikimedia Commons. Gambar sampul GitHub untuk makalah dataset FES oleh ISSAI (Universitas Nazarbayev) (Bissarinova dkk., Sensors 2024, 24(5):1409).

SLAM peristiwa stereo berjalan di atas UAV, dan eksperimen menghindari "benda yang dilempar" — Robotika adalah tempat di mana latensi rendah dan rentang dinamis tinggi kamera peristiwa paling menguntungkan. Makalah "AERO-VIS: Asynchronous Event-based Real-time Onboard Visual-Inertial SLAM" (arXiv:2605.07885), yang diterbitkan pada Mei 2026, menggabungkan kamera peristiwa stereo dengan IMU, mengimplementasikan detektor fitur yang memproses aliran peristiwa sambil tetap menjaganya tetap asinkron, dan melaporkan pencapaian akurasi yang tidak dapat dicapai oleh SLAM berbasis peristiwa konvensional, dengan benar-benar memasangnya pada UAV (kendaraan udara tak berawak) dan menjalankannya di atas pesawat. Secara terpisah, Grup Robotika dan Persepsi di Universitas Zurich, yang dipimpin oleh Davide Scaramuzza, melaporkan bahwa dalam sebuah percobaan dengan quadrotor yang menghindari rintangan hanya dengan mengandalkan kamera peristiwa monokular, ia mendeteksi objek yang datang dengan probabilitas 81-97% dalam waktu 3,5 milidetik, dan berhasil menghindari objek yang dilempar dari jarak 3 meter dengan kecepatan 10 meter per detik dengan probabilitas lebih dari 90%. Kelompok yang sama juga menyatakan bahwa penggunaan kamera event dapat meningkatkan kecepatan terbang drone hingga 10 kali lipat, dan penelitian tentang seberapa jauh kamera event dapat membawa persepsi dalam kecepatan yang pada prinsipnya tidak dapat diimbangi oleh kamera berbasis frame masih terus berlangsung.

Parameter yang menentukan kinerja

  1. Pertukaran resolusi/bandwidth: Resolusi 320×320 pada GenX320 adalah desain yang memprioritaskan konsumsi daya rendah untuk penggunaan di perangkat edge dan wearable, sedangkan resolusi 1280×960 pada Samsung DVS-Gen4 dan 1280×720 pada Sony IMX636 ditujukan untuk aplikasi dengan fidelitas lebih tinggi. Namun, karena kamera event menghasilkan lebih banyak event, semakin cepat gerakannya, semakin tinggi resolusinya, semakin tajam pula lonjakan bandwidth yang dibutuhkan untuk pemrosesan hilir — sebuah poin yang berbeda dari cara berpikir konvensional tentang frame rate.
  2. Rentang dinamis: Dibandingkan dengan GenX320 yang lebih dari 140dB dan IMX636 yang lebih dari 120dB (dengan cutoff cahaya rendah), Samsung DVS-Gen4 agak lebih sederhana dengan 100dB. Dalam aplikasi seperti DSEC di mana adegan dengan rentang dinamis tinggi seperti terowongan dan cahaya latar adalah medan pertempuran utama, angka ini secara langsung menentukan apakah itu praktis dapat digunakan.
  3. Latensi / resolusi waktu: Meskipun DVS128 tahun 2008 telah mencapai 15 mikrodetik, latensi GenX320 dan Samsung DVS-Gen4 dikatakan sekitar 150 mikrodetik pada 1000 lux — perlu kehati-hatian di sini, karena ini bukan perlombaan peningkatan generasi ke generasi yang sederhana tetapi angka yang ditentukan oleh pertimbangan terhadap kondisi pencahayaan dan kebijakan desain sirkuit pemrosesan (seperti apakah daya ultra-rendah diprioritaskan).
  4. Ambang batas kontras: Seperti halnya ambang batas GenX320 yang dinilai sebesar 25%, pengaturan ambang batas yang menangkap perubahan kecerahan sebagai suatu peristiwa itu sendiri merupakan pertimbangan antara noise dan sensitivitas. Menurunkan ambang batas menangkap bahkan perubahan terkecil dengan mengorbankan lebih banyak peristiwa noise; Meningkatkannya mengurangi kebisingan tetapi melewatkan beberapa perubahan cepat
  5. Konsumsi daya: Dibandingkan dengan DVXplorer yang di bawah 140mA pada 5V (kira-kira 700mW), mode daya ultra-rendah GenX320 adalah 36µW — produk yang berbeda hampir empat orde besaran hidup berdampingan dalam kategori "kamera peristiwa" yang sama. Apakah premisnya adalah penggunaan wearable/IoT yang selalu aktif atau dipasang pada robot untuk memproses volume peristiwa yang besar dengan kecepatan tinggi mengubah produk mana yang harus Anda pilih sepenuhnya
  6. DVS murni atau hibrida: Tipe hibrida seperti DAVIS346, yang juga dapat mengeluarkan frame skala abu-abu secara bersamaan, memiliki kemudahan untuk langsung menggunakan kembali pipeline pengenalan gambar yang ada, tetapi output framenya pada 55dB/40fps kurang dari kemampuan output peristiwa itu sendiri. DVS murni (DVXplorer, GenX320, dan lainnya) mengorbankan kompatibilitas dengan pipeline yang ada sebagai imbalan untuk memanfaatkan sepenuhnya keuntungan dari event.
Periksa pemahaman Anda
Bagaimana objek diam tampak bagi kamera event?

Event merespons perubahan kecerahan.

Tanpa perubahan, tampilan statis tidak terus-menerus diperbarui seperti pada frame konvensional.

Referensi

What to read next

Review the backgroundCara Kerja Sensor Ultrasonik dan Produk Utama — Bosch, Murata, Toyota ICSContinue the seriesCara Kerja Sensor Suhu, dan Produk-Produk yang Mendefinisikan Kategori Ini — Termokopel, PT100, DS18B20Explore another aspect of this fieldMembaca log IMU stasioner: bias, scatter, dan deviasi Allan.