Contents — find the section you need
Kamera kedalaman menangkap jarak (kedalaman) ke suatu objek per piksel. Jika kamera stereo merupakan desain pasif yang mendeteksi disparitas hanya menggunakan cahaya tampak, sebagian besar kamera kedalaman secara aktif memproyeksikan beberapa bentuk cahaya ke objek dan mendapatkan kedalaman dari cahaya yang dipantulkan kembali. Implementasinya secara umum terbagi menjadi tiga kategori: "stereo aktif," yang memproyeksikan pola titik acak dengan pemancar inframerah dan melakukan pencocokan stereo; "cahaya terstruktur," yang menghitung kedalaman secara geometris dari bagaimana pola yang diketahui terdistorsi; dan "Time of Flight" (ToF), yang menghitung jarak langsung dari waktu tempuh bolak-balik (atau pergeseran fase) cahaya. Ketiganya memiliki kekuatan mendasar yang sama — karena dapat menggunakan isyarat buatan, mereka dapat menangkap kedalaman bahkan pada target seperti dinding putih polos atau lantai berwarna solid, di mana stereo pasif kesulitan mendeteksi disparitas. Kamera ini digunakan untuk SLAM robot dalam ruangan, pelacakan tangan VR/AR, otentikasi wajah smartphone, dan pengukuran 3D industri.
Kinect (2010, dipamerkan di E3)
Intel RealSense D435Gambar: Kinect dan Xbox 360 di E3 2010 (James Pfaff, CC BY 2.0) / Intel Kamera kedalaman Realsense D435 (Marc Auledas, CC BY-SA 4.0), keduanya dari Wikimedia Commons. Foto RealSense menunjukkan D435 dasar, bukan D435i yang dilengkapi IMU yang dibahas dalam teks.
Prinsip: tiga pendekatan aktif
Stereo aktif menggunakan proyektor inframerah yang memproyeksikan pola titik acak ke suatu objek, kemudian melakukan pencocokan stereo antara dua kamera inframerah pada pergeseran pola tersebut untuk menghitung kedalaman. Prinsip dasarnya sama dengan triangulasi stereo pasif (Z = fB/d, lihat artikel kamera stereo), kecuali tekstur ditambahkan secara artifisial. Seri RealSense D400 Intel menggunakan pendekatan ini.
Cahaya terstruktur melakukan triangulasi menggunakan pasangan yang terdiri dari "proyektor yang memancarkan pola yang diketahui" dan "satu kamera," bukan dua kamera. Terdapat garis dasar antara proyektor dan kamera, dan kedalaman dihitung mundur dengan membandingkan bagaimana pola yang diproyeksikan (titik, garis, dll.) terdistorsi terhadap permukaan objek dengan pola referensi yang diketahui. Kinect asli (2010) dan TrueDepth Apple (iPhone Face ID) keduanya menggunakan pendekatan ini — TrueDepth memproyeksikan lebih dari 30.000 titik inframerah ke wajah untuk membaca bentuk 3D-nya.
ToF (Time of Flight) menerapkan prinsip waktu tempuh bolak-balik cahaya yang sama yang digunakan oleh LiDAR, secara paralel, per piksel. Selain mengukur langsung waktu tempuh bolak-balik pulsa (dToF), pendekatan yang mendominasi kamera kedalaman konsumen dan industri adalah iToF: ia memproyeksikan cahaya kontinu termodulasi dan memperoleh jarak dari pergeseran fase \Delta\phi antara sinyal yang dipancarkan dan dipantulkan. Dengan frekuensi modulasi f_{mod} dan kecepatan cahaya c, jarak Z diberikan oleh
Karena tidak memerlukan triangulasi, ia tidak memerlukan garis dasar antara proyektor dan kamera, sehingga lebih mudah untuk diminiaturisasi dan menghilangkan bagian yang bergerak. Produk Microsoft mulai dari Kinect v2 dan seterusnya, serta Femto Bolt dari Orbbec, menggunakan pendekatan ini. Ketiga pendekatan tersebut bergantung pada cahaya inframerah, sehingga memiliki kelemahan yang sama: akurasi cenderung menurun di luar ruangan di bawah sinar matahari yang kuat, yang kaya akan inframerah.
Diagram: Duskcoil. Garis biru menunjukkan cahaya yang diproyeksikan; garis putus-putus oranye menunjukkan cahaya yang kembali dari target. Stereo aktif dan cahaya terstruktur melakukan triangulasi di atas garis dasar, sedangkan ToF menggunakan pergeseran waktu atau fase.
Perbandingan spesifikasi produk utama
| Produk | Metode | Rentang kedalaman | IMU bawaan | Penggunaan |
|---|---|---|---|---|
| Intel RealSense D435i | Stereo aktif (proyeksi pola inframerah) | Kira-kira 0,3–3m (hingga setara sekitar 10m dalam beberapa kondisi) | Bosch BMI055 (6-sumbu: akselerometer + giroskop) | SLAM, VR/AR, kompensasi gerakan drone |
| Microsoft Kinect (asli, 2010) | Cahaya terstruktur (dibuat oleh PrimeSense) | Kira-kira 1,2–3,5m | Tidak ada | Penginderaan gerakan untuk konsol game Xbox 360. Kedalaman 320x240 pada 30fps |
| Microsoft Kinect v2 / Azure Kinect | ToF | (Spesifikasi resmi bervariasi tergantung aplikasi) | Azure Kinect memiliki IMU bawaan | Azure Kinect diluncurkan pada tahun 2020 untuk realitas campuran, robotika, dan penggunaan industri; dihentikan pada tahun 2023 |
| Orbbec Femto Bolt | ToF (menggunakan teknologi yang dilisensikan dari Microsoft) | Resolusi kedalaman hingga 1024x1024, FOV horizontal 120° | IMU 6-sumbu | Diumumkan pada tahun 2023 sebagai penerus Azure Kinect. Kedalaman 15fps pada 1024x1024 / 30fps pada 640x576, dengan kamera RGB 4K terintegrasi |
| Apple iPhone TrueDepth | Cahaya terstruktur (memproyeksikan 30.000+ titik IR) | Jarak sangat dekat, dioptimalkan untuk otentikasi wajah | (bekerja bersama dengan IMU iPhone sendiri) | Face ID, Animoji, pemisahan subjek mode potret |
D435i adalah D435 dasar dengan tambahan IMU 6-sumbu (Bosch BMI055). Data IMU-nya dikeluarkan secara sinkron (sejajar dengan stempel waktu) dengan data kedalaman, yang persis memungkinkannya mengoreksi gerakan kamera sendiri saat memproses kedalaman dan awan titik. Kinect asli dibangun di atas teknologi cahaya terstruktur yang dikembangkan oleh perusahaan rintisan Israel, PrimeSense; penerusnya, Kinect v2, beralih ke ToF. Azure Kinect berhenti diproduksi pada tahun 2023, tetapi Microsoft melisensikan teknologi time-of-flight-nya kepada Orbbec, dan penerusnya, Femto Bolt, menggunakan modul kamera kedalaman yang sama dengan Azure Kinect, memudahkan migrasi untuk aplikasi yang sudah ada. TrueDepth iPhone adalah cabang komersial terpisah dari garis keturunan cahaya terstruktur PrimeSense yang sama — contoh nyata dari satu akar teknologi yang terpecah menjadi dua aplikasi yang sangat berbeda: "penginderaan gerakan konsol game" dan "otentikasi wajah ponsel pintar."
Bagaimana Satu Teknologi, PrimeSense, Berkembang Menjadi Xbox, iPhone, dan Robot Industri
Perusahaan Israel PrimeSense yang menciptakan Kinect — Teknologi inti dalam Kinect asli (dirilis 2010) tidak dikembangkan sendiri di Microsoft — melainkan teknologi penginderaan kedalaman cahaya terstruktur yang dibangun oleh perusahaan rintisan Israel, PrimeSense. Kinect dengan cepat melampaui asal-usulnya sebagai konsol game dan banyak digunakan dalam robotika akademis dan komersial: kombinasi resolusi sub-720p dengan penangkapan kedalaman dan RGB secara simultan, dengan biaya yang jauh lebih rendah daripada LiDAR yang mahal, merupakan kesepakatan yang luar biasa untuk penelitian robotika pada saat itu. Sebuah makalah tahun 2011 oleh Richard Newcombe, Shahram Izadi, dan kolega di Microsoft Research, "KinectFusion: Pemetaan dan pelacakan permukaan padat waktu nyata" (IEEE ISMAR 2011), mendemonstrasikan pemetaan permukaan 3D padat waktu nyata hanya dengan menggunakan satu kamera kedalaman berbiaya rendah dan GPU komoditas, menjadi salah satu karya pendiri penelitian RGB-D SLAM.
Akuisisi PrimeSense oleh Apple dan kelahirannya kembali sebagai Face ID — Pada November 2013, Apple mengakuisisi PrimeSense seharga $360 juta. Akuisisi tersebut tidak menghapus teknologi cahaya terstruktur Kinect asli dari pasar — silsilah teknologinya kemudian menjadi inti dari Face ID, yang terwujud dalam sistem kamera "TrueDepth" iPhone X (penerangan banjir inframerah, proyektor titik, dan kamera inframerah) yang diumumkan pada tahun 2017. Ini adalah kasus penggunaan kembali teknologi dalam skala besar yang tidak biasa: teknologi yang dibangun untuk penginderaan gerak konsol game, tujuh tahun kemudian, menjadi teknologi otentikasi biometrik inti yang dikirimkan pada ponsel pintar dalam skala satu miliar unit.
Microsoft kembali menghentikan produksi Kinect — Selama lebih dari satu dekade, Microsoft telah berulang kali meluncurkan dan kemudian menghentikan produksi produk keluarga Kinect dari generasi ke generasi: Kinect untuk Xbox 360, Kinect untuk Xbox One, Kinect untuk Windows v2, dan Azure Kinect DK yang berorientasi industri/penelitian. Penghentian Azure Kinect DK, yang diumumkan pada Agustus 2023, adalah yang terbaru (dan sejauh ini yang terakhir) "akhir dari Kinect" dalam garis keturunan ini. Tetapi kali ini bukan penarikan penuh — Microsoft memilih untuk melisensikan teknologi ToF-nya kepada Orbbec, dan "Femto Bolt" dari Orbbec hadir dengan membawa modul kamera kedalaman yang sama seperti Azure Kinect. Ini adalah pola yang menggemakan akuisisi PrimeSense satu dekade sebelumnya: satu teknologi bertahan di tengah peralihan perusahaan.
Parameter yang Menentukan Kinerja
- Jangkauan kedalaman: Jangkauan D435i sekitar 0,3–3m (hingga sekitar 10m-setara dalam beberapa kondisi) adalah desain jarak dekat hingga menengah, cocok untuk mendeteksi rintangan di atas meja atau di sekitar rak untuk robot dalam ruangan, atau penggunaan jarak dekat seperti pelacakan tangan. Pemantauan jarak jauh di luar ruangan lebih baik dilakukan dengan kamera stereo atau LiDAR.
- Pilihan metode (stereo aktif / cahaya terstruktur / ToF): Stereo aktif memiliki biaya komputasi pencocokan stereo tetapi dapat dibangun dari komponen yang relatif murah. Cahaya terstruktur menawarkan akurasi tinggi pada jarak dekat, cocok untuk aplikasi presisi tinggi yang sangat dekat seperti Face ID, tetapi cenderung menghadapi kendala miniaturisasi karena membutuhkan garis dasar antara proyektor dan kamera. ToF tidak memerlukan bagian yang bergerak atau garis dasar, sehingga lebih mudah untuk diminiaturisasi, meskipun cenderung tidak sesuai dengan akurasi jarak dekat cahaya terstruktur. Femto Bolt yang memiliki resolusi kedalaman 1024x1024 dalam bodi yang ringkas adalah desain yang memanfaatkan keunggulan miniaturisasi ToF ini.
- IMU bawaan dan sinkronisasi waktu: Untuk aplikasi di mana kamera itu sendiri bergerak (genggam, terpasang pada drone, robot seluler), seberapa tepat data kedalaman dan data IMU disinkronkan waktunya menentukan akurasi koreksi blur gerakan. IMU bawaan pada D435i, Azure Kinect, dan Femto Bolt dirancang khusus dengan mempertimbangkan kasus penggunaan ini.
- Toleransi terhadap cahaya sekitar: Ketiga pendekatan berbasis inframerah ini stabil di dalam ruangan, tetapi akurasi cenderung menurun di luar ruangan di bawah sinar matahari yang kuat, yang menghilangkan pola yang diproyeksikan atau sinyal yang dipantulkan. Aplikasi yang diasumsikan berjalan di luar ruangan biasanya perlu mengandalkan stereo pasif (ZED, dll.) atau kombinasi beberapa pendekatan.
- Tekstur objek: Untuk robotika dalam ruangan dan VR/AR yang berurusan dengan target yang minim tekstur — dinding putih, lantai berwarna solid — metode aktif yang dapat memproyeksikan pola inframerah secara artifisial memiliki keunggulan. Keunggulan itu berkurang di lingkungan luar ruangan yang kaya tekstur.
- Jarak jangkauan minimum: Untuk aplikasi yang membutuhkan kedalaman pada jarak yang sangat dekat — pelacakan tangan, otentikasi wajah — batas bawah rentang kedalaman secara langsung menentukan kegunaan. TrueDepth yang dirancang khusus untuk target yang hanya berjarak puluhan sentimeter (wajah) adalah contoh arketipe dari hal ini.
Estimasi Kesalahan Jarak dengan Metode
Untuk stereo aktif, hubungan dasarnya adalah Z=fB/d, sehingga ketidakpastian disparitas \sigma_d diperkuat sebagai
Dengan f=600\,\mathrm{px}, B=0.05\,\mathrm{m}, Z=3\,\mathrm{m}, dan \sigma_d=0.25\,\mathrm{px}, kesalahan jaraknya sekitar 7.5\,\mathrm{cm}. Pola yang diproyeksikan membantu pencocokan pada dinding yang kurang bertekstur, tetapi titik-titik dapat menghilang di bawah sinar matahari yang kuat atau pada material yang menyerap inframerah.
Untuk ToF, pembacaan fase atau waktu, reflektivitas, multipath, dan waktu integrasi mendominasi. Oleh karena itu, resolusi kedalaman 1024×1024 piksel bukanlah spesifikasi yang sama dengan deviasi standar jarak. Saat memilih perangkat, pertahankan jarak target dan material tetap konstan dan ukur tingkat pengembalian yang hilang, tingkat outlier, latensi frame, dan offset stempel waktu antara kedalaman, RGB, dan IMU.
Gambar 2 — Nilai di sebelah kiri dihitung dari f,B,\sigma_d artikel. Bagian kanan menjelaskan mengapa kesalahan acak ToF, bias, dan pengembalian yang tidak valid memerlukan pengukuran terpisah. Ini bukan kurva kinerja perangkat.
Apakah kedalaman yang hilang setara dengan nol meter?
Artinya jangkauan tidak diperoleh.
Definisikan penanganan nilai tidak valid daripada memperlakukan data yang hilang sebagai objek terdekat atau ruang kosong.Referensi
- Halaman produk Intel RealSense D435i
- Kinect (Wikipedia)
- Azure Kinect (Wikipedia)
- Microsoft mengumumkan penghentian produksi Azure Kinect DK (Microsoft Tech Community)
- Halaman produk Orbbec Femto Bolt
- Ikhtisar kolaborasi Orbbec x Microsoft
- Microsoft tidak dapat menghentikan Kinect (TechCrunch)
- [Liputan] Akuisisi PrimeSense Apple
- Cara kerja iPhone TrueDepth/Face ID (Struktur)
- Makalah KinectFusion (IEEE ISMAR 2011)
- Penginderaan Jarak Kinect: Cahaya Terstruktur versus Kinect Waktu Tempuh (arXiv:1505.05459)
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.