Contents — find the section you need

Apa yang dipulihkan oleh Structure from Motion adalah awan titik 3D yang jarang, yang hanya menghubungkan titik-titik fitur. Anda dapat melihat garis luar bangunan atau sudut-sudut teksturnya, tetapi dinding dan permukaan melengkung hampir tidak memiliki titik sama sekali, dan hasilnya tidak dapat digunakan sebagai "bentuk" sebagaimana adanya. Multi-View Stereo (MVS) mengambil pose kamera yang sudah diketahui dari SfM atau kalibrasi kamera sebagai data yang diberikan, dan memperkirakan kedalaman untuk hampir setiap piksel dalam gambar, mengisinya menjadi awan titik atau jala yang padat. Pembagian kerja — estimasi pose adalah tugas SfM, pemulihan bentuk padat adalah tugas MVS — adalah titik awal untuk memahami bagaimana kedua teknologi ini saling terkait.

0. Ringkasan 30 Detik

  • MVS adalah teknologi yang memperkirakan kedalaman per piksel yang padat dari banyak gambar dengan pose yang diketahui, dan mengintegrasikannya ke dalam awan titik atau mesh. Ini adalah proses hilir yang mengisi awan titik SfM yang jarang menjadi bentuk yang padat.
  • Prinsip intinya adalah konsistensi foto: asumsikan kedalaman yang benar untuk titik 3D, dan piksel yang sesuai dalam beberapa gambar yang melihatnya harus memiliki warna dan kecerahan yang serupa.
  • Ada dua pendekatan klasik yang representatif: Plane-Sweep, yang mengevaluasi konsistensi sambil menyapu kandidat kedalaman sebagai bidang, dan Patch-based (PMVS), yang secara iteratif memperluas dan menyaring patch kecil.
  • Dalam beberapa tahun terakhir, metode berbasis pembelajaran mendalam yang memproses volume biaya melalui konvolusi (seperti MVSNet) semakin melampaui metode klasik dalam hal akurasi dan ketahanan.
  • Peta kedalaman multi-view yang dihasilkan digunakan langsung sebagai awan titik, atau dikonversi menjadi mesh melalui fusi TSDF atau Rekonstruksi Permukaan Poisson. Estimasi kedalaman waktu nyata dengan kamera stereo atau kamera kedalaman memiliki prinsip konsistensi foto, tetapi berbeda dalam jumlah sudut pandang, kemampuan offline, dan anggaran komputasi.

1. Apa yang Diterima sebagai Input, dan Apa yang Diselesaikannya?

Input MVS adalah informasi berikut, yang sudah ditemukan melalui SfM atau kalibrasi kamera:

  • Posisi kamera dan parameter intrinsik P_i = K_i[R_i\mid\mathbf{t}_i] dari setiap gambar i (dianggap diketahui)
  • Sekumpulan gambar \{I_1,\dots,I_N\} yang memotret adegan target

Outputnya adalah peta kedalaman padat \{D_i\} untuk setiap gambar (atau sekumpulan gambar referensi yang dipilih), atau awan titik/jaringan yang diperoleh dengan mengintegrasikannya. Jika output SfM — awan titik jarang dan pose kamera — adalah "kerangka", MVS adalah proses yang menambahkan "daging" padanya. Anda tidak dapat memulihkan bentuk padat dengan pose yang tidak diketahui — MVS selalu berada di hilir SfM atau kalibrasi, dan ada baiknya untuk menetapkan urutan ini sejak awal.

2. Mengapa Awan Titik Jarang Tidak Cukup?

Alasan SfM tidak langsung menghasilkan awan titik padat adalah karena inputnya bergantung pada pencocokan titik fitur. Seperti yang kita lihat di Panduan Deteksi Fitur, hanya piksel "khas" — sudut, tepi — yang dapat dideteksi dan dicocokkan secara stabil. Wilayah bertekstur seragam seperti dinding polos tidak memiliki titik fitur sama sekali, meninggalkan lubang besar di awan titik 3D SfM.

Di sisi lain, MVS dapat memanfaatkan batasan kuat bahwa pose sudah diketahui, sehingga tidak memerlukan titik fitur sama sekali. Untuk setiap piksel, ia dapat langsung mengevaluasi "apakah kandidat kedalaman ini tetap konsisten di seluruh gambar lain?" Ini membuka kemungkinan untuk memperkirakan kedalaman bahkan untuk dinding yang minim tekstur, selama setidaknya ada beberapa pola atau bayangan untuk dikerjakan (permukaan yang benar-benar tanpa fitur tetap menjadi titik lemah, seperti yang dibahas di bawah).

3. Prinsip Inti: Konsistensi Foto

Hampir setiap metode MVS dibangun berdasarkan asumsi konsistensi foto. Misalkan kedalaman titik 3D yang sesuai dengan piksel \mathbf{u} dalam gambar referensi adalah d; Titik 3D tersebut dapat dipulihkan sebagai

\mathbf{X}(\mathbf{u}, d) = \pi_{\text{ref}}^{-1}(\mathbf{u}, d)

dan asumsi konsistensi foto adalah bahwa memproyeksikannya kembali ke gambar lain k, pada piksel \mathbf{u}' = \pi_k(\mathbf{X}(\mathbf{u},d)), akan memberikan warna dan kecerahan yang mendekati I_{\text{ref}}(\mathbf{u}). Ini paling mudah dipahami sebagai generalisasi, dari 2 sudut pandang menjadi N sudut pandang, dari pencarian disparitas kamera stereo — proses, yang dibahas dalam Cara Kerja Kamera Kedalaman dan Cara Kerja Kamera Stereo, untuk menemukan piksel yang sesuai antara gambar kiri dan kanan dengan mencocokkan kecerahan. Sebenarnya, kedalaman untuk kamera stereo dua mata ditemukan dengan rumus sederhana

Z = \frac{fB}{d_{\text{disp}}}

menggunakan panjang fokus f, panjang garis dasar B, dan disparitas d_{\text{disp}} — dan MVS persis merupakan operasi "mencari disparitas dan mengubahnya menjadi kedalaman," yang diperluas ke sejumlah kamera dalam susunan apa pun.

Implementasi tipikal menggunakan jendela kecil W di sekitar piksel dan mengukur kesesuaian ini dengan korelasi silang ternormalisasi (NCC).

\mathrm{NCC}(\mathbf{u}, d) = \frac{\sum_{\mathbf{x}\in W}\left(I_{\text{ref}}(\mathbf{x})-\bar I_{\text{ref}}\right)\left(I_k(\mathbf{x}')-\bar I_k\right)} {\sqrt{\sum_{\mathbf{x}\in W}\left(I_{\text{ref}}(\mathbf{x})-\bar I_{\text{ref}}\right)^2}\sqrt{\sum_{\mathbf{x}\in W}\left(I_k(\mathbf{x}')-\bar I_k\right)^2}}

\mathbf{x}' adalah titik yang sesuai yang diperoleh dengan memetakan \mathbf{x} ke dalam gambar k, dengan asumsi bidang lokal pada kandidat kedalaman d. \mathrm{NCC} tahan terhadap perubahan skala kecerahan dan offset, sehingga berfungsi bahkan dengan beberapa perbedaan pencahayaan atau eksposur antar gambar. Perhitungan skor kesepakatan ini untuk setiap pasangan gambar dan setiap kandidat kedalaman, serta pemilihan kedalaman dengan skor terbaik, membentuk kerangka komputasi MVS.

4. Alur Kerja Dasar

Diagram 1 · Use the button to switch views
The basic MVS pipeline A diagram showing the flow from a set of images with known camera poses, through estimating each image's dense depth map via either Plane-Sweep or Patch-based methods, to fusing multi-view depth maps into a dense point cloud or mesh. Image set +known camera poses Plane-Sweepsweep depth candidates,evaluate photo-consistency Patch-basedexpand patches,filter by visibility Dense depth mapfor each image Depth mapfusion Point cloud/mesh

Bentuk dasar MVS klasik adalah struktur dua tahap: pilih Plane-Sweep atau Patch-based untuk menemukan peta kedalaman padat setiap gambar terlebih dahulu, kemudian gabungkan menjadi satu bentuk 3D yang konsisten pada tahap kedua. Metode berbasis deep learning modern sebagian besar mengikuti struktur dua tahap yang sama ini, sambil mengganti internal estimasi kedalaman dengan jaringan saraf.

5. Metode Plane-Sweep

Metode Plane-Sweep berasal dari pendekatan pencocokan multi-gambar pemindaian ruang yang diusulkan Collins di CVPR 1996. Metode ini menyelaraskan bidang virtual, yang berjarak pada interval reguler, tegak lurus terhadap sumbu optik kamera referensi (atau berorientasi sesuai dengan adegan) di dalam frustum pandangan kamera referensi, dan mengevaluasi kedalaman saat menyapu dari dangkal ke dalam.

Dengan asumsi bidang pada kedalaman tertentu d, titik-titik pada bidang tersebut dapat dipetakan dari Gambar referensi ditransformasikan ke gambar lain melalui transformasi homografi. Menggunakan transformasi berbentuk H = K_k(R+\mathbf{t}\mathbf{n}^\mathsf{T}/d)K_{\text{ref}}^{-1}, yang dibahas dalam Panduan Homografi, gambar lain I_k diubah bentuknya ke sudut pandang referensi. Konsistensi foto (seperti NCC dari bagian sebelumnya) dihitung pada setiap piksel antara gambar yang telah diubah bentuknya dan gambar referensi, dan biaya diakumulasikan untuk setiap kandidat kedalaman.

d^*(\mathbf{u}) = \arg\min_{d\in\mathcal{D}} \sum_{k} \rho\left(1-\mathrm{NCC}_k(\mathbf{u},d)\right)

Setelah biaya dihitung untuk setiap kandidat kedalaman, kedalaman dengan biaya minimum dipilih per piksel. Ini adalah pencarian kedalaman diskrit, yang cocok dengan paralelisasi GPU, mengevaluasi banyak hipotesis kedalaman sekaligus. Banyak implementasi menggabungkan ini dengan agregasi biaya semi-lokal (regularisasi yang mirip dengan Pencocokan Semi-Global), menginterpolasi kedalaman secara halus dari informasi tetangga bahkan di wilayah yang miskin tekstur. Modul rekonstruksi padat COLMAP juga mengadopsi pendekatan yang mirip dengan Plane-Sweep, mengoptimalkan pemilihan tampilan per piksel (Pemilihan Tampilan Piksel-per-piksel) — makalah Schönberger dkk. di ECCV 2016 adalah contoh representatif.

6. Metode Berbasis Patch (PMVS)

Alih-alih menyapu kedalaman piksel demi piksel, metode berbasis patch secara langsung menghasilkan dan memperluas serangkaian patch persegi panjang kecil yang menutupi permukaan adegan. Contoh representatif adalah PMVS (Patch-based Multi-View Stereo), yang dipublikasikan oleh Furukawa dan Ponce di IEEE TPAMI pada tahun 2010.

Prosesnya berulang dalam tiga tahap: "cocokkan, perluas, saring."

  1. Cocokkan: pertama-tama menghasilkan sejumlah kecil patch awal dari titik korespondensi yang mudah dideteksi sebagai titik fitur, seperti sudut SIFT atau Harris. Setiap patch membawa posisi pusat, arah normal, dan kumpulan gambar yang melihat titik tersebut (visibilitas).

  2. Perluas: menyebarkan patch baru ke lingkungan patch awal, memperluas area yang dicakup ke piksel sekitarnya. Posisi dan normal dari setiap patch yang dipropagasi dioptimalkan secara lokal untuk memaksimalkan konsistensi foto dengan gambar di sekitarnya.

  3. Filter: menghapus patch dengan kontradiksi visibilitas (seperti kasus di mana sebuah patch seharusnya terlihat meskipun berada di belakang patch lain) atau konsistensi foto yang rendah.

Tidak seperti Plane-Sweep, yang menentukan kedalaman secara independen per piksel, PMVS membawa informasi tambahan dari normal patch, sehingga cenderung memiliki akurasi rekonstruksi yang lebih tinggi untuk permukaan miring. Di sisi lain, karena dibangun di atas perluasan dan penyaringan iteratif, perluasan tidak berjalan dengan baik di wilayah dengan sedikit patch awal atau tekstur yang buruk, dan rekonstruksi cenderung menyisakan lubang.

7. Metode Berbasis Deep Learning: Ide Volume Biaya

Dalam beberapa tahun terakhir, metode yang merepresentasikan kesepakatan per kandidat kedalaman bukan dengan metrik yang dirancang secara manual (seperti NCC) tetapi dengan fitur yang dipelajari oleh jaringan saraf konvolusional dan volume biaya telah menjadi arus utama. Contoh representatif adalah MVSNet, yang dipublikasikan oleh Yao dkk. di ECCV 2018.

MVSNet memperoleh peta fitur dari setiap gambar melalui ekstraktor fitur terlatih, mengasumsikan bidang kedalaman diskrit dalam frustum pandangan kamera referensi, dan menyelaraskan peta fitur setiap gambar ke sudut pandang referensi melalui warp homografi yang dapat dibedakan. Ia menggabungkan varians di seluruh peta fitur beberapa gambar ke dalam volume biaya tunggal, meregulasinya dengan konvolusi 3D, dan kemudian meregresikan kedalaman melalui softmax sepanjang arah kedalaman. Kerangka dasarnya mengikuti ide Plane-Sweep tentang "menyapu kandidat kedalaman dan mengevaluasi," tetapi perbedaannya dari metode klasik adalah bahwa perhitungan konsistensi foto itu sendiri menjadi dapat dipelajari.

Metode berbasis pembelajaran cenderung berperilaku lebih kuat dalam kondisi di mana metrik konsistensi foto buatan tangan mengalami kesulitan — pola berulang, tekstur lemah — selama data pelatihan mencakup situasi serupa. Di sisi lain, kinerja dapat menurun dalam adegan yang jauh di luar distribusi dataset pelatihan (bahan yang tidak dikenal, pencahayaan ekstrem).

8. Penggabungan dan Pembuatan Jala Peta Kedalaman

Karena peta kedalaman multi-pandangan masing-masing diestimasi secara independen, menumpuknya begitu saja sebagai titik 3D akan meninggalkan kontradiksi dari noise dan oklusi (titik yang sedikit bergeser di lokasi yang sama menumpuk di beberapa lapisan, atau kedalaman yang tidak sesuai antara sudut pandang). Penggabungan adalah proses yang mengkonsolidasikan peta kedalaman ini menjadi representasi tunggal yang konsisten.

  • Penggabungan sebagai awan titik: hanya mengadopsi piksel di mana kedalaman konsisten di seluruh sudut pandang, membuang kedalaman dengan kepercayaan rendah, dan mengintegrasikan. COLMAP dan lainnya menghasilkan awan titik padat dengan cara ini.

  • Penggabungan TSDF (Truncated Signed Distance Function): metode volumetrik, yang diusulkan oleh Curless dan Levoy di SIGGRAPH 1996, yang membagi ruang menjadi voxel dan mengakumulasikan jarak bertanda di setiap voxel. Banyak digunakan dalam penggabungan kamera kedalaman waktu nyata (seperti KinectFusion), dan juga berlaku untuk menggabungkan peta kedalaman MVS.

  • Pembuatan Jala: dari awan titik atau Metode medan jarak bertanda, seperti Rekonstruksi Permukaan Poisson (2006), oleh Kazhdan dkk., menghasilkan jala poligon yang halus. Penambahan pemetaan tekstur melengkapi model 3D yang juga dapat digunakan secara visual.

9. Membandingkan Algoritma Representatif

Aspek Penyapuan Bidang Berbasis Patch (PMVS) Berbasis Pembelajaran (keluarga MVSNet)
Prinsip Menyapu bidang kedalaman, mengevaluasi konsistensi foto per piksel Secara iteratif memperluas dan menyaring patch kecil Meregulasi volume biaya dengan CNN dan meregresikan kedalaman
Akurasi Bergantung pada resolusi kedalaman dan desain agregasi biaya; sedang hingga tinggi Cenderung akurat untuk bentuk lokal yang miring atau kompleks Akurasi tinggi dalam kondisi yang mendekati data pelatihan
Biaya komputasi Mudah diparalelkan dengan GPU, cepat Cenderung Lebih lambat daripada Plane-Sweep karena pemrosesan iteratif Inferensi cepat setelah pelatihan; biaya pelatihan terpisah
Ketahanan Lemah di wilayah dengan tekstur yang kurang baik Cenderung meninggalkan lubang di wilayah dengan sedikit patch awal Relatif tahan terhadap tekstur lemah atau pola berulang
Kesulitan implementasi Sedang (pembengkokan homografi dan agregasi biaya) Tinggi (manajemen visibilitas dan desain ekspansi iteratif) Tinggi (membutuhkan data pelatihan dan desain jaringan)
Implementasi representatif COLMAP padat, banyak alat fotogrametri komersial PMVS/CMVS MVSNet, metode berbasis pembelajaran selanjutnya

10. Hubungan dengan Kamera Stereo dan Kedalaman

MVS memiliki prinsip dasar yang sama — "menemukan kedalaman dari korespondensi di berbagai sudut pandang" — dengan kamera stereo dan [kamera kedalaman] kamera kedalaman, tetapi mereka menempati posisi yang berbeda.

  • Kamera stereo menggunakan susunan dua mata tetap, membatasi pencarian disparitas ke satu dimensi di sepanjang garis epipolar, dan dirancang dengan premis pemrosesan waktu nyata. Metode Plane-Sweep MVS dapat dipahami sebagai generalisasi pencarian disparitas ini ke sejumlah kamera dalam susunan apa pun.
  • Kamera kedalaman (cahaya terstruktur, ToF, stereo aktif) secara aktif memproyeksikan cahaya, memungkinkan mereka untuk secara stabil memperoleh jarak bahkan untuk permukaan yang kurang bertekstur. Karena MVS hanya bergantung pada konsistensi foto pasif, ia secara inheren dirugikan pada permukaan dengan pola rendah — perbedaan yang jelas dari kamera kedalaman aktif.
  • MVS pada dasarnya offline, membangun bentuk presisi tinggi dan kepadatan tinggi dari banyak gambar (puluhan hingga ratusan), sedangkan kamera stereo dan kedalaman dioptimalkan untuk terus mengeluarkan kedalaman satu bingkai pada satu waktu, secara waktu nyata.

Tergantung pada Aplikasi, robot, atau AR yang membutuhkan kinerja waktu nyata cocok untuk kamera stereo/kedalaman, sementara model 3D presisi tinggi offline untuk dokumentasi warisan budaya, survei arsitektur, atau fotogrametri cocok untuk MVS.

11. Kondisi Sulit dan Kasus Kegagalan Umum

  • Permukaan yang minim tekstur atau seragam: dinding putih, lantai polos, dan langit memberikan sedikit petunjuk untuk konsistensi foto, sehingga kedalaman tidak ditentukan atau terseret ke nilai yang salah oleh noise di sekitarnya.
  • Objek spekular, transparan, atau tembus cahaya: kaca, permukaan air, dan kilau logam berubah penampilan tergantung pada sudut pandang, sehingga melanggar asumsi konsistensi foto itu sendiri.
  • Pola berulang: ubin, batu bata, dan barisan tanaman di ladang dapat menghasilkan "solusi hantu," di mana kedalaman yang salah masih menunjukkan konsistensi foto lokal yang tinggi.
  • Oklusi: wilayah yang hanya terlihat dari beberapa sudut pandang dapat berakhir dengan mengevaluasi konsistensi foto menggunakan gambar yang salah jika visibilitas diperkirakan secara tidak tepat, sehingga merusak perkiraan kedalaman.

  • Sudut pandang atau paralaks yang tidak mencukupi: jika jumlah sudut pandang yang mencakup sedikit, atau paralaks terlalu kecil, maka resolusi yang tersedia di sepanjang arah kedalaman tidak ada sejak awal.

12. Pilihan Praktis

  • Jika pose sudah diketahui dari SfM atau kalibrasi dan tujuannya adalah rekonstruksi 3D offline yang mengutamakan akurasi (dokumentasi warisan budaya, survei arsitektur, fotogrametri untuk produksi video), implementasi keluarga Plane-Sweep, seperti pipeline padat COLMAP, adalah titik awal yang mudah diakses.
  • Jika akurasi untuk permukaan miring atau bentuk lokal yang kompleks merupakan prioritas khusus, pertimbangkan pendekatan berbasis Patch dalam keluarga PMVS, atau implementasi hibrida yang menggabungkan ide-idenya.
  • Jika Anda mengetahui sebelumnya bahwa adegan tersebut miskin tekstur atau memiliki banyak pola berulang, metode berbasis pembelajaran (keluarga MVSNet) cenderung lebih kuat. Karena kinerja dapat menurun pada adegan di luar distribusi data pelatihan, evaluasi pada data yang dekat dengan domain target Anda sebelum mengadopsinya.

  • Untuk aplikasi yang membutuhkan Untuk performa waktu nyata — robot, AR/VR, deteksi rintangan dalam mengemudi otonom — pertimbangkan kamera stereo atau kamera kedalaman sebagai pengganti MVS. Arena utama MVS adalah rekonstruksi offline, kepadatan tinggi, dan presisi tinggi.

  • Jika hasil akhir yang dibutuhkan berupa mesh atau model 3D bertekstur, pilih fusi TSDF atau Rekonstruksi Permukaan Poisson pada tahap fusi peta kedalaman; jika hanya awan titik saja sudah cukup, Anda dapat berhenti di situ.

13. Ringkasan

Multi-View Stereo mengambil pose kamera yang sudah diketahui dari SfM atau kalibrasi sebagai data yang diberikan, dan memulihkan kedalaman padat menggunakan konsistensi foto sebagai petunjuknya. Dua pendekatan klasik, Plane-Sweep dan berbasis Patch, memiliki trade-off yang berbeda, dan dalam beberapa tahun terakhir, metode keluarga MVSNet yang mempelajari volume biaya mendorong akurasi dan ketahanan. Selanjutnya, seluruh alur berlanjut hingga penggabungan dan penggabungan peta kedalaman yang dihasilkan, dan memahami perbedaannya — MVS mengorbankan kinerja waktu nyata demi akurasi, dibandingkan dengan kamera stereo/kedalaman yang memprioritaskan kinerja waktu nyata — adalah dasar untuk membuat pilihan praktis yang tepat.

Periksa pemahaman Anda
Apakah awan titik yang lebih padat menjamin geometri yang lebih akurat?

Kedalaman yang lebih tidak akurat tidak meningkatkan akurasi. Periksa konsistensi multi-view, oklusi, refleksi, dan tekstur secara terpisah dari kepadatan.

Referensi

What to read next

Review the backgroundPengantar Penyesuaian Bundel — Metode Kuadrat Terkecil Nonlinier yang Memperbaiki Posisi Kamera dan Titik 3D Secara Bersama-samaContinue the seriesPanduan VO/VIO — Landasan Praktis untuk Memperkirakan Gerakan dari Kamera dan IMUExplore another aspect of this fieldLab kecerahan dan luminans — eksposur, gamma, dan clipping