Contents — find the section you need

Metode 3D neural mempelajari representasi adegan dari beberapa gambar dan pose kamera, kemudian merender gambar dari sudut pandang yang tidak ditangkap. Sementara SfM terutama memperkirakan pose dan titik-titik yang jarang, dan MVS terutama merekonstruksi geometri padat, 3D neural juga memodelkan bagaimana tampilan suatu adegan dari posisi dan arah pandang.

Secara singkat

  • NeRF merepresentasikan suatu adegan sebagai fungsi yang mengembalikan kepadatan dan radiasi dari posisi dan arah pandang; 3D Gaussian Splatting mengoptimalkan banyak elemen Gaussian 3D eksplisit.

  • Mereproduksi tampilan pelatihan dengan baik tidak membuktikan bahwa tampilan atau geometri yang tidak terlihat itu benar.

  • Pisahkan metrik gambar seperti PSNR/SSIM dari evaluasi geometris kedalaman, titik, normal, dan pose. Sintesis tampilan baru bukanlah bukti akurasi survei.

Diagram 1 · Use the button to switch views
Pelatihan dan evaluasi Neural 3D

Pilihan representasi

NeRF mengevaluasi (\sigma,\mathbf{c})=F_\theta(\mathbf{x},\mathbf{d}) pada sampel di sepanjang sinar kamera dan menggunakan rendering volume untuk membentuk gambar. Pelatihan meminimalkan perbedaan antara gambar yang dirender dan gambar masukan. 3D Gaussian Splatting memproyeksikan Gaussian dengan posisi, kovariansi, opasitas, dan warna, dan mengoptimalkan elemen-elemen ini mulai dari titik-titik yang jarang.

Representasi Kekuatan Peringatan
Keluarga NeRF Bidang radiasi kontinu dan tampilan yang bergantung pada sudut pandang Banyak sampel sinar; pelatihan dan rendering bergantung pada pengaturan
3D Gaussian Splatting Elemen yang diproyeksikan secara eksplisit dapat dirender dengan cepat Validasi kepadatan, geometri yang tidak terlihat, dan objek dinamis secara terpisah
Mesh / MVS Geometri permukaan eksplisit dan mudah diperiksa Sensitif terhadap pantulan, oklusi, lubang, dan tekstur lemah

Pisahkan tampilan pelatihan dan evaluasi

Rendering setiap gambar masukan yang digunakan untuk pelatihan hanya mengukur rekonstruksi tampilan yang diamati. Ini tidak menetapkan interpolasi ke wilayah yang tidak terlihat. Pisahkan gambar atau lintasan kamera menjadi tampilan pelatihan, validasi, dan tampilan yang ditahan, dan tetapkan jarak tampilan, tumpang tindih, objek bergerak, dan sumber pose kamera. Jika pose diperkirakan, catat juga ketidakpastiannya.

PSNR, SSIM, dan LPIPS dapat mengukur kemiripan gambar, tetapi mereka mengukur penampilan. Evaluasi geometris harus membandingkan kedalaman, titik, normal, pose kamera, dan kesalahan reproyeksi secara terpisah. Representasi yang kabur dapat meningkatkan skor gambar sambil menempatkan dinding atau struktur tipis secara tidak tepat.

Kondisi kegagalan umum

  • Cermin, permukaan transparan, pantulan, dan perubahan pencahayaan mematahkan asumsi bahwa suatu titik memiliki penampilan yang konsisten.

  • Wilayah di luar lintasan pelatihan atau yang tersembunyi oleh oklusi mungkin tampak masuk akal tanpa bukti yang kuat.

  • Memindahkan orang, kendaraan, atau tanaman yang diperlakukan sebagai geometri statis dapat menciptakan bayangan dan permukaan duplikat.

  • Jika pose atau skala SfM tidak stabil, gambar yang dirender saja tidak dapat mengidentifikasi penyebabnya.

Ringkasan

Neural 3D mempelajari representasi adegan yang bergantung pada sudut pandang dari gambar dan pose. NeRF dan 3D Gaussian Splatting menggunakan representasi dan strategi rendering yang berbeda, tetapi keduanya membutuhkan pemisahan yang jelas antara rekonstruksi tampilan pelatihan dan generalisasi tampilan yang ditahan. Catat kualitas visual, geometri, kesalahan pose, konten dinamis, dan pembagian tampilan secara independen sebelum menafsirkan hasilnya.

Periksa pemahaman Anda
Apakah PSNR tampilan pelatihan yang tinggi membuktikan bahwa geometri 3D benar?

Tidak.

Periksa tampilan yang ditahan, metrik kedalaman atau awan titik, dan kesalahan posisi kamera secara terpisah.

Referensi

What to read next

Review camera poses and sparse points from input imagesPengantar Struktur dari Gerakan — Memulihkan Posisi 3D dan Kamera Secara Bersamaan dari Kumpulan Foto yang Tidak TerurutReview classical dense reconstruction from multiple viewsPengantar Stereo Multi-View — Mengisi Awan Titik yang Jarang Menjadi Bentuk 3D yang PadatReview the backgroundEstimasi Kedalaman Monokular — Dari Urutan Relatif ke Jarak Metrik