Contents — find the section you need

I metodi neurali 3D apprendono una rappresentazione della scena da più immagini e posizioni della telecamera, quindi renderizzano un'immagine da un punto di vista non acquisito. Mentre la SfM (Screen from Motion) stima principalmente le posizioni e i punti sparsi, e la MVS (Multi-View Synthesis) ricostruisce principalmente la geometria densa, il 3D neurale modella anche l'aspetto di una scena da una posizione e direzione di visualizzazione.

In breve

  • NeRF rappresenta una scena come una funzione che restituisce densità e radianza in base alla posizione e alla direzione di visualizzazione; 3D Gaussian Splatting ottimizza molti elementi gaussiani 3D espliciti.

  • Riprodurre correttamente le viste di addestramento non dimostra che le viste o la geometria non viste siano corrette.

  • Separare le metriche dell'immagine come PSNR/SSIM dalla valutazione geometrica di profondità, punti, normali e posizioni. La sintesi di viste nuove non è una prova di accuratezza di un'indagine.

Diagram 1 · Use the button to switch views
Addestramento e valutazione 3D neurale

Scelte di rappresentazione

NeRF valuta (\sigma,\mathbf{c})=F_\theta(\mathbf{x},\mathbf{d}) in corrispondenza di campioni lungo i raggi della telecamera e utilizza il rendering volumetrico per formare un'immagine. L'addestramento minimizza la differenza tra l'immagine renderizzata e l'immagine di input. Il 3D Gaussian Splatting proietta funzioni gaussiane con posizione, covarianza, opacità e colore, ottimizzando questi elementi a partire da punti sparsi.

Rappresentazione Punti di forza Avvertenza
Famiglia NeRF Campo di radianza continuo e aspetto dipendente dal punto di vista Molti campioni di raggi; addestramento e rendering dipendono dalla configurazione
3D Gaussian Splatting Gli elementi proiettati esplicitamente possono essere renderizzati rapidamente Validazione separata di densità, geometria non visibile e oggetti dinamici
Mesh / MVS La geometria della superficie è esplicita e facile da ispezionare Sensibile a riflessi, occlusioni, fori e texture deboli

Separazione tra viste di addestramento e di valutazione

Il rendering di ogni immagine di input utilizzata per l'addestramento misura solo la ricostruzione delle viste osservate. Non stabilisce l'interpolazione nelle regioni non viste. Suddividere le immagini o la traiettoria della telecamera in viste di addestramento, di validazione e di test, e fissare la spaziatura delle viste, la sovrapposizione, gli oggetti in movimento e la sorgente della posa della telecamera. Se le pose vengono stimate, registrare anche la loro incertezza.

PSNR, SSIM e LPIPS possono misurare la somiglianza delle immagini, ma misurano l'aspetto. La valutazione geometrica dovrebbe confrontare separatamente profondità, punti, normali, pose della telecamera ed errore di riproiezione. Una rappresentazione sfocata può migliorare il punteggio di un'immagine, ma posizionare un muro o una struttura sottile in modo errato.

Condizioni di errore comuni

  • Specchi, superfici trasparenti, riflessi e illuminazione variabile invalidano l'assunto che un punto abbia un aspetto coerente.

  • Le regioni al di fuori della traiettoria di addestramento o nascoste da occlusioni possono apparire plausibili senza prove concrete.

  • Persone, veicoli o piante in movimento trattati come geometria statica possono creare immagini fantasma e superfici duplicate.

  • Se le pose o la scala SfM sono instabili, le sole immagini renderizzate non sono sufficienti a identificarne la causa.

Riepilogo

Neural 3D apprende una rappresentazione della scena dipendente dal punto di vista a partire da immagini e pose. NeRF e 3D Gaussian Splatting utilizzano rappresentazioni e strategie di rendering diverse, ma entrambe richiedono una chiara separazione tra la ricostruzione della vista di training e la generalizzazione della vista di test. Registrare separatamente la qualità visiva, la geometria, l'errore di posa, il contenuto dinamico e le divisioni della vista prima di interpretare un risultato.

Verifica la tua comprensione
Un PSNR elevato nella vista di training dimostra che la geometria 3D è corretta?

No.

Verifica separatamente le viste nascoste, le metriche di profondità o di nuvola di punti e l'errore di posa della telecamera.

Riferimenti

Riferimenti

What to read next

Review camera poses and sparse points from input imagesIntroduzione alla ricostruzione 3D da immagini (Structure from Motion): recupero simultaneo di posizione 3D e posizione della telecamera da una serie di foto non ordinate.Review classical dense reconstruction from multiple viewsIntroduzione alla stereoscopia multivista: come trasformare una nuvola di punti sparsa in una forma 3D densa.Review the backgroundStima della profondità con un monocolo: dall'ordine relativo alla distanza metrica