Contents — find the section you need
Os métodos neurais 3D aprendem uma representação da cena a partir de múltiplas imagens e poses de câmera, e então renderizam uma imagem a partir de um ponto de vista que não foi capturado. Enquanto o SfM estima principalmente poses e pontos esparsos, e o MVS reconstrói principalmente geometria densa, o neurais 3D também modela como uma cena se apresenta a partir de uma posição e direção de visualização.
Em resumo
-
O NeRF representa uma cena como uma função que retorna densidade e radiância a partir da posição e direção de visualização; o 3D Gaussian Splatting otimiza muitos elementos Gaussianos 3D explícitos.
-
Reproduzir bem as vistas de treinamento não prova que vistas ou geometrias não vistas estejam corretas.
-
Separe as métricas de imagem, como PSNR/SSIM, da avaliação geométrica de profundidade, pontos, normais e poses. A síntese de novas vistas não é uma prova de precisão de levantamento.
Opções de representação
O NeRF avalia (\sigma,\mathbf{c})=F_\theta(\mathbf{x},\mathbf{d}) em amostras ao longo dos raios da câmera e usa renderização volumétrica para formar uma imagem. O treinamento minimiza a diferença entre as imagens renderizadas e de entrada. O 3D Gaussian Splatting projeta Gaussianas com posição, covariância, opacidade e cor, e otimiza esses elementos a partir de pontos esparsos.
| Representação | Força | Limitação |
|---|---|---|
| Família NeRF | Campo de radiância contínuo e aparência dependente do ponto de vista | Muitas amostras de raios; treinamento e renderização dependem da configuração |
| 3D Gaussian Splatting | Elementos projetados explicitamente podem renderizar rapidamente | Valida densidade, geometria não vista e objetos dinâmicos separadamente |
| Malha / MVS | Geometria da superfície explícita e fácil de inspecionar | Sensível a reflexos, oclusões, buracos e textura fraca |
Separar visualizações de treinamento e avaliação
Renderizar cada imagem de entrada usada para treinamento mede apenas a reconstrução das visualizações observadas. Não estabelece interpolação em regiões não vistas. Divida as imagens ou a trajetória da câmera em visualizações de treinamento, validação e reservadas, e fixe o espaçamento entre as visualizações, a sobreposição, os objetos em movimento e a fonte da pose da câmera. Se as poses forem estimadas, registre também a incerteza.
PSNR, SSIM e LPIPS podem medir a similaridade da imagem, mas medem a aparência. A avaliação geométrica deve comparar separadamente profundidade, pontos, normais, poses da câmera e erro de reprojeção. Uma representação borrada pode melhorar a pontuação de uma imagem, mas posicionar incorretamente uma parede ou estrutura fina.
Condições comuns de falha
-
Espelhos, superfícies transparentes, reflexos e mudanças de iluminação quebram a suposição de que um ponto tem aparência consistente.
-
Regiões fora da trajetória de treinamento ou ocultas por oclusão podem parecer plausíveis sem evidências fortes.
-
Pessoas, veículos ou plantas em movimento tratados como geometria estática podem criar fantasmas e superfícies duplicadas. - Se as poses ou a escala do SfM forem instáveis, as imagens renderizadas por si só não conseguem identificar a causa.
Resumo
O Neural 3D aprende uma representação da cena dependente da visão a partir de imagens e poses. O NeRF e o 3D Gaussian Splatting usam representações e estratégias de renderização diferentes, mas ambos exigem uma separação clara entre a reconstrução da visão de treinamento e a generalização da visão de teste. Registre a qualidade visual, a geometria, o erro de pose, o conteúdo dinâmico e as divisões de visão independentemente antes de interpretar um resultado.
Um PSNR alto na visão de treinamento prova que a geometria 3D está correta?
Não. Verifique separadamente as visualizações retidas, as métricas de profundidade ou nuvem de pontos e o erro de pose da câmera.

Comentários
Entre na sua conta para continuar.
Ainda não há dados.