Contents — find the section you need
O que a Estrutura a partir do Movimento recupera é uma nuvem de pontos 3D esparsa, conectando apenas pontos de referência. É possível distinguir o contorno de um edifício ou os cantos de sua textura, mas paredes e superfícies curvas ficam praticamente sem pontos, e o resultado não pode ser usado como "forma" em sua forma original. A Estereoscopia Multivisual (MVS) utiliza as poses da câmera já conhecidas pela SfM ou pela calibração da câmera como dados e estima a profundidade para quase todos os pixels da imagem, preenchendo-a em uma nuvem de pontos densa ou malha. A divisão de tarefas — a estimativa de pose é função da SfM, a recuperação de forma densa é função da MVS — é o ponto de partida para entender como essas duas tecnologias se relacionam.
0. Resumo de 30 segundos
-
MVS é uma tecnologia que estima a profundidade densa, pixel a pixel, a partir de várias imagens com poses conhecidas e a integra em uma nuvem de pontos ou malha. É o processo subsequente que preenche a nuvem de pontos esparsa do SfM, transformando-a em uma forma densa.
-
Seu princípio fundamental é a fotoconsistência: assume-se a profundidade correta para um ponto 3D, e os pixels correspondentes nas múltiplas imagens que o visualizam devem ter cor e brilho semelhantes.
-
Existem duas abordagens clássicas representativas: Plane-Sweep, que avalia a consistência enquanto percorre os candidatos à profundidade como planos, e Patch-based (PMVS), que expande e filtra pequenos patches iterativamente.
-
Nos últimos anos, métodos baseados em aprendizado profundo que processam um volume de custo por meio de convolução (como o MVSNet) têm superado cada vez mais os métodos clássicos em precisão e robustez. Os mapas de profundidade multiview resultantes são usados diretamente como uma nuvem de pontos ou convertidos em uma malha por meio de fusão TSDF ou reconstrução de superfície de Poisson. A estimativa de profundidade em tempo real com câmeras estéreo ou de profundidade compartilha o princípio da fotoconsistência, mas difere no número de pontos de vista, na necessidade de processamento offline e no orçamento computacional.
1. O que é utilizado como entrada e o que é calculado?
A entrada do MVS consiste nas seguintes informações, já obtidas por meio do SfM ou da calibração da câmera:
- A pose da câmera e os parâmetros intrínsecos de cada imagem i P_i = K_i[R_i\mid\mathbf{t}_i] (tratados como conhecidos)
- Um conjunto de imagens \{I_1,\dots,I_N\} fotografando a cena alvo
A saída é um mapa de profundidade denso \{D_i\} para cada imagem (ou um conjunto selecionado de imagens de referência), ou a nuvem de pontos/malha obtida pela integração delas. Se a saída do SfM — a nuvem de pontos esparsa e as poses da câmera — é o "esqueleto", o MVS é o processo que o "preenche". Não é possível recuperar a forma densa com poses desconhecidas — o MVS sempre ocorre após o SfM ou a calibração, e é importante ter essa ordem em mente desde o início.
2. Por que uma nuvem de pontos esparsa não é suficiente?
O motivo pelo qual o SfM não gera diretamente uma nuvem de pontos densa é que sua entrada depende da correspondência de pontos de referência. Como vimos no Guia Introdutório à Detecção de Recursos, apenas pixels "distintivos" — cantos, bordas — podem ser detectados e correspondidos de forma estável. Uma região com textura uniforme, como uma parede lisa, não possui pontos de referência, deixando uma lacuna considerável na nuvem de pontos 3D do SfM.
O MVS, por outro lado, pode explorar a forte restrição de que as poses já são conhecidas, portanto, não precisa de pontos de referência. Para qualquer pixel, ele pode avaliar diretamente: "este candidato à profundidade permanece consistente nas outras imagens?". Isso abre a possibilidade de estimar a profundidade mesmo para uma parede com pouca textura, desde que haja pelo menos algum padrão ou sombreamento para trabalhar (uma superfície completamente sem recursos continua sendo um ponto fraco, como discutido abaixo).
3. O Princípio Fundamental: Fotoconsistência
Quase todos os métodos MVS são construídos com base na premissa de fotoconsistência. Suponha que a profundidade do ponto 3D correspondente ao pixel \mathbf{u} em uma imagem de referência seja d; esse ponto 3D pode ser recuperado como
e a premissa de fotoconsistência é que, ao reprojetá-lo em outra imagem k, no pixel \mathbf{u}' = \pi_k(\mathbf{X}(\mathbf{u},d)), a cor e o brilho devem ser próximos aos de I_{\text{ref}}(\mathbf{u}). Isso é mais fácil de entender como uma generalização, de 2 pontos de vista para N pontos de vista, da busca de disparidade em câmeras estéreo — o processo, abordado em Como Funcionam as Câmeras de Profundidade e Como Funcionam as Câmeras Estéreo, de encontrar pixels correspondentes entre as imagens esquerda e direita, combinando o brilho. Na verdade, a profundidade para uma câmera estéreo de dois olhos é encontrada pela fórmula simples
usando a distância focal f, o comprimento da linha de base B e a disparidade d_{\text{disp}} — e o MVS é exatamente essa operação de "buscar disparidade e converter em profundidade", estendida a qualquer número de câmeras em qualquer configuração.
Uma implementação típica usa uma pequena janela W ao redor do pixel e mede essa concordância com correlação cruzada normalizada (NCC).
\mathbf{x}' é o ponto correspondente obtido mapeando \mathbf{x} na imagem k, assumindo um plano local na profundidade candidata d. \mathrm{NCC} é robusto a mudanças de escala de brilho e deslocamento, portanto, funciona mesmo com alguma diferença de exposição ou iluminação entre as imagens. O cálculo dessa pontuação de concordância para cada par de imagens e cada profundidade candidata, e a escolha da profundidade com a melhor pontuação, formam a estrutura computacional do MVS.
4. O Pipeline Básico
A forma básica clássica do MVS é uma estrutura de dois estágios: primeiro, escolhe-se entre o método Plane-Sweep ou o método baseado em Patch para encontrar o mapa de profundidade denso de cada imagem e, em seguida, fundi-los em uma forma 3D consistente no segundo estágio. Os métodos modernos baseados em aprendizado profundo seguem, em grande parte, essa mesma estrutura de dois estágios, substituindo os mecanismos internos da estimativa de profundidade por uma rede neural.
5. O Método Plane-Sweep
O método Plane-Sweep remonta a uma abordagem de correspondência de múltiplas imagens por varredura espacial proposta por Collins na CVPR 1996. Ele alinha planos virtuais, espaçados em intervalos regulares, perpendiculares ao eixo óptico da câmera de referência (ou orientados de acordo com a cena) dentro do campo de visão da câmera de referência. frustum, e avalia à medida que varre a profundidade de rasa para profunda.
Assumindo um plano em alguma profundidade d, pontos nesse plano podem ser mapeados da imagem de referência para outra imagem por meio de uma transformação de homografia. Usando uma transformação da forma H = K_k(R+\mathbf{t}\mathbf{n}^\mathsf{T}/d)K_{\text{ref}}^{-1}, abordada em o Guia de Homografia, a outra imagem I_k é deformada para o ponto de vista de referência. A fotoconsistência (como o NCC da seção anterior) é calculada em cada pixel entre a imagem deformada e a imagem de referência, e o custo é acumulado para cada candidato de profundidade.
Uma vez que o custo tenha sido calculado para cada candidato de profundidade, a profundidade de custo mínimo é escolhida por pixel. Esta é uma busca de profundidade discreta, que combina bem com a paralelização por GPU, avaliando muitas hipóteses de profundidade simultaneamente. Muitas As implementações combinam isso com agregação de custo semilocal (regularização semelhante à Correspondência Semi-Global), interpolando suavemente a profundidade a partir de informações vizinhas, mesmo em regiões com pouca textura. O módulo de reconstrução densa do COLMAP também adota uma abordagem próxima à Varredura de Plano, otimizando a seleção de visualização por pixel (Seleção de Visualização por Pixel) — o artigo de Schönberger et al. na ECCV 2016 é um exemplo representativo.
6. O Método Baseado em Patch (PMVS)
Em vez de varrer a profundidade pixel por pixel, o método baseado em patch gera e expande diretamente um conjunto de pequenos patches retangulares que cobrem a superfície da cena. Um exemplo representativo é o PMVS (Patch-based Multi-View Stereo), publicado por Furukawa e Ponce no IEEE TPAMI em 2010.
O processamento repete três etapas: "correspondência, expansão, filtragem".
- Correspondência: primeiro, gera-se um pequeno número de patches iniciais a partir de pontos de correspondência fáceis de detectar como pontos de características, como SIFT ou Cantos de Harris. Cada patch carrega uma posição central, uma direção normal e o conjunto de imagens que veem esse ponto (visibilidade).
- Expandir: propagar novos patches na vizinhança dos patches iniciais, ampliando a área coberta para os pixels circundantes. A posição e a normal de cada patch propagado são otimizadas localmente para maximizar a fotoconsistência com as imagens circundantes.
- Filtrar: remover patches com contradições de visibilidade (como um caso em que um patch é supostamente visível apesar de estar atrás de outro patch) ou baixa fotoconsistência.
Ao contrário do Plane-Sweep, que determina a profundidade independentemente por pixel, o PMVS carrega a informação extra da normal de um patch, portanto, tende a ter maior precisão de reconstrução para superfícies oblíquas. Por outro lado, como é baseado na expansão e filtragem iterativas, a expansão não progride bem em regiões com poucos patches iniciais ou textura ruim, e a reconstrução tende a deixar lacunas.
7. Métodos Baseados em Aprendizado Profundo: a Ideia de Custo-Volume
Nos últimos anos, métodos que A representação da concordância por candidato de profundidade não com uma métrica projetada manualmente (como NCC), mas com características aprendidas por uma rede neural convolucional e um volume de custo, tornou-se comum. Um exemplo representativo é o MVSNet, publicado por Yao et al. na ECCV 2018.
O MVSNet obtém um mapa de características de cada imagem por meio de um extrator de características treinado, assume planos de profundidade discretos dentro do frustum de visão da câmera de referência e alinha o mapa de características de cada imagem ao ponto de vista de referência por meio de uma deformação homográfica diferenciável. Ele combina a variância entre os mapas de características de múltiplas imagens em um único volume de custo, regulariza-o com convolução 3D e, em seguida, realiza uma regressão de profundidade por meio de uma função softmax ao longo da direção da profundidade. Seu esqueleto básico segue a ideia do Plane-Sweep de "varrer candidatos de profundidade e avaliar", mas a diferença em relação aos métodos clássicos é que o cálculo da fotoconsistência em si se torna aprendível.
Métodos baseados em aprendizado tendem a se comportar de forma mais robusta em condições nas quais as métricas de fotoconsistência projetadas manualmente apresentam dificuldades. — padrões repetitivos, textura fraca — desde que os dados de treinamento incluam situações semelhantes. Por outro lado, o desempenho pode degradar em cenas muito fora da distribuição do conjunto de dados de treinamento (materiais desconhecidos, iluminação extrema).
8. Fusão e Malha de Mapas de Profundidade
Como os mapas de profundidade multiview são estimados independentemente, a simples sobreposição deles como pontos 3D resulta em contradições devido a ruído e oclusão (pontos ligeiramente deslocados no mesmo local se acumulando em várias camadas, ou profundidades diferentes entre os pontos de vista). A fusão é o processo que consolida esses mapas de profundidade em uma única representação consistente.
-
Fusão como nuvem de pontos: adota apenas os pixels onde a profundidade é consistente entre os pontos de vista, descarta a profundidade de baixa confiança e integra. O COLMAP e outros geram uma nuvem de pontos densa dessa forma.
-
Fusão TSDF (Função de Distância Sinalizada Truncada): um método volumétrico, proposto por Curless e Levoy na SIGGRAPH 1996, que divide o espaço em voxels e acumula uma distância com sinal. cada voxel. Amplamente utilizado na fusão de câmeras de profundidade em tempo real (como o KinectFusion) e também aplicável à fusão de mapas de profundidade MVS.
- Malha: a partir de uma nuvem de pontos ou um campo de distância com sinal, métodos como a Reconstrução de Superfície de Poisson (2006), de Kazhdan et al., geram uma malha poligonal suave. A adição de mapeamento de textura completa um modelo 3D visualmente utilizável.
9. Comparando Algoritmos Representativos
| Aspecto | Varredura de Plano | Baseado em Patch (PMVS) | Baseado em Aprendizado (família MVSNet) |
|---|---|---|---|
| Princípio | Varre planos de profundidade, avalia a fotoconsistência por pixel | Expande e filtra pequenos patches iterativamente | Regulariza um volume de custo com uma CNN e regride a profundidade |
| Precisão | Depende da resolução de profundidade e do projeto de agregação de custo; moderada a alta | Tende a ser preciso para Formas locais oblíquas ou complexas | Alta precisão em condições próximas aos dados de treinamento |
| Custo computacional | Facilmente paralelizado em GPU, rápido | Tende a ser mais lento que o Plane-Sweep devido ao processamento iterativo | Inferência rápida após o treinamento; o custo do treinamento é separado |
| Robustez | Fraco em regiões com pouca textura | Tende a deixar lacunas em regiões com poucos patches iniciais | Comparativamente robusto a texturas fracas ou padrões repetitivos |
| Dificuldade de implementação | Moderada (deformação de homografia e agregação de custos) | Alta (gerenciamento de visibilidade e projeto de expansão iterativa) | Alta (requer dados de treinamento e projeto de rede) |
| Implementações representativas | COLMAP denso, muitas ferramentas comerciais de fotogrametria | PMVS/CMVS | MVSNet, métodos subsequentes baseados em aprendizado |
10. Relação com câmeras estéreo e de profundidade
O MVS compartilha seu princípio subjacente — "encontrar profundidade a partir da correspondência entre múltiplos pontos de vista" — com [estéreo As câmeras estéreo e as câmeras de profundidade ocupam posições diferentes.
-
As câmeras estéreo utilizam um arranjo fixo de dois olhos, restringindo a busca de disparidade a uma dimensão ao longo da linha epipolar, e são projetadas com base no processamento em tempo real. O método Plane-Sweep do MVS pode ser entendido como uma generalização dessa busca de disparidade para qualquer número de câmeras em qualquer arranjo.
-
As câmeras de profundidade (luz estruturada, ToF, estéreo ativo) projetam luz ativamente, permitindo que obtenham distância de forma estável mesmo em superfícies com pouca textura. Como o MVS depende exclusivamente da fotoconsistência passiva, ele está inerentemente em desvantagem em superfícies com poucos padrões — uma clara distinção em relação às câmeras de profundidade ativas.
-
O MVS é fundamentalmente offline, construindo formas de alta precisão e alta densidade a partir de muitas imagens (dezenas a centenas), enquanto as câmeras estéreo e de profundidade são otimizadas para processamento em tempo real. Continue gerando profundidade quadro a quadro, em tempo real.
Dependendo da aplicação, robôs ou realidade aumentada que precisam de desempenho em tempo real são adequados para câmeras estéreo/de profundidade, enquanto modelos 3D offline de alta precisão para documentação de patrimônio cultural, levantamento arquitetônico ou fotogrametria são adequados para o MVS.
11. Condições Difíceis e Casos Comuns de Falha
-
Superfícies com pouca textura ou uniformes: paredes brancas, pisos lisos e céus oferecem poucas pistas para a fotoconsistência, deixando a profundidade indeterminada ou influenciada por ruídos externos.
-
Objetos especulares, transparentes ou translúcidos: superfícies de vidro, água e brilhos metálicos mudam de aparência dependendo do ponto de vista, quebrando a própria premissa de fotoconsistência.
-
Padrões repetitivos: ladrilhos, tijolos e fileiras de plantações em um campo podem produzir "soluções fantasmas", onde uma profundidade incorreta ainda mostra alta fotoconsistência local.
-
Oclusão: regiões visíveis apenas de alguns pontos de vista podem acabar sendo avaliadas incorretamente. Consistência fotográfica: usar a imagem errada se a visibilidade for estimada incorretamente, comprometendo a estimativa de profundidade.
- Pontos de vista insuficientes ou paralaxe: se o número de pontos de vista que cobrem a cena for pequeno ou a paralaxe for muito pequena, simplesmente não haverá resolução disponível na direção da profundidade.
12. Escolhas Práticas
-
Se as poses já forem conhecidas a partir de SfM ou calibração e o objetivo for a reconstrução 3D offline com foco na precisão (documentação de patrimônio cultural, levantamento arquitetônico, fotogrametria para produção de vídeo), uma implementação da família Plane-Sweep, como o pipeline denso do COLMAP, é um ponto de partida acessível.
-
Se a precisão para superfícies oblíquas ou formas locais complexas for uma prioridade específica, considere uma abordagem baseada em patches da família PMVS ou uma implementação híbrida que incorpore suas ideias.
-
Se você souber antecipadamente que a cena tem pouca textura ou muitos padrões repetitivos, os métodos baseados em aprendizado (família MVSNet) tendem a ser mais robustos. Como o desempenho pode ser prejudicado em cenas fora da distribuição dos dados de treinamento, avalie antes de adotar uma abordagem com base em dados próximos ao seu domínio de destino.
- Para aplicações que exigem desempenho em tempo real — robôs, AR/VR, detecção de obstáculos em direção autônoma — considere câmeras estéreo ou câmeras de profundidade em vez de MVS. A principal área de atuação do MVS é a reconstrução offline, de alta densidade e alta precisão.
Se o produto final precisar ser uma malha ou um modelo 3D texturizado, escolha a fusão TSDF ou a Reconstrução de Superfície de Poisson na etapa de fusão do mapa de profundidade; se uma nuvem de pontos for suficiente, você pode parar por aí.
13. Resumo
O Multi-View Stereo (MVS) utiliza poses de câmera já conhecidas a partir de SfM ou calibração como dados e recupera a profundidade densa usando a consistência fotográfica como pista. As duas abordagens clássicas, Plane-Sweep e Patch-based, têm diferentes vantagens e desvantagens e, nos últimos anos, Os métodos da família MVSNet, que aprendem um volume de custo, estão elevando ainda mais a precisão e a robustez. Todo o fluxo se estende até a fusão e a malha dos mapas de profundidade resultantes, e entender a divisão — MVS sacrificando o desempenho em tempo real pela precisão, versus câmeras estéreo/de profundidade priorizando o desempenho em tempo real — é fundamental para fazer a escolha prática correta.
Uma nuvem de pontos mais densa garante uma geometria mais precisa?
Mais profundidades incorretas não melhoram a precisão. Verifique a consistência multiview, oclusão, reflexão e textura separadamente da densidade.
Referências
- Collins, A Space-Sweep Approach to True Multi-Image Matching (CVPR 1996)
- [Furukawa & Ponce, Accurate, Dense, and Robust Multi-View Stereopsia (IEEE TPAMI, 2010)
- Seitz, Curless, Diebel, Scharstein & Szeliski, Uma comparação e avaliação de algoritmos de reconstrução estéreo multiview (CVPR 2006)
- Schönberger, Zheng, Pollefeys & Frahm, Seleção de visualização pixel a pixel para estéreo multiview não estruturado (ECCV 2016)
- Yao, Luo, Li, Fang & Quan, MVSNet: Inferência de profundidade para estéreo multiview não estruturado (ECCV 2018)
- Curless & Levoy, Um método volumétrico para construção de modelos complexos a partir de imagens de alcance (SIGGRAPH 1996)
- Kazhdan, Bolitho & Hoppe, Reconstrução de Superfície de Poisson (Simpósio Eurographics sobre Processamento de Geometria, 2006)
- Documentação oficial do COLMAP: Reconstrução Densa
Comentários
Entre na sua conta para continuar.
Ainda não há dados.