Contents — find the section you need

A estimativa de pose pode inferir juntas 2D (u,v), juntas 3D ou rotação do objeto R e translação t. A projeção pode ser escrita como \tilde p\sim K[R|t]P. Calibração, oclusão, ambiguidade esquerda-direita e alinhamento temporal são tão importantes quanto a arquitetura da rede.

A estimativa de pose pode inferir juntas 2D (u,v), juntas 3D ou rotação do objeto R e translação t. A projeção pode ser escrita como \tilde p\sim K[R|t]P. Calibração, oclusão, ambiguidade esquerda-direita e alinhamento temporal são tão importantes quanto a arquitetura da rede.

A estimativa de pose pode inferir juntas 2D (u,v), juntas 3D ou rotação do objeto R e translação _

Diagram 1 · Use the button to switch views
Image keypoint estimationAn image is transformed to feature heatmaps and keypoint or pose coordinates.imagefeatures/heatmapskeypoints/pose

Recursos/mapas de calor

Pontos-chave/pose

Diagrama: Duskcoil, conceitual. Não autoriza uso para identificação ou vigilância.

Use mapa de calor ou regressão de coordenadas, PnP e filtragem temporal. Avalie PCK, OKS ou erro de reprojeção por oclusão, iluminação, vestuário, dispositivos auxiliares e dados demográficos. Para uso com pessoas, especifique consentimento, limitação de finalidade, retenção e revisão humana para erros.

Métodos e sistemas de coordenadas

Para poses humanas em 2D, uma rede pode selecionar o máximo de um mapa de calor para cada articulação, regredir coordenadas diretamente, estimar uma pessoa por vez após a detecção (de cima para baixo) ou associar todas as pessoas a partir de uma imagem completa (de baixo para cima). Para poses de objetos em 6D, o PnP estima a rotação e a translação a partir de pontos 3D conhecidos e correspondências de imagem. Uma rotação R\in SO(3) obedece a R^TR=I,\det R=1; a regressão direta de ângulos de Euler apresenta singularidades e descontinuidades, portanto, quatérnios normalizados ou representações contínuas em 6D são utilizados.

Saída Uso típico Métrica Falha
Ponto-chave 2D Análise de pose, UI PCK, OKS Oclusão, troca esquerda-direita
Esqueleto 3D Análise de movimento, imitação de robô MPJPE Ambiguidade de profundidade, erro de câmera
Pose de objeto 6D Preensão, RA ADD, erro de reprojeção Simetria, reflexão, outliers PnP

Dados e tratamento de falhas

Avalie oclusão, contraluz, espelhos, múltiplas pessoas, dispositivos de assistência, roupas, formato do corpo, aparência da pele e altura da câmera separadamente. Um OKS médio alto não comprova a pior latência e taxa de falhas necessárias para detecção de quedas ou prevenção de quedas em robôs colaborativos. Não reutilize pontos-chave para inferência de identidade ou emoção sem consentimento. Defina limitação de propósito, retenção, controle de acesso, exclusão e procedimentos de apelação.

Na implementação, calibre os parâmetros intrínsecos e extrínsecos e documente o quadro, a unidade, o carimbo de data/hora e a confiança. Quando a confiança for baixa, não considere a interpolação como verdade absoluta: diminua a velocidade do robô, pare-o ou solicite revisão humana. A suavização temporal reduz a oscilação, mas adiciona atraso, o que deve ser refletido na distância de parada.

  1. Defina saídas, tolerâncias e latência para a tarefa.
  2. Dividir a avaliação por atributos, oclusão e iluminação.

  3. Registrar calibração, transformações de coordenadas e outliers PnP.

  4. Testar regras de parada para baixa confiança, perda de sinal da câmera e aproximação de pessoas.

  5. Avaliação de pontos-chave COCO

Calibração e tempo pertencem a contextos externos à rede

O erro de pose não é apenas um problema da rede. Uma distância focal ou ponto principal incorretos podem tornar um ponto visualmente correto incorreto em 3D. Mantenha a ordem de distorção, redimensionamento/corte, origem e convenção de centro do pixel idênticos no treinamento e na inferência. Os parâmetros extrínsecos mudam com o movimento e a vibração da câmera, portanto, verifique novamente o erro de reprojeção em relação a um alvo de referência, em vez de confiar em uma única calibração para sempre.

Com várias câmeras ou uma IMU, verifique os timestamps antes dos frames. Um frame de atraso de 30 fps pode mover uma mão ou ferramenta rapidamente de forma significativa. Armazene o tempo de hardware, o tempo de recebimento, o tempo de conclusão da inferência e as amostras usadas para interpolação. Uma trajetória perfeitamente suavizada ainda pode chegar tarde demais para Prevenção de colisões.

Opções de pipeline

Pipeline Benefício Necessidade de computação/dados Falha principal
Monocular 2D Barato e simples Rótulos 2D, uma câmera Profundidade desconhecida, oclusão
Monocular 3D Instalação simples Informações prévias 3D, grande volume de dados Captura fora do domínio, escala
Triangulação multiview Restrição geométrica 3D Sincronização, calibração, visualizações Correspondências incorretas, fora de vista
RGB-D Profundidade direta Sensor de profundidade, limite de alcance Reflexo, luz solar, profundidade ausente
Pontos-chave + PnP Usa CAD Correspondências 3D, intrínsecos Simetria, outliers, layout degenerado

Normalizar o erro 2D pelo tamanho do alvo e definir as unidades e o quadro 3D. Para objetos simétricos, a comparação com uma rotação canônica pode marcar uma pose fisicamente correta como errada; usar ADD-S com reconhecimento de simetria ou Reprojeção e avaliação da folga de preensão. Relate o percentil 95, falhas, erros de alta confiança e latência de ponta a ponta, além do erro médio.

Caso de falha: espelhamento esquerda-direita confiável

Espelhos, vistas traseiras e auto-oclusão podem tornar um esqueleto invertido (esquerda-direita) geometricamente plausível. O suavização pode corrigir o erro por muitos quadros. Combine orientação, pistas visuais, múltiplas hipóteses e um limite de movimento; não confie apenas em restrições de comprimento ósseo. Em aplicações de segurança, alta confiança não é prova — use detecção de troca e discordância com um sensor independente como condições de parada.

Procedimento de implementação reproduzível

  1. Fixe os quadros da imagem, da câmera, do mundo e do robô com um diagrama e dados de teste.

  2. Teste as transformações de pontos-chave de ida e volta após redimensionamento, preenchimento e aumento de dados, incluindo um erro subpixel conhecido.

  3. Defina o limite e os pontos mínimos do RANSAC PnP; inspecione os pontos internos, o erro de reprojeção e a profundidade positiva.

  4. Registre casos estáticos, de caminhada, de movimento rápido, de oclusão, de borda da imagem e de falha da câmera com latência.

  5. Teste a parada e a reinicialização em casos de baixa confiança, deformação repentina do esqueleto, desvio de calibração e tempo invertido.
  6. Documente a finalidade, o acesso, a retenção, a anonimização e a exclusão se os quadros originais forem armazenados.

A pose é uma hipótese de observação, não a identidade, a intenção ou a condição de uma pessoa. Passe o quadro, o tempo e a incerteza para os sistemas subsequentes para que eles possam lidar com o "desconhecido" com segurança.

Qualidade da anotação e auditorias operacionais

As anotações também têm incerteza. Os centros das articulações sob as roupas, os pulsos ocluídos e a orientação simétrica do objeto variam entre os anotadores. Armazene os estados visíveis, ocluídos e fora do quadro separadamente; retenha as discordâncias entre anotadores, as revisões de definição e Pontos interpolados em vez de forçar a ambiguidade em um rótulo rígido. Deixe uma imagem real de teste para que o material sintético e as pistas de iluminação não dominem.

As operações podem ser monitoradas sem reter todas as imagens para sempre. Agregue confiança, contagem de juntas ausentes, erro de reprojeção, latência, status da câmera e paradas; retenha apenas os dados incidentes por um curto período com acesso controlado. Nas atualizações do modelo, reproduza vídeos idênticos e compare o comprimento do dropout, as trocas esquerda-direita e o pior erro em zonas de risco, depois recalibre após a substituição da câmera.

Verifique seu entendimento
As juntas 2D determinam exclusivamente uma pose 3D?

A profundidade permanece ambígua. Verifique as vistas adicionais, as medições de profundidade ou as suposições do modelo corporal usadas para resolvê-la.

What to read next

Review the backgroundUm guia completo para o SegFormer — Por que um Transformer sem codificação posicional funciona para segmentaçãoContinue the seriesIntrodução à Aprendizagem de Máquina: Modelos GenerativosExplore another aspect of this fieldAvaliação comparativa de LLMs locais: primeira resposta, taxa de geração e memória.