Contents — find the section you need

Para determinar si dos puntos de una imagen muestran lo mismo, es más eficiente comparar pequeñas pistas que se pueden encontrar de forma repetible que comparar la imagen completa. El proceso de selección de estas pistas se denomina detección de características. Constituye el punto de partida de cualquier proceso que requiera correspondencia entre imágenes: estimación del movimiento de la cámara, creación de panoramas, reconstrucción 3D, recuperación de imágenes e inspección visual. Este artículo distingue entre "dónde seleccionar" y "cómo relacionar los puntos seleccionados", y organiza el razonamiento detrás de los algoritmos clásicos desde una perspectiva tanto teórica como práctica.

Cámara de profundidad Intel RealSense D435 montada en un trípodeIntel RealSense D435

Imagen: Intel Cámara de profundidad RealSense D435 (Marc Auledas, CC BY-SA 4.0), Wikimedia Commons. Una cámara representativa, no un dispositivo exclusivo para la detección de características.

Resumen de 30 segundos

  • Coloque los puntos de referencia no en paredes planas, sino en esquinas con cambios de intensidad en múltiples direcciones, o en zonas cuyo brillo difiera del de su entorno. Lo importante es que se detecten de nuevo en el mismo lugar tras una pequeña transformación de la imagen (repetibilidad).
  • La detección de esquinas captura la bidireccionalidad de los gradientes locales; la detección de manchas captura un parche de brillo localmente distinto a cierta escala. DoG busca rápidamente candidatos a manchas a partir de la diferencia de múltiples imágenes borrosas.

  • FAST identifica rápidamente las esquinas comparando solo los píxeles de un círculo. ORB combina FAST con una pirámide de imágenes, estimación de orientación y un descriptor binario BRIEF rotado, lo que lo hace adecuado para su uso en tiempo real.

  • SIFT selecciona la escala mediante DoG, normaliza la orientación con un histograma de dirección de gradiente y construye un descriptor de 128 dimensiones. El costo computacional y de memoria aumenta, pero es robusto a los cambios de escala y rotación.

  • La detección por sí sola no determina la correspondencia. La distancia del descriptor, la prueba de razón y la verificación geométrica basada en RANSAC deben evaluarse conjuntamente como un único proceso. Recientemente, la detección y la correspondencia basadas en aprendizaje, como SuperPoint, ALIKED y LightGlue, también se han vuelto prácticas.

¿Qué es un punto característico? — No es un punto que destaque, sino un punto que se pueda encontrar fácilmente.

Sean las coordenadas de píxeles \mathbf{x}=(x,y)^\mathsf{T} y la imagen I(\mathbf{x}). Un punto característico es una ubicación cuyo parche vecino se puede detectar de forma estable como la misma ubicación física incluso después de una ligera traslación, rotación o escalado, y que se puede distinguir de otros puntos por el patrón circundante. El detector se denomina detector, y lo que convierte el descriptor en un vector numérico o una cadena de bits se denomina descriptor.

Estos dos son distintos. FAST es, en principio, un detector; BRIEF es un descriptor; ORB es un mecanismo que combina ambos. SIFT es la combinación de un detector DoG y un descriptor de histograma de gradiente. Comparar solo los nombres puede generar confusión, por lo que, de ahora en adelante, siempre lo trataremos como tres etapas: «seleccionar puntos», «representar el entorno» y «coincidir puntos».

Diagram 1 · Use the button to switch views
The flow of feature-based matchingDiagram showing feature points and descriptors extracted from two images, candidate correspondences geometrically verified with RANSAC, to obtain reliable correspondences. Image AInput frameDetect + describekeypoints / descriptorsScale and orientation stored tooCandidate matchingDistance, ratio testGeometric verificationRANSACCorrespondence / poseThe same extraction runs on Image B too

Figura: creada por Duskcoil. La calidad del sistema no se rige por el número de detecciones, sino por el número de correspondencias

que resultan geométricamente consistentes.

Esquinas: Selección de puntos que cambian en dos direcciones

La característica más intuitiva es la esquina. El cambio aparente que se produce cuando un parche de imagen W se desplaza una pequeña distancia \mathbf{u}=(u,v)^\mathsf{T} se representa como la suma de las diferencias al cuadrado (SSD):

E(\mathbf{u})=\sum_{\mathbf{x}\in W} w(\mathbf{x})\left[I(\mathbf{x}+\mathbf{u})-I(\mathbf{x})\right]^2 \simeq \mathbf{u}^{\mathsf{T}}\mathbf{M}\mathbf{u}

Bajo una aproximación de Taylor de primer orden, la matriz de estructura local (segundo momento) \mathbf{M} se convierte en:

\mathbf{M}=\sum_{\mathbf{x}\in W}w(\mathbf{x}) \begin{bmatrix}I_x^2&I_xI_y\\I_xI_y&I_y^2\end{bmatrix}

donde I_x,I_y son los gradientes de la imagen y w es un peso, como una ventana gaussiana. Sean los valores propios de \mathbf{M} \lambda_1,\lambda_2; un punto es una esquina donde incluso el valor propio más pequeño es grande. En un borde, donde el gradiente es grande solo en una dirección, un valor propio permanece pequeño. En plano En ambas regiones, el detector Harris no calcula explícitamente los autovalores en cada píxel; en su lugar, selecciona los máximos locales del siguiente valor de respuesta:

R=\det(\mathbf{M})-k\,\mathrm{trace}(\mathbf{M})^2 =\lambda_1\lambda_2-k(\lambda_1+\lambda_2)^2

k suele estar entre 0,04 y 0,06. Harris es relativamente robusto a la rotación, pero como analiza una ventana de tamaño fijo, carece de un mecanismo para seleccionar el mismo punto cuando el objeto se amplía o reduce significativamente. El \min(\lambda_1,\lambda_2) de Shi-Tomasi también se utiliza ampliamente como criterio práctico para seleccionar esquinas adecuadas para el seguimiento.

Manchas: Una "mancha", incluso sin esquina, es una pista útil

Las esquinas por sí solas no detectan adecuadamente logotipos redondos, manchas, agujeros oscuros ni el centro de un reflejo brillante. Por lo tanto, un detector de manchas encuentra parches de brillo localmente distintos en relación con su entorno, a cierta escala. Escriba el espacio de escala suavizado con una gaussiana. G(\mathbf{x};\sigma) como

L(\mathbf{x};\sigma)=G(\mathbf{x};\sigma)*I(\mathbf{x})

donde * es la convolución y \sigma representa "el tamaño que estamos observando". La respuesta normalizada a escala del Laplaciano de Gauss (LoG),

\sigma^2\nabla^2L=\sigma^2(L_{xx}+L_{yy})

responde fuertemente a un círculo oscuro sobre un fondo brillante, o a un círculo brillante sobre un fondo oscuro. Encontrar extremos no solo en la posición, sino también en el espacio tridimensional (x,y,\sigma), incluyendo la dirección \sigma, permite identificar simultáneamente el centro y el tamaño característico de una mancha. Esto también puede interpretarse como la escala correspondiente a una mancha circular cuyo radio es aproximadamente \sqrt{2}\sigma.

LoG es una excelente idea, pero calcular la segunda derivada exacta en cada escala es costoso. Esta aproximación y aceleración conducen a DoG, y de ahí a SIFT.

DoG: Búsqueda de candidatos invariantes a escala a partir de una diferencia de desenfoques

La diferencia de gaussianas (DoG) es la diferencia entre dos imágenes desenfocadas adyacentes:

D(\mathbf{x};\sigma)=L(\mathbf{x};k\sigma)-L(\mathbf{x};\sigma)

donde k>1 es la relación entre escalas adyacentes. Salvo un factor constante, DoG se aproxima al LoG normalizado a escala, por lo que se pueden buscar candidatos a blobs con una sola convolución adicional. En la implementación, se construye una pirámide gaussiana desenfocando progresivamente la imagen y se compara cada píxel DoG con sus 8 vecinos a la misma escala, más 9 vecinos a cada una de las escalas superior e inferior (26 en total). Un máximo o un mínimo lo convierte en un candidato.

Los candidatos no se utilizan tal cual. Los extremos débiles son ruido y se descartan, al igual que los extremos a lo largo de bordes alargados. La interpolación de una función cuadrática 3D alrededor de un extremo DoG proporciona la posición y la escala subpíxel. Para la matriz hessiana:

\mathbf{H}=\begin{bmatrix}D_{xx}&D_{xy}\\D_{xy}&D_{yy}\end{bmatrix}

Un valor grande de \mathrm{Tr}(\mathbf{H})^2/\det(\mathbf{H}) indica una respuesta de borde donde solo una curvatura principal es fuerte, y dichos puntos se excluyen. Esto resuelve el mismo problema que en la detección de esquinas: un punto en un borde se ve similar incluso cuando se desplaza a lo largo del borde, por lo que su correspondencia no se puede determinar de forma unívoca.

FAST: Detección rápida de esquinas observando solo un círculo

FAST (Features from Accelerated Segment Test) utiliza los 16 píxeles de un círculo de Bresenham de radio 3 alrededor del píxel p. Dado un umbral t, si n píxeles consecutivos (normalmente 9 o 12) son todos más brillantes que I_p+t, o todos más oscuros que I_p-t, p se considera una esquina.

\exists\,S_n:\quad \forall q\in S_n,\quad I_q>I_p+t\quad\text{or}\quad I_q<I_p-t

Porque No calcula gradientes ni matrices —solo un pequeño número de comparaciones de píxeles más un rechazo temprano—, por lo que es extremadamente rápido. El diseño que primero verifica los píxeles en las posiciones de las 1, 5, 9 y 13 en punto del círculo, y se detiene inmediatamente si no se puede formar una secuencia continua de píxeles claros/oscuros, es clave para su velocidad. Por otro lado, FAST simple no proporciona ni escala ni orientación, y tiende a responder a muchos puntos a lo largo de los bordes. Solo después de calcular la diferencia de intensidad con respecto al entorno, aplicar la supresión de no máximos (NMS) y combinarlo con una pirámide de imágenes se convierte en un detector multiescala práctico.

ORB: No dejar a FAST como "Rápido pero difícil de usar"

ORB (Oriented FAST and Rotated BRIEF) es una construcción que refuerza FAST y BRIEF, orientada a la coincidencia de imágenes en tiempo real. Primero, ejecuta FAST a través de una pirámide de imágenes en cada relación de reducción s, conservando los puntos superiores de cada nivel. Esto proporciona, si no una coincidencia exacta, Robustez ante cambios de escala.

A continuación, calcula el centroide de intensidad del parche alrededor del punto p. A partir de los instantes

m_{pq}=\sum_{x,y}x^py^q I(x,y),\qquad \mathbf{c}=\left(\frac{m_{10}}{m_{00}},\frac{m_{01}}{m_{00}}\right)

el ángulo \theta=\operatorname{atan2}(m_{01},m_{10}) desde el centro p hasta el centroide \mathbf{c} se convierte en la orientación dominante. El descriptor BRIEF es una cadena de bits que compara pares de píxeles (\mathbf{a}_i,\mathbf{b}_i) dentro del parche:

\tau_i=\begin{cases}1&I(\mathbf{a}_i)<I(\mathbf{b}_i)\\0&\text{otherwise}\end{cases}

dispuestos aproximadamente 256 veces. En ORB, las coordenadas de los pares de puntos se rotan mediante \theta antes de la comparación, por lo que el mismo patrón de bits tiende a resultar incluso después de la rotación. rBRIEF, que aprende a seleccionar pares de comparación de baja correlación, es otra forma de preservar el contenido de información de los bits. La distancia entre cadenas binarias se puede calcular rápidamente como la distancia de Hamming: el número de bits activados después de XOR.

La principal ventaja de ORB reside en su velocidad y eficiencia de memoria en CPU y dispositivos embebidos, y se utiliza ampliamente en SLAM visual. Sin embargo, ante grandes diferencias de escala, desenfoque intenso o cambios significativos de perspectiva, SIFT o características basadas en aprendizaje con descripciones de gradiente más ricas pueden resultar ventajosas.

SIFT: Normalización consistente de escala, orientación y descripción

La Transformación de Características Invariantes a la Escala (SIFT) detecta los extremos de (x,y,\sigma) mediante DoG y elimina los puntos de bajo contraste y las respuestas de borde. Alrededor de cada punto, calcula la magnitud y la dirección del gradiente, y construye un histograma de orientación ponderado por una distribución gaussiana. El pico más grande se convierte en la orientación dominante utilizada para normalizar la rotación del parche, y a los picos secundarios que superan el 80 % del máximo también se les asigna su propia orientación. Esta es la base de su robustez frente a la rotación.

Para el descriptor, una ventana normalizada de aproximadamente 16\times16 se divide en Las celdas 4\times4 reciben un histograma de gradiente de 8 direcciones. Por lo tanto, la dimensionalidad es 4\times4\times8=128. El vector \mathbf{d} se normaliza L2, y los elementos que superan 0,2 se recortan y se renormalizan, suprimiendo la sensibilidad a los cambios de iluminación local.

\hat{\mathbf{d}}=\frac{\mathbf{d}}{\|\mathbf{d}\|_2},\qquad d_i\leftarrow\min(\hat d_i,0.2),\qquad \mathbf{d}\leftarrow\frac{\mathbf{d}}{\|\mathbf{d}\|_2}

En otras palabras, la "invariancia" de SIFT no es magia. Es un diseño explícito que aborda cada fuente de variación individualmente: seleccionando la escala mediante la pirámide de imágenes, rotando el sistema de coordenadas según la orientación dominante y absorbiendo el contraste mediante la normalización. No es completamente inmune a la deformación afín ni a las grandes diferencias de perspectiva, que aún requieren RANSAC o geometría multivista.

Pseudocódigo de implementación mínima

El procesamiento de puntos característicos no debe detenerse en la extracción; debe implementarse hasta la verificación de correspondencia. A continuación se presenta un esquema que se aplica tanto a ORB como a SIFT.

function match_images(imageA, imageB, method):
    grayA, grayB = to_gray(imageA), to_gray(imageB)
    detector = create(method)        # ORB: FAST+pyramid+rBRIEF / SIFT: DoG+gradient
    keyA, descA = detector.detect_and_compute(grayA)
    keyB, descB = detector.detect_and_compute(grayB)

    metric = HAMMING if method == ORB else L2
    tentative = []
    for each descriptor a in descA:
        b1, b2 = two_nearest(a, descB, metric)
        if distance(a, b1) < 0.75 * distance(a, b2):
            tentative.append((a.keypoint, b1.keypoint))

    H, inlier_mask = RANSAC_HOMOGRAPHY(tentative, reproj_threshold=3px)
    return tentative[inlier_mask], H

Tomar solo el vecino más cercano deja puntos ambiguos, como marcos de ventanas, cuadrículas y patrones repetitivos, en el resultado. La prueba de razón de Lowe utiliza la razón entre la mejor distancia d_1 y la segunda mejor d_2, descartando candidatos donde la diferencia con el segundo mejor no es lo suficientemente grande. RANSAC estima entonces una homografía \mathbf{H} o matriz fundamental a partir de pequeños subconjuntos aleatorios de correspondencias como hipótesis, y selecciona la hipótesis que explica la mayor cantidad de correspondencias (inliers) con un pequeño error de reproyección. Si el objeto es plano, o la cámara simplemente se rotó en su lugar, la consistencia se puede verificar con la homografía.

\tilde{\mathbf{x}}'\sim\mathbf{H}\tilde{\mathbf{x}}

Para una escena 3D general, se utiliza la matriz fundamental/esencial. El número de inliers y la razón que se conservan hasta este punto representan la cantidad de características realmente utilizables.

¿Qué es robusto? Iluminación, escala y rotación, y en qué medida

Ante los cambios de iluminación, un simple ajuste de brillo (I'(x,y)=I(x,y)+b) elimina las diferencias de píxeles, pero tiene poco efecto en las relaciones relativas de los gradientes o las comparaciones binarias. Un cambio de contraste uniforme (I'=aI+b) también se maneja bastante bien mediante la normalización de descriptores de SIFT. Sin embargo, cuando la estructura local cambia (saturación de la exposición, límites de sombras, reflejos, día frente a noche), los métodos clásicos por sí solos no ofrecen garantías. Durante la captura, corrija o gestione con precisión la exposición y, si es necesario, aplique una corrección de contraste local como CLAHE en las mismas condiciones para ambas imágenes. La sobrecorrección conlleva el riesgo de convertir el ruido en características espurias, así que tenga cuidado.

Harris o FAST de resolución única son inherentemente débiles ante los cambios de escala. ORB, que busca candidatos a lo largo de una pirámide de imágenes, tiene una tolerancia práctica, aunque no la misma normalización que SIFT, que selecciona extremos de escala continuos mediante DoG. Si la textura desaparece a escala reducida, ningún método puede encontrar correspondencia. La resolución de entrada, la profundidad de la pirámide y el tamaño mínimo del parche deben decidirse a partir de Rango esperado de variación de la distancia de captura.

Ante la rotación, la respuesta de Harris es relativamente estable, pero la correspondencia requiere rotar también el sistema de coordenadas del descriptor. ORB asigna la orientación mediante el centroide de intensidad, mientras que SIFT lo hace mediante el histograma de dirección del gradiente. Esta normalización de ángulo continuo es más efectiva que un descriptor que solo maneja pasos de rotación de 90 grados. Por otro lado, una vista oblicua pronunciada no se basa en rotación y escalado, sino en una deformación afín/proyectiva, lo que requiere datos multivista, características covariantes afines o características basadas en aprendizaje combinadas con verificación geométrica.

Métricas de evaluación: Medir correspondencias útiles, no recuento de puntos

Para un par de imágenes con una homografía conocida H, proyectar el punto \mathbf{x}_i de la imagen A en la B, y si existe un punto dentro de la distancia \epsilon en el conjunto de puntos detectados K_B, contarlo como una redetección exitosa. La repetibilidad es conceptualmente

\mathrm{Repeatability}=\frac{\#\{\mathbf{x}_i\in K_A: \min_{\mathbf{y}\in K_B}\|H\mathbf{x}_i-\mathbf{y}\|<\epsilon\}}{\min(|K_A|,|K_B|)}

Pero encontrar la misma ubicación es inútil si los descriptores no pueden distinguirla. Por lo tanto, también se informa la precisión de coincidencia (fracción de correspondencias correctas), el recuento de correspondencias correctas, la proporción de coincidencias posteriores a RANSAC, el error de rotación/traslación de la pose estimada, el tiempo de procesamiento y la memoria. HPatches es un benchmark representativo que separa el cambio de iluminación del cambio de punto de vista para evaluar la coincidencia de parches, los detectores y la estimación de homografía. A menos que se mida con datos que coincidan con la geometría de la aplicación (planar o 3D de línea base ancha), no se debe adoptar la clasificación de una sola puntuación tal cual.

Método Núcleo de detección Descriptor Escala/rotación Distancia de coincidencia Ventajas Principales advertencias
Harris + parche Matriz de estructura Parche sin procesar, etc. Escala ✕, rotación separada SSD/NCC Principio claro Débil a la iluminación/escala
LoG / DoG Extremos de blob en el espacio de escala Necesita un descriptor separado Escala ◎, rotación separada Depende del descriptor Obtiene blob y escala Se requiere cálculo de pirámide
RÁPIDO + BREVE Brillo continuo en el círculo Comparación binaria Ninguno por sí solo Hamming Muy rápido Débil al punto de vista/escala
ORB Pirámide RÁPIDO rBRIEF rotado Escala ○, rotación ○ Hamming Ligero, compatible con tiempo real Limitado bajo grandes deformaciones
SIFT Extremos DoG Histograma de gradiente de 128 dimensiones Escala ◎, rotación ◎ L2 Sólido, bien validado Consume mucha CPU/memoria
Basado en aprendizaje Aprendido a través de la red Aprendido Vector Reforzado mediante datos L2 / aprendido Alta tasa de correspondencia en condiciones difíciles Requiere modelo, GPU y gestión de reproducibilidad

Los símbolos ○ y ◎ de la tabla no son calificaciones absolutas, sino puntos de referencia relativos para implementaciones típicas y rangos esperados. Incluso SIFT es ambiguo cuando el mismo patrón de cuadrícula llena el fotograma, e incluso ORB puede obtener suficientes coincidencias en condiciones moderadas.

Ubicación en las bibliotecas actuales y productos reales

Para un primer prototipo, cv::ORB::create(), cv::SIFT::create() y cv::FastFeatureDetector::create() de OpenCV son fáciles de usar. ORB se combina con BFMatcher(NORM_HAMMING); SIFT con BFMatcher de distancia L2 o un comparador basado en FLANN. Incluso si se desea separar el detector y el descriptor, la API Feature2D de OpenCV mantiene el mismo flujo de trabajo. Para experimentación basada en aprendizaje y GPU. Para el procesamiento, Kornia en PyTorch proporciona SIFT, ORB, DISK, KeyNet/HardNet, LightGlue y más como bloques de construcción.

En la práctica de la fotogrametría y la reconstrucción 3D, COLMAP es la herramienta representativa; su documentación oficial actual admite SIFT estándar más ALIKED cuando se compila con ONNX habilitado. Dado que tanto SIFT como ALIKED pueden conectarse a la coincidencia por fuerza bruta o a la coincidencia LightGlue, es fácil comparar los enfoques clásicos y basados en aprendizaje en el punto de entrada de la reconstrucción. Al elegir un producto o biblioteca, es mejor decidir primero si debe ejecutarse solo en CPU, el presupuesto de latencia, si se acepta una coincidencia offline intensiva y si se requiere la fijación de versiones reproducible, en lugar de si el nombre del modelo suena novedoso.

Investigación reciente: Optimización conjunta de detección, descripción y coincidencia

Un punto de inflexión para los enfoques basados en aprendizaje fue SuperPoint. Una red totalmente convolucional genera un mapa de probabilidad de puntos de interés y un mapa de descriptores simultáneamente, aprendiendo de forma auto-supervisada, mediante Adaptación Homográfica, para reproducir puntos a través de transformaciones geométricas. La idea consiste en aprender de los datos dónde se encuentran las ubicaciones útiles para la correspondencia, en lugar de depender únicamente de una noción predefinida de "esquina".

DISK aborda el problema de que seleccionar puntos dispersos y emparejarlos es discreto y difícil de diferenciar, optimizando la detección y la descripción de extremo a extremo con gradientes de política que recompensan el número de correspondencias correctas. ALIKED utiliza un cabezal de descriptor deformable disperso que aprende ubicaciones de soporte deformables alrededor de cada punto clave, con el objetivo de equilibrar la expresividad y la eficiencia extrayendo descriptores en puntos dispersos en lugar de en todo el mapa de características denso.

Los algoritmos de emparejamiento también se están alejando de la búsqueda independiente del vecino más cercano. LightGlue estima las correspondencias entre dos conjuntos de características locales mediante un mecanismo de atención, con un cálculo adaptativo que se detiene prematuramente cuando un par de imágenes es fácil de emparejar. Si bien no es un detector de características en sí mismo, es un recordatorio importante de que una buena distancia del descriptor al detector por sí sola no garantiza buenas correspondencias finales. Actualmente, es práctico comparar una configuración que utiliza características clásicas con un algoritmo de emparejamiento ligero frente a una configuración que empareja Se han aprendido características como SuperPoint/ALIKED con LightGlue, con la misma configuración RANSAC en los datos objetivo.

Lista de verificación para la selección y el ajuste

  • Primero, registre el número de detecciones, el número de pruebas de razón de aprobación, el número de coincidencias RANSAC, la razón de coincidencias y el tiempo de procesamiento en pares de imágenes reales. Aumentar solo el número de detecciones puede ser contraproducente si las discrepancias aumentan simultáneamente.

  • Para el seguimiento de corta duración cerca de una cámara fija, comience con FAST/ORB y ajuste nfeatures, el umbral de FAST y los niveles de la pirámide. Con poca textura, verifique el desenfoque, la exposición y el enfoque antes de reducir el umbral.

  • Para la coincidencia de imágenes fijas con grandes cambios en la distancia de captura o la rotación, utilice SIFT como referencia. Siempre se debe verificar si un método más rápido supera a SIFT en los mismos datos con la misma verificación geométrica.

  • De noche, con fuerte contraluz, durante cambios estacionales o con grandes diferencias de perspectiva, considere también las características basadas en aprendizaje. Sin embargo, tenga en cuenta la diferencia entre los datos de entrenamiento y el entorno objetivo, las actualizaciones del modelo y la disponibilidad de la GPU en el rendimiento. Evaluación.

  • Los patrones repetitivos, las superficies especulares, los objetos en movimiento y el desenfoque extremo por movimiento representan menos un problema de detección de características que una ambigüedad en la observación. Se puede compensar con enmascaramiento, seguimiento temporal, fusión de sensores y planificación de captura.

La detección de características no es un clasificador universal para comprender imágenes. Sin embargo, sigue siendo una tecnología fundamental eficaz para seleccionar, con un mínimo de procesamiento, qué píxeles pueden soportar geometría. Comprender los conceptos de esquinas, regiones, espacio de escala y normalización de orientación permite rastrear las causas de los fallos en los datos, ya sea ajustando ORB/SIFT clásicos o evaluando características basadas en aprendizaje.

Comprueba tu comprensión
¿Es fácil rastrear cada punto de un borde pronunciado?

El movimiento a lo largo de un solo borde es ambiguo. Las esquinas proporcionan cambios de intensidad en diferentes direcciones, lo que facilita la identificación del movimiento bidimensional.

Referencias

Gira una imagen sintética en el laboratorio de extracción y compara las detecciones Harris y Shi–Tomasi.

What to read next

Review the backgroundIntroducción a la calibración de cámaras: recuperación de la distorsión de la lente y los parámetros intrínsecos.Continue the seriesLab de brillo y luminancia — exposición, gamma y recorteExplore another aspect of this fieldLaboratorio de extracción de puntos — comparar Harris y Shi–Tomasi