Contents — find the section you need

La stima della profondità monoculare prevede la distanza per pixel a partire da una singola immagine RGB. Una singola immagine non è in grado di distinguere in modo univoco un piccolo oggetto vicino da uno grande e distante con le stesse dimensioni apparenti. Pertanto, la prima domanda da porsi è se un modello predice la profondità relativa (ordine anteriore-posteriore) o la profondità metrica con un'unità di misura fisica come i metri.

In breve

  • Un'immagine monoculare generalmente non determina la scala assoluta. La profondità relativa descrive l'ordine e la forma; la profondità metrica mira a una distanza unitaria.

  • Anche un modello che restituisce la profondità metrica può presentare derive di scala o errori locali al di fuori della fotocamera, della scena e della distribuzione di addestramento da cui ha appreso.

  • Un'immagine senza dati di riferimento non può stabilire l'accuratezza della profondità. È necessario distinguere tra errore di profondità, ordine relativo, limiti di occlusione e se è stato utilizzato l'allineamento di scala.

Perché l'immagine non fissa la scala

Per una fotocamera a foro stenopeico, un punto 3D (X,Y,Z) viene proiettato approssimativamente come u=fX/Z, v=fY/Z. Scalare tutte le coordinate e la profondità con lo stesso fattore non modifica la posizione dell'immagine. Questa è l'ambiguità di scala monoculare. Un modello di profondità la risolve statisticamente utilizzando le dimensioni dell'oggetto, la prospettiva, l'ombreggiatura, la texture e le informazioni a priori apprese sulla scena.

Diagram 1 · Use the button to switch views
Scala e valutazione per la profondità monoculare

Se l'output del modello \hat D è solo relativo, la valutazione può allinearlo con a\hat D+b . Un basso errore post-allineamento non dimostra che il modello possa recuperare direttamente i metri. Non mescolare mai la valutazione metrica non allineata con la valutazione relativa allineata.

Separare i tipi di output

Output Cosa supporta Condizione aggiuntiva
Profondità relativa Ordine anteriore/posteriore e forma È ancora necessaria la scala assoluta
Profondità inversa Una rappresentazione che enfatizza le regioni vicine Non confondere 1/Z con la profondità Z

Profondità metrica | Distanza in metri o altra unità | Convalidare la calibrazione della telecamera, del dominio e della scala |

Quando la profondità metrica determina la distanza o la dimensione di un ostacolo, è necessario correggere la verità di base del dominio, la sincronizzazione del sensore, i parametri intrinseci della telecamera, l'intervallo valido e la politica per i valori non validi. Il nome di un modello o un'immagine dall'aspetto plausibile non garantiscono l'accuratezza nel mondo reale.

Protocollo di valutazione minimo

Confrontare la profondità reale D e la previsione \hat D sullo stesso set di pixel validi. Le misure comuni includono l'errore relativo assoluto \mathrm{AbsRel}=\mathrm{mean}(|\hat D-D|/D), l'RMSE e l'accuratezza della soglia \delta. Registrare i pixel non validi, la gestione dell'occlusione, gli intervalli lontani esclusi e il numero di pixel validi.

Per un modello relativo, specificare se l'allineamento di scala viene stimato separatamente per ogni immagine di test o se viene impostato a partire dai dati di training. L'allineamento per singola immagine è utile per confrontare la forma relativa, ma può nascondere l'incapacità del modello di recuperare una scala fisica stabile.

Condizioni di errore comuni

  • Specchi, oggetti trasparenti, cielo e pareti lisce forniscono pochi indizi visivi affidabili.

  • Illuminazione, telecamere, regioni, oggetti o campi visivi non familiari possono alterare la scala e i confini.

  • Strutture sottili e confini di occlusione possono contenere errori locali critici per la sicurezza, nonostante un valore medio basso della metrica.

  • Le previsioni video possono presentare sfarfallii da un fotogramma all'altro. Le metriche basate su singole immagini non garantiscono la stabilità temporale.

Riepilogo

La profondità monoculare è un problema di inferenza che combina le evidenze delle immagini con informazioni visive a priori; non si tratta semplicemente di un sensore di distanza implementato nel software. Separare la profondità relativa, la profondità metrica e l'allineamento di scala, e registrare le condizioni di ground truth e di pixel validi prima di confrontare i risultati. Un laboratorio specifico per un modello dovrebbe attendere la disponibilità di input con licenza, versioni fisse, profondità di riferimento e condizioni hardware.

Verifica la tua comprensione

Un buon punteggio di profondità relativa dimostra che le distanze in metri sono corrette?

No. Verifica separatamente l'allineamento della scala, la verità di base metrica e le condizioni della telecamera e della distribuzione dei dati.

Riferimenti

What to read next

Review monocular imaging and planar distance assumptionsCome funzionano le fotocamere monoculari e i prodotti principali: Mobileye, Tesla, ContinentalReview focal length and camera intrinsicsGuida introduttiva alla calibrazione della fotocamera: recupero della distorsione dell'obiettivo e dei parametri intrinseci.Review the backgroundIntroduzione al Visual-SLAM: come una telecamera impara "Dove mi trovo?"