Contents — find the section you need
La stima della profondità monoculare prevede la distanza per pixel a partire da una singola immagine RGB. Una singola immagine non è in grado di distinguere in modo univoco un piccolo oggetto vicino da uno grande e distante con le stesse dimensioni apparenti. Pertanto, la prima domanda da porsi è se un modello predice la profondità relativa (ordine anteriore-posteriore) o la profondità metrica con un'unità di misura fisica come i metri.
In breve
-
Un'immagine monoculare generalmente non determina la scala assoluta. La profondità relativa descrive l'ordine e la forma; la profondità metrica mira a una distanza unitaria.
-
Anche un modello che restituisce la profondità metrica può presentare derive di scala o errori locali al di fuori della fotocamera, della scena e della distribuzione di addestramento da cui ha appreso.
-
Un'immagine senza dati di riferimento non può stabilire l'accuratezza della profondità. È necessario distinguere tra errore di profondità, ordine relativo, limiti di occlusione e se è stato utilizzato l'allineamento di scala.
Perché l'immagine non fissa la scala
Per una fotocamera a foro stenopeico, un punto 3D (X,Y,Z) viene proiettato approssimativamente come u=fX/Z, v=fY/Z. Scalare tutte le coordinate e la profondità con lo stesso fattore non modifica la posizione dell'immagine. Questa è l'ambiguità di scala monoculare. Un modello di profondità la risolve statisticamente utilizzando le dimensioni dell'oggetto, la prospettiva, l'ombreggiatura, la texture e le informazioni a priori apprese sulla scena.
Se l'output del modello \hat D è solo relativo, la valutazione può allinearlo con a\hat D+b . Un basso errore post-allineamento non dimostra che il modello possa recuperare direttamente i metri. Non mescolare mai la valutazione metrica non allineata con la valutazione relativa allineata.
Separare i tipi di output
| Output | Cosa supporta | Condizione aggiuntiva |
|---|---|---|
| Profondità relativa | Ordine anteriore/posteriore e forma | È ancora necessaria la scala assoluta |
| Profondità inversa | Una rappresentazione che enfatizza le regioni vicine | Non confondere 1/Z con la profondità Z |
Profondità metrica | Distanza in metri o altra unità | Convalidare la calibrazione della telecamera, del dominio e della scala |
Quando la profondità metrica determina la distanza o la dimensione di un ostacolo, è necessario correggere la verità di base del dominio, la sincronizzazione del sensore, i parametri intrinseci della telecamera, l'intervallo valido e la politica per i valori non validi. Il nome di un modello o un'immagine dall'aspetto plausibile non garantiscono l'accuratezza nel mondo reale.
Protocollo di valutazione minimo
Confrontare la profondità reale D e la previsione \hat D sullo stesso set di pixel validi. Le misure comuni includono l'errore relativo assoluto \mathrm{AbsRel}=\mathrm{mean}(|\hat D-D|/D), l'RMSE e l'accuratezza della soglia \delta. Registrare i pixel non validi, la gestione dell'occlusione, gli intervalli lontani esclusi e il numero di pixel validi.
Per un modello relativo, specificare se l'allineamento di scala viene stimato separatamente per ogni immagine di test o se viene impostato a partire dai dati di training. L'allineamento per singola immagine è utile per confrontare la forma relativa, ma può nascondere l'incapacità del modello di recuperare una scala fisica stabile.
Condizioni di errore comuni
-
Specchi, oggetti trasparenti, cielo e pareti lisce forniscono pochi indizi visivi affidabili.
-
Illuminazione, telecamere, regioni, oggetti o campi visivi non familiari possono alterare la scala e i confini.
-
Strutture sottili e confini di occlusione possono contenere errori locali critici per la sicurezza, nonostante un valore medio basso della metrica.
-
Le previsioni video possono presentare sfarfallii da un fotogramma all'altro. Le metriche basate su singole immagini non garantiscono la stabilità temporale.
Riepilogo
La profondità monoculare è un problema di inferenza che combina le evidenze delle immagini con informazioni visive a priori; non si tratta semplicemente di un sensore di distanza implementato nel software. Separare la profondità relativa, la profondità metrica e l'allineamento di scala, e registrare le condizioni di ground truth e di pixel validi prima di confrontare i risultati. Un laboratorio specifico per un modello dovrebbe attendere la disponibilità di input con licenza, versioni fisse, profondità di riferimento e condizioni hardware.
Un buon punteggio di profondità relativa dimostra che le distanze in metri sono corrette?
No. Verifica separatamente l'allineamento della scala, la verità di base metrica e le condizioni della telecamera e della distribuzione dei dati.

Commenti
Accedi per continuare.
Nessun dato disponibile.