Visione artificiale
Visione artificiale — Un percorso strutturato in robotica, controllo, agricoltura in ambiente controllato, energia ed elettronica di potenza.
Find a reading order in the learning guides → Search this field →
Lab di luminosità e luminanza — esposizione, gamma e clipping
Confronta esposizione lineare e regolazioni del grigio codificato con immagini sintetiche, istogrammi e gradienti.
Hands-on · 2 min di letturaLaboratorio di estrazione dei punti — confrontare Harris e Shi–Tomasi
Ruota, ridimensiona e modifica la luminosità di immagini sintetiche per confrontare gli angoli rilevati con riferimenti noti.
Hands-on · 2 min di letturaLaboratorio di corrispondenze — filtri, inlier e verità nota
Confronta patch e filtra corrispondenze per capire perché l’accordo geometrico non garantisce un abbinamento corretto.
Hands-on · 2 min di letturaLab di flusso ottico: seguire il moto tra due immagini
Stima lo spostamento dei punti e confrontalo con una trasformazione sintetica nota. Esplora luminosità, occlusione e problema dell’apertura.
Hands-on · 2 min di lettura
Visione artificiale
September 13, 2026
Stima della profondità con un monocolo: dall'ordine relativo alla distanza metrica
Un'introduzione alla profondità monoculare: profondità relativa versus profondità metrica, ambiguità di scala, protocolli di valutazione e condizioni di guasto.
Guida allo studio · 3 min di lettura
Visione artificiale
September 13, 2026
Neural 3D: sintesi di una nuova prospettiva e valutazione visiva/geometrica separata.
Un'introduzione alle rappresentazioni neurali delle scene, alla sintesi di nuove viste, alle viste escluse e alla valutazione visiva e geometrica separate.
Guida allo studio · 3 min di letturaGuida introduttiva al Feature Tracking: come evitare di perdere lo stesso punto tra un fotogramma e l'altro.
Il feature tracking è il processo di abbinamento dello stesso punto fisico tra i fotogrammi di una sequenza video. Questo articolo organizza il template tracking, il flusso ottico di Lucas-Kanade, la corrispondenza dei descrittori, RANSAC, il rifiuto degli outlier e la predizione di Kalman con equazioni e fasi di implementazione, e spiega le condizioni in cui l'odometria visiva e lo SLAM falliscono, insieme alle relative soluzioni.
Fundamentals · 7 min di letturaGuida introduttiva alla chiusura del ciclo: correggere la deriva di un sistema SLAM in un colpo solo, attorno a un ciclo.
La chiusura del ciclo è il processo di riconoscimento del ritorno di un robot in un luogo precedentemente visitato e di distribuzione dell'errore di autolocalizzazione accumulato sull'intera mappa. Questo articolo spiega in modo sistematico il riconoscimento del luogo, il recupero delle immagini, la verifica geometrica, l'ottimizzazione del grafo delle pose, le difese contro i falsi positivi e le attuali implementazioni e ricerche SLAM.
Fundamentals · 6 min di letturaIntroduzione al flusso ottico: leggere la velocità e la struttura dal movimento dell'immagine.
Il flusso ottico è un campo vettoriale che descrive la direzione in cui si è mosso ciascun pixel in una sequenza di immagini. Questo articolo analizza il vincolo di costanza della luminosità, gli algoritmi di Lucas-Kanade e Horn-Schunck, le piramidi, il flusso denso rispetto al tracciamento di caratteristiche sparse, i metodi basati sull'apprendimento come RAFT, il movimento della telecamera, gli oggetti dinamici e la metodologia di valutazione, con la relativa matematica sottostante.
Fundamentals · 6 min di letturaGuida introduttiva a PnP: recupero della posizione della telecamera a partire da soli punti 3D e un'immagine.
Il problema Perspective-n-Point (PnP) è un problema geometrico che consiste nello stimare la posizione e l'orientamento di una telecamera a partire da punti 3D noti e dai corrispondenti punti immagine. Questo articolo analizza l'equazione di proiezione, P3P/AP3P, EPnP, l'ottimizzazione iterativa, RANSAC, la degenerazione planare e le applicazioni di PnP in Visual SLAM, AR e topografia, fornendo la parte matematica e una checklist di implementazione.
Fundamentals · 6 min di lettura
Visione artificiale
September 7, 2026
Introduzione al Visual-SLAM: come una telecamera impara "Dove mi trovo?"
Senza GPS e senza mappa, un robot può comunque trovare la propria posizione e costruire una mappa dell'ambiente circostante basandosi esclusivamente sulle immagini della telecamera. Dal tracciamento delle caratteristiche attraverso la geometria epipolare, la differenza tra odometria visiva e SLAM, la genealogia degli algoritmi di punti di riferimento da ORB-SLAM a LSD-SLAM e DSO, e Bundle Adjustment: un'analisi sistematica e approfondita del funzionamento effettivo di Visual-SLAM.
Fundamentals · 21 min di letturaIntroduzione al Bundle Adjustment: il metodo dei minimi quadrati non lineari che perfeziona le pose della fotocamera e i punti 3D.
Il Bundle Adjustment è un problema non lineare dei minimi quadrati che sposta simultaneamente molte pose della telecamera e punti 3D per minimizzare l'errore di riproiezione su tutte le osservazioni. Questo articolo illustra in modo sistematico perché la matrice jacobiana è sparsa, perché il complemento di Schur rende risolvibili problemi su larga scala, il ruolo del metodo di Levenberg-Marquardt, la libertà di gauge e la relazione con l'ottimizzazione del Pose Graph e la SfM, con equazioni e diagrammi.
Fundamentals · 11 min di lettura Visione artificiale September 4, 2026Guida introduttiva alla calibrazione della fotocamera: recupero della distorsione dell'obiettivo e dei parametri intrinseci.
La calibrazione della telecamera è il processo di recupero dei parametri intrinseci e della distorsione dell'obiettivo necessari per mappare le coordinate dei pixel nello spazio 3D. Partendo dal modello a foro stenopeico, passando per i modelli di distorsione radiale e tangenziale, il metodo del pattern planare di Zhang, l'ottimizzazione dell'errore di riproiezione, fino ad arrivare a ciò che non funziona a valle in Visual SLAM e VO quando la calibrazione si discosta: una panoramica sistematica con equazioni e diagrammi.
Fundamentals · 9 min di letturaIntroduzione all'omografia: descrizione della corrispondenza planare con una singola matrice 3x3.
L'omografia è la relazione che lega tra loro punti sullo stesso piano, o la vista di una telecamera puramente rotante, utilizzando una singola trasformazione proiettiva 3x3. Questo articolo tratta la stima basata sulla DLT, la robustezza con RANSAC, la decomposizione in rotazione, traslazione e normale al piano, e quando utilizzarla rispetto alla geometria epipolare, insieme ad applicazioni come l'unione di immagini e il tracciamento del piano AR, con equazioni e diagrammi.
Fundamentals · 9 min di lettura Visione artificiale September 4, 2026Introduzione alla stereoscopia multivista: come trasformare una nuvola di punti sparsa in una forma 3D densa.
La stereoscopia multivista (MVS) ricostruisce forme 3D dense a partire da numerose immagini, utilizzando pose di ripresa note. Questo articolo illustra in modo sistematico il principio fondamentale della coerenza fotografica, i due approcci classici basati su scansione planare e patch (PMVS), i metodi basati sul deep learning, esemplificati da MVSNet, e la creazione di mesh tramite fusione di mappe di profondità, insieme alla relazione con le telecamere stereo e di profondità, corredata da equazioni e diagrammi.
Fundamentals · 13 min di letturaIntroduzione alla ricostruzione 3D da immagini (Structure from Motion): recupero simultaneo di posizione 3D e posizione della telecamera da una serie di foto non ordinate.
La ricostruzione 3D da immagini (Structure from Motion, SfM) ricostruisce simultaneamente la struttura 3D di una scena e la posizione di ogni ripresa a partire da una serie di foto di cui non si conoscono l'ordine e le posizioni di scatto. Questo articolo analizza in modo sistematico la corrispondenza delle caratteristiche, la verifica geometrica, le due strategie di ricostruzione SfM incrementale e globale, la triangolazione, la relazione con il Bundle Adjustment e la differenza rispetto al Visual-SLAM, insieme ad implementazioni attuali come COLMAP.
Fundamentals · 12 min di lettura
Visione artificiale
September 3, 2026
Geometria epipolare: lettura della profondità e del movimento della telecamera da due immagini
La geometria epipolare è la teoria che definisce i vincoli relativi alla proiezione di uno stesso punto 3D in due immagini diverse. Questo articolo illustra in modo sistematico la Matrice Fondamentale e la Matrice Essenziale, gli algoritmi a 8 e 5 punti, RANSAC, la triangolazione, la scelta tra geometria epipolare e omografia, la calibrazione, l'implementazione in OpenCV/COLMAP, le condizioni di errore e le recenti tecniche di stima basate sull'apprendimento automatico, con equazioni e diagrammi.
Fundamentals · 19 min di lettura
Visione artificiale
September 3, 2026
Introduzione al rilevamento delle caratteristiche
Il rilevamento delle caratteristiche seleziona "punti che è possibile ritrovare" in un'immagine e li utilizza per il confronto. Questo articolo collega i principi di angoli, blob, DoG, FAST, ORB e SIFT con robustezza, valutazione, strumenti attuali e metodi basati sull'apprendimento in un unico quadro coerente.
Fundamentals · 15 min di lettura
Visione artificiale
September 3, 2026
Introduzione a VO/VIO: nozioni pratiche per la stima del movimento da una telecamera e da un'unità di misura inerziale (IMU)
L'odometria visiva (VO) e l'odometria visivo-inerziale (VIO) stimano il movimento relativo di un robot o di una telecamera a partire da una sequenza di immagini e misurazioni inerziali. Questo articolo affronta, con l'ausilio di formule matematiche e diagrammi, l'ambiguità di scala monoculare, la preintegrazione dell'IMU, l'inizializzazione, il filtraggio rispetto all'ottimizzazione, implementazioni come VINS-Mono e OpenVINS, metriche di valutazione e condizioni di errore.
Fundamentals · 19 min di lettura