Contents — find the section you need
SLAM (Simultaneous Localization and Mapping) adalah teknologi yang memungkinkan estimasi "di mana saya berada" dan "seperti apa lingkungan sekitar saya" secara bersamaan, hanya dengan menggunakan sensor. Artikel ini mengulas perkembangan teknis yang lebih luas di bidang SLAM secara keseluruhan; detail spesifik dari masing-masing bidang (Visual-SLAM, LiDAR-SLAM) dibahas dalam artikel tersendiri.
Ide utama: SLAM bukanlah saluran satu arah yang pertama-tama menemukan lokasi robot dan kemudian memetakannya. Ini adalah masalah estimasi yang saling terkait: peta yang tidak pasti membantu memperkirakan posisi, dan posisi tersebut kemudian digunakan untuk memperbarui peta.
Gambar: Robot Operating System logo, Wikimedia Commons (CC BY-SA 4.0)
Sekilas tentang Sistem SLAM
Diagram: Duskcoil. Sistem SLAM berbasis grafik representatif disederhanakan. Penutupan loop mendeteksi kunjungan ulang dan menambahkan batasan; back end berbasis grafik mengoreksi lintasan dan peta. Batasan komponen bervariasi tergantung implementasi.
Meskipun metode SLAM berubah, sumbu perbandingannya tetap mudah dibaca. Front end membentuk korespondensi dan batasan gerak relatif; back end menyelaraskan batasan sepanjang waktu; dan penutupan loop menambahkan batasan jarak jauh ketika suatu tempat dikunjungi ulang. Metode berbasis pembelajaran menggantikan sebagian atau seluruh komponen ini, sementara 3DGS dan NeRF terutama memperluas representasi peta. Sejarah di bawah ini paling mudah diikuti sebagai kisah tentang bagaimana masing-masing bagian ini telah berubah.
Arus Pertama: Dimulai dari Metode Berbasis Filter
Diagram: Duskcoil. Perubahan dalam estimasi dan perluasan ortogonal melalui pembelajaran, representasi peta, dan semantik dipisahkan. Metode lama dan baru masih hidup berdampingan dan digabungkan berdasarkan aplikasi.
SLAM awal didominasi oleh estimasi sekuensial melalui Extended Kalman Filter (EKF) atau filter partikel — memperbarui status setiap kali pengamatan sensor baru tiba. Secara komputasi murah, tetapi memiliki kelemahan: kesalahan mudah terakumulasi, dan pendekatan ini cenderung gagal pada peta skala besar.
Arus Kedua: Pergeseran ke Optimasi Grafik
Yang menjadi dominan setelah itu adalah optimasi grafik pose (graph SLAM). Ini membangun grafik di mana setiap node adalah Posisi robot pada suatu titik di sepanjang lintasannya, dan setiap sisi merupakan hubungan relatif yang diperoleh dari pengamatan sensor, kemudian mengoptimalkan keseluruhan hal tersebut sekaligus sebagai masalah kuadrat terkecil nonlinier. Dikombinasikan dengan penutupan loop (mengenali tempat yang sebelumnya dikunjungi dan secara retroaktif mengoreksi kesalahan yang terakumulasi), hal ini memungkinkan untuk membangun peta yang tetap valid bahkan di lingkungan skala besar. slam_toolbox, yang digunakan dalam newbot, termasuk dalam garis keturunan ini. FAST-LIO, sebaliknya, melakukan odometri LiDAR–IMU yang terhubung erat dengan filter Kalman berulang, bukan grafik posisi.
Apa yang Ada di Dalam Optimasi Grafik: Dirumuskan sebagai Kuadrat Terkecil Nonlinier
Melihat lebih konkret pada grafik masalah yang sebenarnya dipecahkan SLAM secara internal: ia membangun grafik di mana setiap simpul adalah posisi robot pada suatu titik waktu di sepanjang lintasannya, dan setiap sisi adalah hubungan posisi relatif yang diperoleh dari pengamatan sensor, dan dirumuskan sebagai masalah kuadrat terkecil nonlinier yang menyesuaikan penempatan setiap simpul agar menjadi Sangat konsisten dengan batasan setiap sisi. Karena pengamatan sensor membawa noise, batasan antar sisi pasti akan saling bertentangan sampai batas tertentu, dan peran optimasi ini adalah untuk mendistribusikan konflik tersebut dengan cara yang "paling tidak masuk akal".
Secara formal, untuk seluruh himpunan pose yang akan dipecahkan, \mathbf{x} = (\mathbf{x}_1, \dots, \mathbf{x}_n), masalahnya adalah meminimalkan tujuan berikut.
Di sini \mathcal{C} adalah himpunan pasangan node (sisi) yang dibatasi oleh pengamatan sensor, \mathbf{e}_{ij} adalah fungsi kesalahan yang menyatakan ketidaksesuaian antara pose yang diperkirakan dari node i dan j dengan pengamatan sensor, dan \Sigma_{ij}^{-1} adalah pembobotan dari kepercayaan pengamatan tersebut (kovarians invers).
Metode iteratif seperti Gauss-Newton atau Levenberg-Marquardt digunakan untuk menyelesaikannya. Fungsi kesalahannya adalah Dilinearisasi di sekitar estimasi saat ini (\mathbf{e}_{ij}(\mathbf{x} + \Delta\mathbf{x}) \approx \mathbf{e}_{ij}(\mathbf{x}) + \mathbf{J}_{ij}\Delta\mathbf{x}), dan persamaan normal \mathbf{J}^\top \mathbf{J} \, \Delta\mathbf{x} = -\mathbf{J}^\top \mathbf{e} diselesaikan untuk pembaruan \Delta\mathbf{x}, diulang hingga konvergensi. Ketika posisi 3D dari titik fitur yang diamati (landmark) disertakan sebagai target optimasi bersama dengan pose kamera, proses ini secara khusus disebut Penyesuaian Bundel (Bundle Adjustment). Masalah SLAM memiliki sejumlah besar variabel (pose, landmark), tetapi setiap pengamatan individu hanya menyentuh sebagian kecil dari variabel tersebut, sehingga matriks yang dihasilkan (Jacobian, Hessian) menjadi jarang (sparse). Menyelesaikan secara efisien dengan memanfaatkan kelangkaan tersebut adalah kunci praktis di sini, dan kerangka kerja optimasi tujuan umum seperti Ceres Solver, g2o, dan GTSAM banyak digunakan sebagai pustaka untuk masalah kuadrat terkecil nonlinier jarang (sparse) seperti ini.
Arus Ketiga: SLAM Berbasis Pembelajaran, AI-Native
Arus yang sedang berlangsung saat ini adalah menggabungkan pembelajaran mendalam ke dalam pipeline SLAM. Mengganti ekstraksi dan pencocokan fitur eksplisit dengan... Deep learning adalah bidang penelitian aktif yang bertujuan untuk meningkatkan ketahanan terhadap perubahan pencahayaan dan lingkungan dengan tekstur yang kurang baik. Baru-baru ini, arah yang disebut "AI-native" atau "semantic SLAM" juga muncul — mengintegrasikan jaringan saraf graf, atau bahkan model bahasa besar (LLM) dan model Vision-Language-Action (VLA), ke dalam pipeline SLAM. Tujuannya bukan lagi hanya "di mana saya berada", tetapi membangun peta semantik yang secara bersamaan memahami "apa yang ada di sana."
Pergeseran dalam Representasi Peta Itu Sendiri
Perubahan terbaru yang paling mencolok adalah penemuan kembali "format representasi" peta itu sendiri. Di luar point cloud dan occupancy grid tradisional, representasi peta yang dibangun di atas Neural Radiance Fields (NeRF) dan 3D Gaussian Splatting (3DGS) dengan cepat mendapatkan tempat. Metode-metode ini semakin mengungguli metode tradisional dalam hal akurasi pemetaan, kualitas rendering, dan efisiensi komputasi, dan metode berbasis 3DGS/NeRF baru — MHED-SLAM, GTS-SLAM, MTE-SLAM, HL-SLAM, PMET-SLAM, dan lainnya — terus muncul di konferensi dan jurnal utama hingga tahun 2026. Lihat artikel terpisah "Tren Teknologi dalam Visual-SLAM" untuk detailnya.
Gambaran Akhir 2026: 3DGS-SLAM yang Beragam Berdasarkan Domain
Jika kita melihat secara konkret metode berbasis 3DGS/NeRF yang disebutkan di atas hingga publikasi Agustus 2026, yang menonjol adalah seberapa beragamnya domain target. RoSe-SLAM membangun peta Gaussian 3D yang diberi tag semantik dari video monokular dalam adegan dinamis (diterima di IROS 2026); Stipple, dari lab Daniel Cremers, secara bertahap membangun peta secara real-time sambil menggabungkan data visual dan inersia secara erat; GLAM-SLAM dapat diskalakan ke lingkungan seukuran blok kota melalui densifikasi aliran dan dekomposisi spasial (juga diterima di IROS 2026); dan Real-Time LiDAR Gaussian Splatting SLAM menggabungkan awan titik LiDAR secara langsung dengan Gaussian 3D. Spesialisasi berlangsung di sepanjang sumbu yang berbeda — dalam ruangan vs. luar ruangan, adegan dinamis, lingkungan skala besar. Pendekatan ini juga menyebar di luar robotika ke bidang kedokteran: EndoMD-SLAM menargetkan SLAM endoskopi, dan Track2Map (diterima di MICCAI 2026) menargetkan operasi laparoskopi.
Mengintegrasikan Pemahaman Semantik: SLAM Kosakata Terbuka dan Model Dasar yang Terhubung
Menelusuri lebih jauh ke dalam arus "SLAM berbasis pembelajaran, asli AI": 2026 telah menjadi tahun munculnya beberapa metode yang menghubungkan fitur model dasar visi secara langsung ke dalam pipeline SLAM. RADIO-ViPE (April 2026) secara erat menghubungkan embedding multi-modal dari model dasar visi aglomeratif secara online, mencapai SLAM semantik kosakata terbuka yang dapat melokalisasi kategori yang ditentukan teks secara arbitrer pada peta bahkan di lingkungan dinamis. FeatureSLAM (Januari 2026) merasterisasi fitur yang selaras dengan model dasar visi ke setiap Gaussian dalam peta Gaussian Splatting 3D, membangun peta yang dapat dicari secara semantik sambil mempertahankan kinerja waktu nyata. Arah ini diuraikan secara sistematis dalam survei Oktober 2025 "Semantic Visual SLAM: A Survey on State of the Art, Challenges, and Future Directions," yang memperluas cakupannya hingga integrasi model bahasa besar — menggarisbawahi bagaimana SLAM bergeser dari estimasi geometris murni menuju sistem yang juga membawa pemahaman semantik.
Memperluas Modalitas Sensor: Radar 4D sebagai Pilihan
Bersama dengan LiDAR dan kamera, penelitian yang menggunakan radar 4D (radar gelombang milimeter yang memberikan jangkauan, azimut, elevasi, dan kecepatan Doppler) sebagai modalitas sensor ketiga — yang dihargai karena ketahanannya terhadap cuaca buruk — terus diperbarui secara aktif. Odometri Radar-Inersia 4D, yang menggabungkan pemodelan Gaussian 3D dengan pencocokan pemindaian multi-hipotesis, menargetkan Akurasi odometri yang ditingkatkan dalam kondisi kabut, hujan, dan debu di mana kamera dan LiDAR sama-sama kesulitan; pertama kali diterbitkan pada akhir tahun 2024, versi revisinya baru-baru ini diterbitkan pada Maret 2026. Kumpulan data benchmark juga semakin matang menuju kondisi operasi yang lebih realistis, seperti pada kumpulan data Hilti-Trimble-Oxford (Juli 2026), yang menggunakan kamera 360 derajat plus IMU dan menggabungkan prioritas denah lantai.
Pola Regional dalam Industri dan Penelitian
Analisis paten dan makalah terkait SLAM menunjukkan bahwa Tiongkok memiliki bobot yang tidak proporsional dalam SLAM 2D berbasis LiDAR, implementasi berbasis ROS, optimasi grafik, dan penelitian multi-robot/komputasi tepi. Permintaan dari aplikasi praktis — drone, robot layanan — tampaknya sangat mengarahkan arah penelitian.
Ringkasan: Ketiga Arus Tidak Saling Eksklusif
Penyaringan sekuensial dan optimasi grafik adalah pilihan untuk bagian belakang estimasi. Fitur yang dipelajari Ekstraksi, representasi peta 3DGS/NeRF, dan integrasi semantik membentuk sumbu terpisah yang dapat dikombinasikan dengan salah satunya. FAST-LIO, yang digunakan dalam newbot misalnya, dibangun di atas filter Kalman iteratif; FAST-LIO2 juga mendaftarkan titik mentah langsung ke peta tanpa tahap ekstraksi fitur terpisah. Kombinasi mana yang akan dipilih bergantung pada komputasi yang tersedia, konfigurasi sensor, dan untuk apa peta tersebut sebenarnya dibutuhkan — itulah kesimpulan praktis pada saat ini.
Apakah representasi peta baru menyelesaikan setiap masalah SLAM?
Penampilan, lokalisasi, penutupan loop, dan komputasi adalah dimensi terpisah. Identifikasi komponen spesifik yang ditingkatkan oleh suatu kontribusi.
Referensi
- Bagaimana NeRF dan 3D Gaussian Splatting Membentuk Kembali SLAM: Sebuah Survei )
- Ulasan tentang Visual-SLAM: Kemajuan dari Pemodelan Geometris hingga Pemahaman Adegan Semantik Berbasis Pembelajaran (arXiv)
- Semantic Visual SLAM: Survei tentang Keadaan Seni, Tantangan, dan Arah Masa Depan (arXiv)
- Makalah RADIO-ViPE (arXiv)
- Makalah Dataset Hilti-Trimble-Oxford (arXiv)
- FAST-LIO2: Odometri LiDAR-inersia Langsung Cepat (arXiv)
- Implementasi newbot juga dibahas dalam "Cara Kerja Lokalisasi Mandiri dan Fusi Sensor" dan "[Cara Pekerjaan Pemetaan dan Navigasi Otonom"
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.