Contents — find the section you need

Navigasi robot adalah teknologi perencanaan jalur dari posisi saat ini ke tujuan pada peta, kemudian mengikuti jalur tersebut sambil menghindari rintangan. Pipeline klasik seperti Nav2 — yang digunakan oleh newbot — tetap menjadi pilihan utama dalam praktiknya, sementara penelitian tentang pendekatan ujung-ke-ujung yang dibangun berdasarkan pembelajaran penguatan (reinforcement learning) dan model Visi-Bahasa (Vision-Language) berkembang pesat.

ROS 2ROS 2 / Nav2

Gambar: Logo Robot Sistem Operasi, Wikimedia Commons (CC BY-SA 4.0)

Navigasi Otonom Sekilas

Diagram 1 · Use the button to switch views
Navigasi otonom loop tertutup di mana peta, posisi saat ini, dan tujuan menghasilkan jalur global, kontrol lokal menghasilkan perintah kecepatan, dan pengamatan baru memberikan umpan balik ke keputusan berikutnya

Diagram: Duskcoil. Pembagian tanggung jawab dalam tumpukan navigasi hierarkis seperti Nav2 disederhanakan.

Navigasi lebih dari sekadar menghitung jalur terpendek sekali. Perencana global melihat peta, pengontrol lokal mengubah jalur menjadi perintah kecepatan sambil memperhitungkan rintangan di dekatnya dan batasan kendaraan, dan pengamatan setelah pergerakan memperbarui keputusan selanjutnya. Berhenti, perencanaan ulang, dan pemulihan juga merupakan bagian dari sistem. Oleh karena itu, bagian-bagian di bawah ini dapat dibaca dengan menanyakan di mana perencanaan, kontrol, pembelajaran, dan instruksi bahasa masuk ke dalam lingkaran tertutup umum ini.

Alur Kerja Klasik: Memisahkan Peta Biaya dari Perencanaan Jalur

Tumpukan navigasi klasik, yang dicontohkan oleh Nav2, membangun peta biaya (peta 2D yang mewakili risiko rintangan) dari data sensor, kemudian menjalankan perencanaan jalur global dan pelacakan lintasan lokal sebagai modul terpisah di atasnya. Peran setiap modul jelas, dan perilaku yang dihasilkan mudah dipahami dan disesuaikan oleh manusia, tetapi kemampuannya untuk beradaptasi dengan lingkungan yang tidak terduga (bentuk rintangan yang tidak dikenal, kerumunan padat) memiliki batasan nyata. newbot juga menggunakan alur kerja klasik ini — lihat "Cara Kerja Pemetaan dan Navigasi Otonom" untuk detail implementasi.

Kinematika yang Mendasari: Konversi Kecepatan Penggerak Diferensial

Metode navigasi apa pun yang digunakan, apa yang pada akhirnya dikeluarkan oleh pengontrol adalah sepasang nilai: kecepatan translasi v dan kecepatan sudut \omega. Untuk robot penggerak diferensial seperti newbot (dua roda, kiri dan kanan), fondasi di bawahnya adalah model kinematik yang mengubah pasangan ini menjadi kecepatan roda kiri/kanan v_l, v_r.

v = \frac{v_r + v_l}{2}, \qquad \omega = \frac{v_r - v_l}{L}

L adalah jarak antara roda kiri dan kanan (lebar tapak). Transformasi invers digunakan untuk melakukan hal sebaliknya — dari (v, \omega) yang direncanakan ke kecepatan target untuk setiap roda. Sepasang persamaan sederhana ini menangkap batasan mendasar dari penggerak diferensial itu sendiri (tidak ada gerakan menyamping; berbelok selalu membutuhkan perbedaan kecepatan antara roda) — tidak peduli seberapa canggih peta biaya atau perencanaan jalur, motor pada akhirnya digerakkan melalui model kinematik ini. Implementasi newbot juga dibahas dalam "Cara Kerja Kontrol Kecepatan Aman."

Di Dalam Nav2: Peta Biaya, Pengontrol, Pohon Perilaku

Melihat lebih konkret bagaimana modul di dalam alur kerja klasik bekerja sama: Nav2 membangun peta biayanya (peta 2D yang mewakili risiko rintangan) dengan menumpuk beberapa "lapisan." Lapisan yang mencerminkan data peta statis, lapisan yang mendeteksi dan melacak rintangan dinamis dari data kamera atau sensor kedalaman, lapisan yang menulis ulang peta biaya berdasarkan aturan — menumpuk lapisan dengan peran yang berbeda seperti ini memungkinkan berbagai sumber informasi, lebih banyak daripada yang dapat diwakili oleh satu algoritma saja, untuk diintegrasikan ke dalam satu representasi peta.

Controller_server, yang bertanggung jawab untuk mengikuti jalur, menggerakkan robot di sepanjang jalur global yang paling baru direncanakan, merujuk pada costmap lokal sambil juga bekerja dengan plugin pendukung — pemeriksa kemajuan dan pemeriksa tujuan. Behavior_server, yang menangani perilaku pemulihan (berputar di tempat, mundur), dirancang untuk merujuk pada costmap lokal yang sama dengan controller_server secara real-time, pengaturan efisien yang menghindari penyimpanan objek representasi lingkungan duplikat di lebih dari satu tempat.

Yang mengontrol urutan dan kondisi pemanggilan masing-masing server ini adalah Behavior Tree. Nav2 menggunakan pustaka bernama BehaviorTree.CPP, di mana sebuah node berstruktur pohon, setiap kali "diaktifkan" (dipicu untuk dieksekusi), memanggil server aksi — perencana, pengontrol, server perilaku. Desain ini memungkinkan logika percabangan yang kompleks — "jika perencanaan jalur gagal, coba lagi hingga N kali sebelum beralih ke perilaku pemulihan yang berbeda" — diatur ulang murni melalui konfigurasi Behavior Tree, tanpa menyentuh kode server individual mana pun.

Penyebaran Navigasi Berbasis Pembelajaran Ujung-ke-Ujung

Tren terkini yang menjadi penentang pipeline klasik adalah navigasi berbasis pembelajaran ujung-ke-ujung yang menghasilkan aksi langsung dari input sensor mentah. Dalam adegan kooperatif realistis seperti melewati pintu, beberapa laporan menunjukkan metode berbasis pembelajaran mengungguli metode berbasis model, dan pembelajaran penguatan mendalam (DRL) telah menjadi salah satu tren utama dalam penelitian navigasi berbasis ROS. Algoritma seperti TD3 (Twin-Delayed DDPG), DDPG, dan DQN telah diterapkan pada deteksi, pelacakan, dan navigasi objek secara real-time, dan metode hibrida yang menggabungkan pembelajaran imitasi (mempelajari kebijakan awal dari demonstrasi ahli) dengan pembelajaran penguatan (terus meningkatkan kebijakan tersebut) juga telah muncul.

Arah Model Dasar Navigasi

Tren yang lebih baru adalah upaya untuk melatih navigasi itu sendiri sebagai "model dasar." Kerangka kerja yang menggabungkan pra-pelatihan video offline dengan pasca-pelatihan melalui pembelajaran penguatan dalam simulasi (S2E: Seeing-to-Experiencing) dirancang untuk memperkuat interaktivitas sambil mempertahankan kinerja generalisasi. Penelitian yang menggabungkan model Visi-Bahasa ke dalam navigasi (Navi2Gaze, misalnya) juga berkembang, mengeksplorasi arah di mana target navigasi ditentukan bukan oleh koordinat pada peta tetapi oleh bahasa alami atau gambar tujuan (ini juga tumpang tindih dengan bidang VLA — lihat "Tren Teknologi dalam VLA" untuk detailnya).

Navigasi Sosial

Untuk robot dalam ruangan yang beroperasi di lingkungan di mana orang-orang bergerak, mengambil jalur "seperti manusia" — bukan hanya menghindari rintangan — telah menjadi tema penelitian penting tersendiri. Di bidang navigasi sosial, tiga tantangan biasanya diidentifikasi sebagai masalah penelitian utama: model yang dapat secara akurat memprediksi pergerakan manusia, lingkungan pembelajaran yang secara realistis mensimulasikan lingkungan yang ramai, dan metrik evaluasi yang dapat menangkap kompleksitas dunia nyata. Penelitian aktif menggabungkan berbagai keluarga algoritma pembelajaran penguatan — berbasis nilai, berbasis kebijakan, aktor-kritik — dengan berbagai arsitektur jaringan saraf — feedforward, rekuren, konvolusional, grafik, transformer.

Hasil Konkret dari Navigasi Berbasis Pembelajaran: 2026 dalam Angka

Penelitian hingga tahun 2026 semakin mendukung klaim dengan angka konkret daripada "peningkatan kinerja" yang samar. CORE Planner (Juni 2026), yang menjelajahi lingkungan yang tidak dikenal tanpa peta sebelumnya, menggabungkan representasi grafik visibilitas yang jarang dengan transformer dan melaporkan pengurangan jarak tempuh sebesar 13% dibandingkan FAR Planner tradisional dan hingga 48% dibandingkan baseline berbasis pembelajaran lainnya, sekaligus mencapai transfer simulasi ke nyata tanpa pelatihan tambahan. FlashNav (Juni 2026), yang secara dramatis memangkas waktu pelatihan, menghilangkan rendering yang tidak perlu dan fisika fidelitas tinggi dari simulasi dan menjalankan pipeline pelatihan berbasis GPU, mencapai tingkat keberhasilan 100% dengan pelatihan kebijakan yang selesai dalam waktu kurang dari 20 detik pada RTX 5090 — dan berhasil mentransfer kebijakan yang telah dilatih ke robot fisik.

Kemajuan kuantitatif juga terlihat dalam navigasi sosial. HUMA (Juli 2026), pendekatan hibrida yang secara selektif mengaktifkan penalaran VLM (Vision-Language Model) hanya ketika orang berada di dekatnya sementara sebaliknya mengandalkan efisiensi komputasi dari kebijakan pembelajaran penguatan, melaporkan peningkatan keberhasilan tugas sebesar 20% dan 3% pada benchmark Social-MP3D dan Social-HM3D, masing-masing. Keputusan desain kuncinya bukanlah "selalu jalankan penalaran yang mahal" tetapi "jalankan hanya ketika benar-benar dibutuhkan" — pilihan yang mendamaikan pertukaran antara akurasi dan biaya komputasi.

Model Dasar Navigasi yang Semakin Konkret: Contoh Implementasi VLN

Arah "model dasar navigasi" (S2E dan sejenisnya) telah mengkristal menjadi implementasi yang lebih konkret hingga tahun 2026. SuperMap (Agustus 2026, diterima di RSS 2026) mengintegrasikan SLAM geometris frekuensi tinggi dengan persepsi kosakata terbuka asinkron untuk membangun grafik adegan 4D (ruang plus waktu) yang mendukung kueri komposisional atas semantik dan hubungan objek. Ia dirancang untuk mempertahankan identitas objek yang stabil — mencocokkan dan mengenali ulang objek dalam ruang 3D — bahkan di lingkungan dinamis, dan berfungsi sebagai dasar untuk navigasi robot yang didorong oleh instruksi bahasa alami.

Contoh yang lebih ringan adalah GemNav (Juli 2026), yang mengadaptasi LLM multimodal yang telah dilatih sebelumnya untuk menangani navigasi titik arah melalui token diskrit. Tidak memerlukan encoder visual khusus, dan diposisikan sebagai "alternatif yang efisien data" — mencapai transfer tanpa pelatihan (zero-shot transfer) ke lingkungan dalam dan luar ruangan yang belum pernah dilihat sebelumnya dari sejumlah kecil data pelatihan, tanpa perlu melakukan fine-tuning penuh pada model dasar yang besar. Ada juga pendekatan Navigasi Bahasa-Visual offline (Juli 2026) yang berjalan sepenuhnya di perangkat tanpa ketergantungan cloud, menggabungkan deteksi objek kosakata terbuka, segmentasi berbasis perintah, dan geometri LiDAR untuk memperkirakan lokasi tujuan di luar ruangan hanya dengan menggunakan model bahasa kecil. Secara keseluruhan, ini menunjukkan bahwa "navigasi yang Anda instruksikan dalam bahasa alami" bergerak dari topik penelitian menuju sesuatu yang benar-benar diimplementasikan.

Kondisi Praktis Saat Ini

Saat ini, belum ada yang sampai pada titik menggantikan pipeline klasik seperti Nav2. Metode berbasis pembelajaran menunjukkan hasil yang kuat dalam pengaturan penelitian, tetapi biaya untuk memverifikasi reproduksibilitas dan keamanan pada perangkat keras nyata sangat tinggi, dan penerapannya ke produksi dan penggunaan massal masih terbatas. Desain newbot sendiri — perencana jalur klasik yang dipasangkan dengan lapisan pengawasan keselamatan independen, termasuk sakelar pemutus fisik (lihat "Cara Kerja Kontrol Kecepatan Aman" untuk detailnya) — dapat dibaca sebagai cerminan dari keadaan praktis terkini di bidang ini. Bahkan ketika metode berbasis pembelajaran bergerak menuju penggunaan praktis, pilihan yang realistis, setidaknya untuk masa mendatang, tampaknya adalah hibrida yang dibangun di sekitar mekanisme keselamatan klasik.

Periksa pemahaman Anda
Apakah lokalisasi yang akurat menjamin tercapainya tujuan?

Pemetaan, penanganan rintangan, perencanaan, dan kontrol juga harus berhasil.

Akurasi lokalisasi hanyalah satu bagian dari kinerja navigasi.

Referensi

What to read next

Review the backgroundTren Teknologi dalam Visual-SLAMContinue the seriesTren Teknologi dalam Deteksi ObjekExplore another aspect of this fieldTren Teknologi dalam Robot Humanoid