Pembelajaran penguatan — Panduan belajar
Pembelajaran penguatan — Alur belajar terstruktur tentang robotika, kendali, pertanian lingkungan terkendali, energi, dan elektronika daya.
Alur belajar terstruktur tentang robotika, kendali, pertanian lingkungan terkendali, energi, dan elektronika daya.
- Fundamentals · 6 menit baca
Dasar-Dasar Pembelajaran Penguatan — MDP, Persamaan Bellman, dan Eksplorasi untuk Robot
Pembelajaran penguatan (reinforcement learning) adalah sebuah siklus tertutup di mana agen memilih tindakan dari pengamatan dan memaksimalkan imbalan yang tertunda. Pengantar ini menjelaskan MDP (Multi-Dependency Process), fungsi nilai, kebijakan, persamaan Bellman, eksplorasi versus eksploitasi, desain imbalan, dan jalur dari simulasi ke robot nyata.
- Fundamentals · 5 menit baca
Q-Learning dan DQN — Dari Q-Table ke Deep Reinforcement Learning
Q-learning memperbarui nilai aksi dengan target optimalitas Bellman. Panduan ini mengikuti jalur dari tabel Q-table ke Deep Q-Network, menjelaskan pengalaman replay, jaringan target, estimasi berlebih, dan penempatan yang aman dalam tumpukan robot.
- Fundamentals · 5 menit baca
Gradien Kebijakan, PPO, dan SAC — Kontrol Kontinu Stabil untuk Robot
Gradien kebijakan memperbarui kebijakan secara langsung sehingga kemudi, daya dorong, dan torsi sendi dapat tetap kontinu. Artikel ini menghubungkan Actor-Critic, PPO, dan SAC, kemudian membahas pemotongan (clipping), regularisasi entropi, evaluasi, dan batas keamanan untuk transfer Sim-to-Real.
- Fundamentals · 8 menit baca
Pengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RL
Dalam implementasi pembelajaran penguatan (reinforcement learning), desain fungsi imbalan lebih sering menentukan hasil daripada algoritma itu sendiri. Artikel ini membahas imbalan jarang (sparse) vs. imbalan padat (dense), invariansi kebijakan dari pembentukan imbalan berbasis potensial, kasus nyata peretasan imbalan (reward hacking), pembelajaran penguatan invers (inverse reinforcement learning), dan RL terbatas (constrained RL).
- Fundamentals · 4 menit baca
Pembelajaran Penguatan Berbasis Model dan Simulasi ke Nyata
Model dunia, kesalahan prediksi, MPC, pengacakan domain, identifikasi sistem, dan pemantauan keselamatan untuk mesin nyata.
- Fundamentals · 5 menit baca
Pengantar Pembelajaran Penguatan: Pembelajaran Imitasi dan Pembelajaran Penguatan Terbalik
Kloning Perilaku, DAgger, dan pembelajaran penguatan terbalik menggunakan demonstrasi ketika imbalan sulit untuk ditulis. Panduan singkat ini mencakup pergeseran kovariat, inferensi imbalan, koneksi VLA, evaluasi, keamanan, dan asal usul data.
- Fundamentals · 10 menit baca
Penjelasan π0 — Bagaimana Pencocokan Aliran Mengubah Generasi Tindakan VLA
Panduan teknis berbasis sumber untuk π0 Kecerdasan Fisik: PaliGemma VLM dan Pakar Aksi khusus, pembangkitan aksi berkelanjutan dengan pencocokan aliran bersyarat, pelatihan lintas perwujudan di tujuh jenis robot, dan perbedaannya dari model VLA autoregresif seperti RT-2 dan OpenVLA.
- Fundamentals · 8 menit baca
Pengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga Belajar
Ketika beberapa agen belajar secara bersamaan, MDP agen tunggal tidak lagi berlaku. Artikel ini membahas tentang non-stasioneritas, pengaturan kooperatif/kompetitif/campuran, CTDE, masalah penugasan kredit, serta MADDPG dan QMIX, dengan persamaan dan diagram.