Contents — find the section you need

Pembelajaran penguatan (Reinforcement Learning/RL) adalah cara bagi robot untuk mempelajari tindakan mana yang menguntungkan dalam jangka panjang dengan berinteraksi dengan lingkungannya. Tidak seperti klasifikasi gambar, di mana input dan label datang bersamaan, robot mengamati dunia, menggerakkan motor, dan menerima imbalan—seringkali beberapa detik kemudian. Siklus esensialnya adalah mencoba, mengamati hasilnya, dan memperbarui kebijakan.

Ringkasan 30 detik

  • Transisi RL terkecil adalah, pada waktu t, keadaan (atau pengamatan) s_t, tindakan a_t, imbalan r_{t+1}, dan keadaan berikutnya s_{t+1}.
  • Proses keputusan Markov (Markov Decision Process/MDP) memodelkan bagaimana keadaan dan tindakan saat ini menghasilkan keadaan dan imbalan berikutnya. Keadaan tersebut harus merangkum riwayat dengan cukup baik untuk prediksi.

  • Kebijakan \pi(a\mid s) memilih tindakan; Fungsi nilai V^\pi(s) adalah pengembalian masa depan yang diharapkan ketika kebijakan tersebut diikuti.

  • Pengembalian tersebut mendiskon imbalan masa depan dengan \gamma. Jangka waktu yang terlalu panjang dapat mengganggu pembelajaran, sementara jangka waktu yang terlalu pendek menghasilkan robot yang berpandangan sempit dan tidak aman.

  • Eksplorasi mencoba tindakan yang tidak pasti; eksploitasi memilih tindakan yang saat ini diyakini terbaik. Pada perangkat keras, batasan keamanan berada di atas keduanya.

1. Melihat robot sebagai agen

Diagram 1 · Use the button to switch views
Observation, action, and reward loop in reinforcement learning An agent selects an action from an observation and the environment returns the next observation and a reward Agentcomputes π(a|s) Environmentphysics, simulator, or people action aₜ observation oₜ₊₁ and reward rₜ₊₁ state sₜ is an internal summary of the observation history

Gambar 1 — Setelah agen bertindak, lingkungan berubah dan mengembalikan pengamatan dan hadiah berikutnya. Robot nyata menambahkan penundaan komunikasi, kebisingan sensor, dan saturasi aktuator ke dalam loop ini.

Untuk robot penggerak diferensial, agen dapat menggunakan data kamera, LiDAR, dan encoder sebagai statusnya dan mengeluarkan kecepatan roda kiri dan kanan sebagai tindakan. Lingkungan mencakup dinamika kendaraan, gesekan lantai, rintangan, dan status baterai. Bergerak menuju tujuan dapat menghasilkan hadiah positif, sementara tabrakan atau perubahan kemudi yang tiba-tiba dapat dikenakan penalti. Sinyal "+1 di tujuan" tunggal biasanya terlalu jarang; jarak, kecepatan, margin berhenti, dan energi harus dipertimbangkan bersama.

2. MDP: Membagi Masalah Menjadi Komponen

Sebuah MDP didefinisikan oleh ruang keadaan \mathcal{S} , ruang aksi \mathcal{A} , probabilitas transisi P(s'\mid s,a) , fungsi hadiah R(s,a,s') , dan faktor diskon \gamma :

\mathcal{M}=(\mathcal{S},\mathcal{A},P,R,\gamma),\qquad 0\le\gamma<1

Ketika agen memilih aksi a_t dalam keadaan s_t , lingkungan bertransisi ke keadaan berikutnya s_{t+1} sesuai dengan P dan mengembalikan hadiah r_{t+1}=R(s_t,a_t,s_{t+1}) .

“Markov” berarti bahwa, setelah keadaan saat ini diketahui, masa lalu tidak lagi menambahkan informasi yang dibutuhkan untuk memprediksi masa depan. Robot bergerak yang keadaannya hanya berisi posisi tidak dapat membedakan robot yang berhenti dari robot yang meluncur melalui posisi yang sama. Sertakan kecepatan, laju sudut, dan kepercayaan sensor, atau gunakan model rekuren yang mempertahankan riwayat.

Ketika keadaan lengkap s_t tidak dapat diamati secara langsung, masalahnya adalah MDP yang dapat diamati sebagian (POMDP). Hampir setiap robot nyata adalah POMDP karena oklusi dan hilangnya data LiDAR. Estimator keadaan—EKF, grafik faktor, atau model yang dipelajari—mengubah pengamatan o_t menjadi keadaan internal yang berguna. Artikel sensor-fusion menjelaskan batasan ini, dan ROS 2 Primer menunjukkan cara menjadikannya komponen perangkat lunak yang dapat direproduksi.

3. Fungsi nilai dan pengembalian

Jumlah imbalan yang didiskon dari waktu t adalah pengembalian G_t :

G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots

Nilai keadaan s di bawah kebijakan \pi adalah

V^\pi(s)=\mathbb{E}_\pi[G_t\mid s_t=s]

dan nilai keadaan-aksi juga menentukan aksi pertama:

Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid s_t=s,a_t=a]

Memilih nilai Q terbesar adalah desain berbasis nilai. Memperbarui parameter \theta dari kebijakan neural \pi_\theta(a\mid s) secara langsung adalah berbasis kebijakan. Sudut kemudi kontinu dan torsi sendi sering kali lebih menyukai metode gradien kebijakan atau Actor-Critic, karena menghitung setiap kemungkinan aksi adalah hal yang mustahil.

4. Persamaan Bellman memecah horizon panjang menjadi satu langkah

Alih-alih mengevaluasi seluruh masa depan sekaligus, bagilah menjadi imbalan langsung ditambah nilai satu langkah kemudian. Persamaan ekspektasi Bellman adalah:

V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^\pi(s')\right]

Nilai optimal V^*(s) mematuhi persamaan optimalitas Bellman:

V^*(s)=\max_a\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^*(s')\right]

Inilah mengapa target nilai dapat dihasilkan dari perkiraan lain daripada label yang diberikan manusia. Referensi diri juga merupakan sumber ketidakstabilan. Jaringan target, pemutaran ulang pengalaman, dan normalisasi imbalan memisahkan perkiraan lama dari pembaruan saat ini dan mengurangi korelasi yang merugikan.

5. Menyeimbangkan eksplorasi dan eksploitasi

Selalu memilih tindakan dengan perkiraan tertinggi saat ini dapat menjebak agen dalam solusi lokal yang beruntung. Eksplorasi mencoba tindakan yang tidak diketahui, tetapi gerakan acak pada mesin nyata dapat menyebabkan tabrakan. Pilihan umum adalah:

Metode Intuisi Kekuatan Kekhawatiran perangkat keras
ε-greedy pilih secara acak dengan probabilitas ε sederhana perubahan mendadak tidak aman untuk torsi kontinu
Boltzmann/softmax ambil sampel sesuai proporsi nilai mendukung opsi yang menjanjikan suhu perlu disetel
UCB coba tindakan dengan ketidakpastian tinggi rasional eksplorasi eksplisit membutuhkan estimasi ketidakpastian
Kebijakan bising tambahkan kebisingan kontinu ke tindakan atau bobot eksplorasi lebih halus masih membutuhkan saturasi dan batasan

Pada perangkat keras, batasi eksplorasi pada amplop operasi yang telah divalidasi. Letakkan batas kecepatan, batas lunak sendi, batas gaya/arus, pengawas, dan penghentian darurat di luar pembelajaran sehingga setiap keluaran kebijakan dapat dicegat. Pengacakan dalam simulator berguna; itu bukan izin untuk menerapkan perintah acak ke mesin.

6. Uji ide dalam dunia grid kecil

Grid 5×5 membuat dinamika pembelajaran terlihat. Misalkan sel adalah keadaan, atas/bawah/kiri/kanan adalah tindakan, hadiah tujuan adalah +1, dinding adalah −0,1, dan setiap langkah adalah −0,01. Inisialisasi Q ke nol dan ulangi pembaruan perbedaan temporal:

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

Istilah dalam tanda kurung adalah kesalahan TD: perbedaan antara prediksi dan target satu langkah. Jika \alpha terlalu besar, pengalaman baru mendominasi; jika terlalu kecil, kebijakan tidak dapat mengikuti lingkungan yang berubah. Catat tingkat keberhasilan, langkah rata-rata, tingkat tabrakan, dan fraksi keadaan yang belum dikunjungi—bukan hanya kurva hadiah tunggal.

7. Tulis hadiah seperti spesifikasi

Desain hadiah seringkali lebih penting daripada detail algoritma. Robot pengantar barang mungkin menggunakan

r=w_d\,\Delta d-w_c\,\mathbf{1}_{\mathrm{collision}}-w_u\,|u|^2-w_j\,\|\Delta u\|^2

untuk menggabungkan kemajuan, tabrakan, energi masukan, dan kelancaran. Meningkatkan bobot w tidak selalu meningkatkan perilaku. Jika penalti tabrakan mendominasi, robot mungkin mempelajari kebijakan yang aman tetapi tidak berguna yaitu tidak pernah bergerak. Catat setiap istilah secara terpisah dan audit istilah mana yang sebenarnya dioptimalkan oleh kebijakan tersebut.

Peretasan hadiah adalah mode kegagalan lain: bug pada detektor tujuan, titik buta sensor, atau aturan kontak khusus simulator dapat menghasilkan skor tinggi tanpa mencapai tugas yang dimaksud. Tujuan yang mudah dibaca manusia, batasan berbasis fisika, dan lingkungan evaluasi independen membuat jalan pintas ini lebih mudah dideteksi.

8. Di mana penelitian bertemu dengan produk

Metode nilai efisien data tetapi sering mengasumsikan keadaan dan tindakan diskrit. Gradien kebijakan dan metode Aktor-Kritik menangani kontrol kontinu; SAC menambahkan tujuan entropi, sementara RL berbasis model merencanakan dengan model dinamika yang dipelajari atau analitis sebelum menggerakkan robot. Metode berbasis model dapat mengurangi sampel dunia nyata, tetapi harus mentolerir kesalahan model.

Dalam produksi, RL tidak selalu diterapkan pada setiap lapisan, mulai dari pemantauan keselamatan hingga arus motor. PID atau MPC klasik dapat memberikan batasan keselamatan sementara RL memilih kontak genggaman, preferensi rute, atau jadwal penguatan. Gambaran umum VLA menjelaskan batasan serupa: model bahasa-visi dapat mengusulkan potongan aksi sementara pengontrol tingkat rendah yang terverifikasi membatasi torsi dan kecepatan.

9. Sebelum beralih ke perangkat keras

  • Apakah keadaan mencakup kecepatan, penundaan, dan kepercayaan sensor, atau apakah asumsi Markov telah dilanggar secara diam-diam?

  • Apakah istilah hadiah dicatat secara terpisah, dengan tingkat tabrakan, energi, kelancaran input, dan jarak berhenti selain tingkat keberhasilan?

  • Apakah rentang aksi, batas laju, pengawas, dan pemberhentian darurat independen dari pembelajar?

  • Apakah gesekan, massa, penundaan sensor, pencahayaan, dan kehilangan paket diacak dalam simulasi, dan apakah celah distribusi diukur pada log nyata?

  • Apakah himpunan evaluasi yang tidak terlihat dipisahkan dari data pelatihan? Apakah kegagalan disertakan dan bukan disaring?

  • Apakah proses restart memasuki keadaan aman dan menghindari pemutaran ulang perintah lama?

Ringkasan

Pembelajaran penguatan tidak membuat robot menghafal "gerakan yang benar." Ia mendefinisikan keadaan, tindakan, transisi, dan imbalan sebagai MDP, kemudian memperkirakan nilai jangka panjang selangkah demi selangkah dengan persamaan Bellman. Eksplorasi, peretasan imbalan, dan keamanan perangkat keras harus menjadi bagian dari desain sistem sebelum kebijakan yang dipelajari dapat keluar dari simulasi. Artikel selanjutnya dalam seri ini akan membandingkan Q-learning/DQN, gradien kebijakan, PPO dan SAC, pembelajaran imitasi, dan Sim-to-Real dalam kerangka kerja yang sama.

Periksa pemahaman Anda
Apakah tindakan dengan imbalan langsung tertinggi selalu yang terbaik?

Imbalan dan transisi di masa depan dapat mengubah jawabannya.

Bedakan antara imbalan langsung dan pengembalian yang didiskon.

Referensi

What to read next

Continue the seriesQ-Learning dan DQN — Dari Q-Table ke Deep Reinforcement LearningExplore another aspect of this fieldPengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga BelajarExplore another aspect of this fieldPenjelasan π0 — Bagaimana Pencocokan Aliran Mengubah Generasi Tindakan VLA