Contents — find the section you need

Q-learning dan DQN memilih dari himpunan aksi yang terbatas. Namun, kecepatan roda, daya dorong drone, atau torsi manipulator bersifat kontinu. Metode policy-gradient memperbarui kebijakan \pi_\theta yang menghasilkan distribusi atas aksi kontinu. Actor-Critic menambahkan Critic yang mengevaluasi aksi-aksi tersebut; PPO dan SAC menambahkan stabilisasi praktis yang banyak digunakan dalam penelitian robot.

Ringkasan 30 detik

  • Policy gradient meningkatkan pengembalian yang diharapkan J(\theta) secara langsung. Mereka menangani aksi kontinu secara alami, tetapi estimasi lintasan tunggal memiliki varians yang tinggi.

  • Actor-Critic menggunakan estimasi nilai sebagai dasar. Advantage mengukur apakah suatu aksi lebih baik daripada aksi rata-rata dalam keadaan yang sama.

  • PPO membatasi rasio probabilitas antara kebijakan lama dan baru sehingga satu pembaruan tidak dapat bergerak terlalu jauh. Ini mudah, tetapi data on-policy sulit untuk digunakan kembali.

  • SAC memaksimalkan baik reward maupun entropi kebijakan. Ini adalah metode off-policy, menggunakan replay, dan sangat cocok untuk kontrol kontinu.

  • Kedua metode tersebut tidak menyediakan batasan keselamatan. Jaga agar batasan aksi, batasan laju, PID/MPC tingkat rendah, dan penghentian darurat berada di luar sistem pembelajaran.

1. Mengoptimalkan kebijakan secara langsung

Diagram 1 · Use the button to switch views
Aktor–Kritikus: perbarui kebijakan berdasarkan pengalaman

Gambar 1 — Aktor mengusulkan distribusi kontinu dan Kritikus mengevaluasi pengembaliannya. Pada perangkat keras, tindakan tersebut melalui pengontrol tingkat bawah yang terverifikasi, bukan langsung ke torsi.

Untuk kebijakan stokastik \pi_\theta(a\mid s), gradien pengembalian yang diharapkan J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] dapat ditulis menggunakan gradien log probabilitas:

\nabla_\theta J(\theta)=\mathbb{E}_{\pi_\theta}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,G_t\right]

Tindakan yang menghasilkan pengembalian tinggi menjadi lebih mungkin. Karena G_t bising dan tertunda, mengurangi garis dasar yang bergantung pada keadaan b(s_t) mengurangi varians tanpa mengubah gradien yang diharapkan:

\nabla_\theta J(\theta)=\mathbb{E}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,(G_t-b(s_t))\right]

2. Keunggulan dan Aktor-Kritikus

Kritikus mempelajari V_\phi(s) dan memperkirakan apakah suatu tindakan lebih baik daripada rata-rata keadaan dengan A_t=Q(s_t,a_t)-V(s_t). Aproksimasi TD satu langkah adalah

\hat A_t=r_{t+1}+\gamma V_\phi(s_{t+1})-V_\phi(s_t)

Estimasi Keunggulan Umum (GAE) menggabungkan beberapa langkah dengan hiperparameter bias-varians \lambda. Saat \lambda mendekati satu, ia menggunakan horizon yang lebih panjang dan bias yang lebih rendah tetapi varians yang lebih tinggi. Untuk loop sikap yang cepat, gunakan penundaan dan skala waktu aktual tugas daripada menyalin pengaturan benchmark.

Kerugian Aktor adalah

L_\pi=-\mathbb{E}[\log\pi_\theta(a_t\mid s_t)\hat A_t]

dan Kritikus meminimalkan kesalahan nilai kuadrat

L_V=\mathbb{E}[(V_\phi(s_t)-\hat V_t)^2]

Ketika encoder gambar digunakan bersama, satu gradien mengubah kedua estimasi. Tingkat pembelajaran terpisah, pemotongan gradien, dan catatan normalisasi observasi tetap memudahkan diagnosis kegagalan.

3. PPO: jangan mengubah kebijakan terlalu jauh sekaligus

Gradien kebijakan on-policy mengumpulkan rollout dengan kebijakan saat ini. Menggunakannya kembali untuk terlalu banyak pembaruan akan menjauhkan kebijakan baru dari distribusi data. PPO membentuk rasio probabilitas antara kebijakan lama \pi_{\theta_{old}} dan kebijakan baru,

r_t(\theta)=\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\theta_{old}}(a_t\mid s_t)}

dan memaksimalkan tujuan yang dipotong

L^{CLIP}=\mathbb{E}\left[\min\left(r_t\hat A_t,\operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t\right)\right]

Keuntungan positif tidak dapat meningkatkan probabilitasnya tanpa batas, dan keuntungan negatif tidak dapat menurunkannya tanpa batas. \epsilon yang kecil bersifat konservatif; yang besar memungkinkan pembaruan yang lebih berani. Pemotongan bukanlah batasan keamanan, sehingga batasan sendi, kecepatan, dan gaya masih terpisah.

Implementasi mengumpulkan rollout tetap, menormalisasi Keuntungan, dan melatih beberapa epoch mini-batch. Simpan probabilitas log lama, bedakan waktu habis dari waktu sebenarnya. keadaan terminal, dan membekukan statistik normalisasi pada evaluasi. Jika tidak, dua run dengan bobot yang sama dapat bertindak berbeda.

4. SAC: reward plus entropi

Soft Actor-Critic (SAC) menambahkan entropi kebijakan \mathcal{H}(\pi) ke reward masa depan sebagai tujuan:

J(\pi)=\mathbb{E}\left[\sum_t\gamma^t\left(r_t+\alpha\mathcal{H}(\pi(\cdot\mid s_t))\right)\right]

Istilah entropi mencegah tindakan yang sama baiknya runtuh menjadi satu terlalu dini, bertindak sebagai suhu \alpha yang menjaga eksplorasi tetap hidup. SAC bersifat off-policy dan menggunakan buffer replay, sehingga setiap transisi dunia nyata dapat digunakan kembali. Itu meningkatkan efisiensi sampel, tetapi data usang, skala reward, dan penyetelan suhu penting.

Untuk tindakan kontinu, Actor mengeluarkan rata-rata \mu_\theta(s) dan deviasi standar \sigma_\theta(s) dari Gaussian, kemudian memetakannya ke dalam batas dengan tanh atau transformasi lain. Probabilitas log membutuhkan koreksi Jacobian dari transformasi tersebut. Jaringan Twin Q dan estimasi Q yang lebih kecil mengurangi Estimasi berlebihan. Putuskan apakah penerapan menggunakan rata-rata deterministik atau mempertahankan noise eksplorasi.

5. Memilih PPO atau SAC

Aspek PPO SAC
Data peluncuran on-policy pemutaran ulang off-policy
Eksplorasi distribusi kebijakan dan bonus entropi entropi adalah bagian dari tujuan
Efisiensi sampel rendah hingga sedang seringkali lebih tinggi
Bug utama probabilitas log, flag terminal, pemotongan estimasi Q berlebihan, skala hadiah, koreksi tanh
Kecocokan tipikal banyak simulator paralel torsi kontinu dan data perangkat keras yang langka

PPO seringkali stabil ketika banyak lingkungan simulasi dapat berjalan secara paralel. SAC dapat menarik ketika setiap transisi nyata mahal. Kedua metode tersebut tidak memodelkan penundaan sensor, zona mati motor, atau saturasi aktuator secara otomatis.

6. Sim-to-Real adalah Batasan, bukan sakelar

Kesenjangan simulasi-ke-realitas berasal dari massa dan gesekan, reaksi balik, paparan dan kebisingan sensor, penundaan jaringan, penurunan daya baterai, material lantai, dan pencahayaan. Pengacakan Domain mengambil sampel parameter ini sehingga kebijakan tidak terlalu menyesuaikan satu nilai ideal. Rentang harus diukur dari perangkat keras; mengacak dunia yang mustahil hanya akan mempersulit pelatihan.

Transfer bertahap lebih aman: (1) simulasi murni, (2) memutar ulang log sensor nyata tanpa gerakan, (3) pengujian daya rendah dengan roda terangkat, (4) kecepatan dan gaya terbatas pada lantai yang bersih, dan (5) tugas itu sendiri. Catat tindakan yang diminta secara terpisah dari tindakan yang sebenarnya dilewati oleh pembatas keamanan. Sim-to-Real adalah siklus iteratif identifikasi dan evaluasi, bukan tombol penyebaran tunggal.

7. Keamanan dan evaluasi

Pemotongan PPO dan entropi SAC tidak mencegah tabrakan. Monitor independen harus memeriksa kecepatan, percepatan, sudut sambungan, gaya kontak, tekanan hidrolik, arus, dan suhu. Pada pengamatan yang tidak valid, NaN, stempel waktu kedaluwarsa, atau komunikasi Jika terjadi dropout, monitor harus memerintahkan penghentian yang aman. Tempatkan dalam proses atau MCU terpisah jika risikonya memungkinkan.

Selain reward, ukur keberhasilan, tingkat tabrakan, deviasi maksimum, jarak berhenti, energi, kelancaran aksi, latensi inferensi, dan tingkat intervensi pembatas keamanan. Tingkat keberhasilan yang tinggi dengan intervensi yang sering berarti kebijakan bergantung pada pembatas. Ulangi eksekusi dengan beberapa seed acak dan laporkan varians dan kasus terburuk, bukan hanya rata-rata.

Daftar periksa implementasi

  1. Uji unit aksi, batasan, pengurutan tanh/clip, dan koreksi log-probabilitas.

  2. Untuk PPO, simpan log probabilitas lama, Advantage, dan flag terminal versus timeout.

  3. Untuk SAC, pantau distribusi replay, nilai Q kembar, suhu \alpha, dan skala reward.

  4. Tetapkan pra-pemrosesan, normalisasi, seed, bobot, dan parameter lingkungan berdasarkan ID eksperimen.

  5. Jaga agar PID/MPC tingkat rendah, batasan laju, watchdog, dan penghentian darurat independen dari pembelajar.

  6. Tetapkan kondisi berhenti untuk log pasif, daya rendah, dan operasi normal sebelum setiap transisi.

  7. Catat keberhasilan, tabrakan, intervensi pembatas, latensi, energi, dan deviasi maksimum secara bersamaan.

Ringkasan

Gradien kebijakan mengoptimalkan distribusi aksi kontinu secara langsung. Actor-Critic menggunakan Advantage untuk mengurangi varians; PPO memotong pembaruan; SAC menggunakan entropi dan pemutaran ulang untuk meningkatkan eksplorasi dan efisiensi data. Tidak satu pun dari metode tersebut yang menyelesaikan ketidakpastian perangkat keras atau keamanan dengan sendirinya. Pengontrol tingkat bawah yang terverifikasi, monitor independen, transfer bertahap, dan evaluasi kasus terburuk merupakan bagian dari algoritma ketika kebijakan yang dipelajari meninggalkan simulasi.

Periksa pemahaman Anda
Apakah pemotongan PPO menjamin perilaku yang aman?

Ini memoderasi tujuan optimasi, bukan batasan keamanan fisik. Evaluasi stabilitas pelatihan dan keamanan aksi secara terpisah.

Referensi

What to read next

Review the backgroundQ-Learning dan DQN — Dari Q-Table ke Deep Reinforcement LearningContinue the seriesPengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RLExplore another aspect of this fieldPengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga Belajar