Contents — find the section you need
Q-learning dan DQN memilih dari himpunan aksi yang terbatas. Namun, kecepatan roda, daya dorong drone, atau torsi manipulator bersifat kontinu. Metode policy-gradient memperbarui kebijakan \pi_\theta yang menghasilkan distribusi atas aksi kontinu. Actor-Critic menambahkan Critic yang mengevaluasi aksi-aksi tersebut; PPO dan SAC menambahkan stabilisasi praktis yang banyak digunakan dalam penelitian robot.
Ringkasan 30 detik
-
Policy gradient meningkatkan pengembalian yang diharapkan J(\theta) secara langsung. Mereka menangani aksi kontinu secara alami, tetapi estimasi lintasan tunggal memiliki varians yang tinggi.
-
Actor-Critic menggunakan estimasi nilai sebagai dasar. Advantage mengukur apakah suatu aksi lebih baik daripada aksi rata-rata dalam keadaan yang sama.
-
PPO membatasi rasio probabilitas antara kebijakan lama dan baru sehingga satu pembaruan tidak dapat bergerak terlalu jauh. Ini mudah, tetapi data on-policy sulit untuk digunakan kembali.
-
SAC memaksimalkan baik reward maupun entropi kebijakan. Ini adalah metode off-policy, menggunakan replay, dan sangat cocok untuk kontrol kontinu.
-
Kedua metode tersebut tidak menyediakan batasan keselamatan. Jaga agar batasan aksi, batasan laju, PID/MPC tingkat rendah, dan penghentian darurat berada di luar sistem pembelajaran.
1. Mengoptimalkan kebijakan secara langsung
Gambar 1 — Aktor mengusulkan distribusi kontinu dan Kritikus mengevaluasi pengembaliannya. Pada perangkat keras, tindakan tersebut melalui pengontrol tingkat bawah yang terverifikasi, bukan langsung ke torsi.
Untuk kebijakan stokastik \pi_\theta(a\mid s), gradien pengembalian yang diharapkan J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] dapat ditulis menggunakan gradien log probabilitas:
Tindakan yang menghasilkan pengembalian tinggi menjadi lebih mungkin. Karena G_t bising dan tertunda, mengurangi garis dasar yang bergantung pada keadaan b(s_t) mengurangi varians tanpa mengubah gradien yang diharapkan:
2. Keunggulan dan Aktor-Kritikus
Kritikus mempelajari V_\phi(s) dan memperkirakan apakah suatu tindakan lebih baik daripada rata-rata keadaan dengan A_t=Q(s_t,a_t)-V(s_t). Aproksimasi TD satu langkah adalah
Estimasi Keunggulan Umum (GAE) menggabungkan beberapa langkah dengan hiperparameter bias-varians \lambda. Saat \lambda mendekati satu, ia menggunakan horizon yang lebih panjang dan bias yang lebih rendah tetapi varians yang lebih tinggi. Untuk loop sikap yang cepat, gunakan penundaan dan skala waktu aktual tugas daripada menyalin pengaturan benchmark.
Kerugian Aktor adalah
dan Kritikus meminimalkan kesalahan nilai kuadrat
Ketika encoder gambar digunakan bersama, satu gradien mengubah kedua estimasi. Tingkat pembelajaran terpisah, pemotongan gradien, dan catatan normalisasi observasi tetap memudahkan diagnosis kegagalan.
3. PPO: jangan mengubah kebijakan terlalu jauh sekaligus
Gradien kebijakan on-policy mengumpulkan rollout dengan kebijakan saat ini. Menggunakannya kembali untuk terlalu banyak pembaruan akan menjauhkan kebijakan baru dari distribusi data. PPO membentuk rasio probabilitas antara kebijakan lama \pi_{\theta_{old}} dan kebijakan baru,
dan memaksimalkan tujuan yang dipotong
Keuntungan positif tidak dapat meningkatkan probabilitasnya tanpa batas, dan keuntungan negatif tidak dapat menurunkannya tanpa batas. \epsilon yang kecil bersifat konservatif; yang besar memungkinkan pembaruan yang lebih berani. Pemotongan bukanlah batasan keamanan, sehingga batasan sendi, kecepatan, dan gaya masih terpisah.
Implementasi mengumpulkan rollout tetap, menormalisasi Keuntungan, dan melatih beberapa epoch mini-batch. Simpan probabilitas log lama, bedakan waktu habis dari waktu sebenarnya. keadaan terminal, dan membekukan statistik normalisasi pada evaluasi. Jika tidak, dua run dengan bobot yang sama dapat bertindak berbeda.
4. SAC: reward plus entropi
Soft Actor-Critic (SAC) menambahkan entropi kebijakan \mathcal{H}(\pi) ke reward masa depan sebagai tujuan:
Istilah entropi mencegah tindakan yang sama baiknya runtuh menjadi satu terlalu dini, bertindak sebagai suhu \alpha yang menjaga eksplorasi tetap hidup. SAC bersifat off-policy dan menggunakan buffer replay, sehingga setiap transisi dunia nyata dapat digunakan kembali. Itu meningkatkan efisiensi sampel, tetapi data usang, skala reward, dan penyetelan suhu penting.
Untuk tindakan kontinu, Actor mengeluarkan rata-rata \mu_\theta(s) dan deviasi standar \sigma_\theta(s) dari Gaussian, kemudian memetakannya ke dalam batas dengan tanh atau transformasi lain. Probabilitas log membutuhkan koreksi Jacobian dari transformasi tersebut. Jaringan Twin Q dan estimasi Q yang lebih kecil mengurangi Estimasi berlebihan. Putuskan apakah penerapan menggunakan rata-rata deterministik atau mempertahankan noise eksplorasi.
5. Memilih PPO atau SAC
| Aspek | PPO | SAC |
|---|---|---|
| Data | peluncuran on-policy | pemutaran ulang off-policy |
| Eksplorasi | distribusi kebijakan dan bonus entropi | entropi adalah bagian dari tujuan |
| Efisiensi sampel | rendah hingga sedang | seringkali lebih tinggi |
| Bug utama | probabilitas log, flag terminal, pemotongan | estimasi Q berlebihan, skala hadiah, koreksi tanh |
| Kecocokan tipikal | banyak simulator paralel | torsi kontinu dan data perangkat keras yang langka |
PPO seringkali stabil ketika banyak lingkungan simulasi dapat berjalan secara paralel. SAC dapat menarik ketika setiap transisi nyata mahal. Kedua metode tersebut tidak memodelkan penundaan sensor, zona mati motor, atau saturasi aktuator secara otomatis.
6. Sim-to-Real adalah Batasan, bukan sakelar
Kesenjangan simulasi-ke-realitas berasal dari massa dan gesekan, reaksi balik, paparan dan kebisingan sensor, penundaan jaringan, penurunan daya baterai, material lantai, dan pencahayaan. Pengacakan Domain mengambil sampel parameter ini sehingga kebijakan tidak terlalu menyesuaikan satu nilai ideal. Rentang harus diukur dari perangkat keras; mengacak dunia yang mustahil hanya akan mempersulit pelatihan.
Transfer bertahap lebih aman: (1) simulasi murni, (2) memutar ulang log sensor nyata tanpa gerakan, (3) pengujian daya rendah dengan roda terangkat, (4) kecepatan dan gaya terbatas pada lantai yang bersih, dan (5) tugas itu sendiri. Catat tindakan yang diminta secara terpisah dari tindakan yang sebenarnya dilewati oleh pembatas keamanan. Sim-to-Real adalah siklus iteratif identifikasi dan evaluasi, bukan tombol penyebaran tunggal.
7. Keamanan dan evaluasi
Pemotongan PPO dan entropi SAC tidak mencegah tabrakan. Monitor independen harus memeriksa kecepatan, percepatan, sudut sambungan, gaya kontak, tekanan hidrolik, arus, dan suhu. Pada pengamatan yang tidak valid, NaN, stempel waktu kedaluwarsa, atau komunikasi Jika terjadi dropout, monitor harus memerintahkan penghentian yang aman. Tempatkan dalam proses atau MCU terpisah jika risikonya memungkinkan.
Selain reward, ukur keberhasilan, tingkat tabrakan, deviasi maksimum, jarak berhenti, energi, kelancaran aksi, latensi inferensi, dan tingkat intervensi pembatas keamanan. Tingkat keberhasilan yang tinggi dengan intervensi yang sering berarti kebijakan bergantung pada pembatas. Ulangi eksekusi dengan beberapa seed acak dan laporkan varians dan kasus terburuk, bukan hanya rata-rata.
Daftar periksa implementasi
-
Uji unit aksi, batasan, pengurutan tanh/clip, dan koreksi log-probabilitas.
-
Untuk PPO, simpan log probabilitas lama, Advantage, dan flag terminal versus timeout.
-
Untuk SAC, pantau distribusi replay, nilai Q kembar, suhu \alpha, dan skala reward.
-
Tetapkan pra-pemrosesan, normalisasi, seed, bobot, dan parameter lingkungan berdasarkan ID eksperimen.
-
Jaga agar PID/MPC tingkat rendah, batasan laju, watchdog, dan penghentian darurat independen dari pembelajar.
-
Tetapkan kondisi berhenti untuk log pasif, daya rendah, dan operasi normal sebelum setiap transisi.
-
Catat keberhasilan, tabrakan, intervensi pembatas, latensi, energi, dan deviasi maksimum secara bersamaan.
Ringkasan
Gradien kebijakan mengoptimalkan distribusi aksi kontinu secara langsung. Actor-Critic menggunakan Advantage untuk mengurangi varians; PPO memotong pembaruan; SAC menggunakan entropi dan pemutaran ulang untuk meningkatkan eksplorasi dan efisiensi data. Tidak satu pun dari metode tersebut yang menyelesaikan ketidakpastian perangkat keras atau keamanan dengan sendirinya. Pengontrol tingkat bawah yang terverifikasi, monitor independen, transfer bertahap, dan evaluasi kasus terburuk merupakan bagian dari algoritma ketika kebijakan yang dipelajari meninggalkan simulasi.
Apakah pemotongan PPO menjamin perilaku yang aman?
Ini memoderasi tujuan optimasi, bukan batasan keamanan fisik. Evaluasi stabilitas pelatihan dan keamanan aksi secara terpisah.
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.