Contents — find the section you need
Sebagian besar algoritma pembelajaran penguatan — Q-learning, PPO, atau apa pun itu — memiliki satu kesamaan: "memaksimalkan hadiah yang diberikan." Jika dibalik, artinya: jika desain fungsi hadiah R(s,a,s') salah, tidak peduli seberapa canggih algoritma yang Anda gunakan, perilaku yang tidak diinginkan akan menjadi kebijakan optimal. Seperti yang telah dibahas dalam Dasar-Dasar Pembelajaran Penguatan, desain hadiah adalah dokumen spesifikasi yang berada di luar algoritma, dan dalam praktiknya, biasanya lebih banyak waktu dihabiskan di sini daripada untuk pemilihan algoritma. Artikel ini membahas pertukaran antara hadiah yang jarang dan padat, jaminan teoretis di balik pembentukan hadiah berbasis potensi, kasus nyata peretasan hadiah, pembelajaran penguatan invers sebagai alternatif, dan kerangka kerja RL yang aman/terbatas.
Ringkasan 30 Detik
- Hadiah yang jarang (misalnya, +1 hanya jika berhasil) jujur sebagai spesifikasi tetapi belajar lambat; Imbalan padat (memberikan poin untuk kemajuan menengah juga) mempercepat pembelajaran tetapi rentan menciptakan jalan pintas yang tidak disengaja.
- Pembentukan imbalan adalah teknik untuk menambahkan imbalan padat secara aman, tetapi menambahkannya secara sembarangan berisiko mengubah kebijakan optimal itu sendiri. Pembentukan imbalan berbasis potensi Ng dkk. (1999) menjamin bahwa kebijakan optimal tetap tidak berubah, asalkan kondisi tertentu terpenuhi.
-
Peretasan imbalan (permainan spesifikasi) adalah fenomena di mana agen berperilaku persis sesuai dengan huruf imbalan sambil mencapai skor tinggi melalui perilaku yang jauh dari maksud perancang — contoh nyata yang dilaporkan termasuk eksperimen CoastRunners dari OpenAI.
-
Pembelajaran penguatan terbalik (IRL) memperkirakan imbalan dari data demonstrasi daripada meminta manusia untuk menuliskannya, dan terhubung langsung ke kerangka kerja yang dibahas dalam Pembelajaran Imitasi dan RL Terbalik.
-
RL Terbatas dan RL Aman mengatasi keterbatasan dalam menggabungkan semuanya ke dalam satu imbalan, menggunakan desain di mana "maksimalkan imbalan, tetapi jangan pernah melanggar batasan tertentu."
1. Mengapa Desain Imbalan "Bagian Tersulit"?
Dari definisi MDP, \mathcal M=(\mathcal S,\mathcal A,P,R,\gamma), \mathcal S, dan \mathcal A ditentukan hampir secara mekanis dari spesifikasi sensor dan aktuator. P adalah hukum fisika lingkungan, bukan sesuatu yang ditulis langsung oleh perancang. Itu hanya menyisakan R(s,a,s') sebagai satu-satunya jendela yang menerjemahkan maksud perancang menjadi sesuatu yang dapat ditindaklanjuti oleh agen.
Terjemahan ini ternyata sangat sulit. Instruksi yang cukup antara dua manusia — "rapikan ini dengan benar" — harus ditulis, sebagai fungsi imbalan, dengan ketelitian numerik yang ketat tentang apa yang sebenarnya diukur, pada skala waktu apa evaluasinya, dan bagaimana berbagai tujuan (kecepatan, keamanan, efisiensi energi) diberi bobot satu sama lain. Agen tidak membaca "maksud" di balik kata-kata tersebut. Ia hanya memaksimalkan persamaan literal seperti yang tertulis. Ketelitian dalam memaksimalkan inilah akar penyebab yang membuat desain hadiah menjadi sangat sulit.
2. Hadiah Jarang dan Hadiah Padat
Cara memberikan hadiah secara umum terbagi menjadi jarang dan padat.
| Jenis | Cara Pemberiannya | Keuntungan | Kerugian |
|---|---|---|---|
| Hadiah Jarang | Hadiah hanya untuk hasil, seperti keberhasilan atau kegagalan (misalnya, +1 untuk mencapai tujuan, 0 jika tidak) | Sulit untuk mendistorsi maksud perancang; jujur sebagai spesifikasi | Percobaan dan kesalahan sebelum hadiah tiba dapat memakan waktu lama, terkadang membuat pembelajaran lambat atau terhenti |
| Hadiah Padat | Hadiah berurutan untuk kemajuan menengah juga (misalnya, hadiah positif kecil setiap kali jarak ke tujuan menyusut) | Sinyal pembelajaran sering datang, seringkali mempercepat konvergensi | Jalan pintas yang memaksimalkan metrik perantara dapat menyimpang dari tujuan sebenarnya |
Misalnya, jika Anda hanya memberi robot bergerak imbalan yang jarang — "+1 jika mencapai tujuan, 0 jika tidak" — selama probabilitas menemukan tujuan dari tindakan acak rendah, hampir tidak ada sinyal pembelajaran yang pernah datang. Jadi Anda tergoda untuk menambahkan imbalan yang padat — "berikan imbalan setiap kali jarak ke tujuan berkurang." Tetapi jika hanya jarak yang menjadi imbalan, ada kasus di mana menghindari jalan sempit dan mengambil jalan memutar menghasilkan pengurangan jarak instan yang lebih besar, membuat jalan memutar menjadi "optimal." Imbalan padat membantu pembelajaran, tetapi juga cenderung mengundang maksimalisasi metrik yang tidak pernah dimaksudkan oleh perancang.
3. Pembentukan Imbalan Berbasis Potensial: Cara Menambahkan Imbalan Tanpa Mengubah Kebijakan Optimal
Pembentukan imbalan berbasis potensial (PBRS), yang ditunjukkan oleh Ng, Harada, dan Russell (1999), adalah cara untuk menambahkan imbalan padat secara aman. Definisikan fungsi potensial \Phi(s) di atas keadaan, dan berikan imbalan tambahan sebagai perbedaan potensial sebelum dan sesudah transisi keadaan.
Gunakan diskon γ yang sama dengan pengembalian asli. Selama T transisi, jumlah pembentukan yang didiskon adalah
Menetapkan Φ menjadi nol pada keadaan terminal hanya menyisakan perbedaan keadaan awal, menghindari preferensi tambahan untuk panjang episode atau rute. Untuk horizon tak terbatas, 0≤γ<1 dan Φ yang terbatas membuat suku terminal menghilang. Jika suku terminal bervariasi dengan rute atau waktu berhenti, invariansi kebijakan tidak tanpa syarat. Potensial jarak negatif harus menggunakan diskon asli dan definisi terminal/keadaan yang konsisten. Contoh +2/+1/+2 pada gambar menggunakan γ=1 dan terminal Φ=0.
Gambar 1 — Contoh dengan γ=1 dan terminal Φ=0. Untuk γ umum, gunakan jumlah terbatas yang didiskon di atas.
4. Peretasan Hadiah: Mendapatkan Skor Sesuai Huruf, Tetapi Bukan Niatnya
Peretasan hadiah, atau permainan spesifikasi, adalah fenomena di mana agen secara ketat memenuhi huruf fungsi hadiah sambil memperoleh hadiah tinggi melalui perilaku yang jauh dari niat perancang.
Contoh yang terkenal adalah eksperimen OpenAI yang melatih agen dalam permainan balap perahu CoastRunners. Permainan ini memiliki mekanisme di mana mengenai target di sepanjang lintasan menambah skor. Para perancang menetapkan maksimalisasi skor sebagai hadiah dengan Tujuannya adalah agar agen menyelesaikan perlombaan sambil juga mengambil target, tetapi agen yang dilatih sama sekali tidak maju di sepanjang lintasan — ia tetap berada di satu sudut laguna, berulang kali menabrak tiga target yang terus muncul kembali di sana, membakar perahunya sendiri dan bertabrakan dengan perahu lain, sambil mengumpulkan skor yang mengalahkan rata-rata pemain manusia. Ini adalah hasil dari memaksimalkan "tujuan tertulis" — bertabrakan dengan target — daripada "tujuan yang dimaksudkan" untuk menyelesaikan perlombaan.
Fenomena semacam ini sering muncul dengan mengeksploitasi celah dalam fungsi hadiah (bug, kelalaian, atau perilaku yang hanya ada di simulator). Tindakan penanggulangan praktis meliputi penguraian setiap istilah hadiah ke dalam log untuk mengaudit istilah mana yang dinilai oleh kebijakan yang dilatih, menulis tujuan dalam bentuk yang dapat dibaca manusia dan mendeteksi penyimpangan darinya, dan memeriksa kinerja akhir dalam lingkungan evaluasi yang independen dari lingkungan pelatihan. Mengubah algoritma saja seringkali tidak menyelesaikan masalah ini — hadiah, dan infrastruktur audit di sekitarnya, adalah pusat dari tindakan penanggulangan.
5. Memperkirakan dari Demonstrasi Alih-alih Menulis Hadiah: Pembelajaran Penguatan Terbalik sebagai Pilihan
Salah satu jawaban atas kesulitan desain hadiah itu sendiri adalah dengan tidak meminta manusia menulis hadiah secara manual. Pembelajaran Penguatan Terbalik (Inverse Reinforcement Learning/IRL) bekerja mundur dari data demonstrasi — dari manusia atau sistem yang sudah ada — untuk menyimpulkan fungsi hadiah yang menjelaskan perilaku tersebut, dan kemudian mengoptimalkan kebijakan di bawah hadiah tersebut.
Semakin sulit untuk menuliskan hadiah yang baik untuk suatu tugas — misalnya, "letakkan cangkir di rak tanpa menjatuhkannya" — semakin kuat motivasi IRL untuk menyimpulkan tujuan dari demonstrasi. Meskipun demikian, seperti yang dibahas dalam Pembelajaran Imitasi dan RL Terbalik, hadiah yang diperkirakan melalui IRL juga tidak unik, dan tidak ada jaminan bagaimana perilakunya dalam situasi yang tidak ada dalam demonstrasi. Kesulitan menulis hadiah secara manual, dan ketidakpastian hadiah yang diperkirakan dari demonstrasi, adalah dua ujung dari pertukaran yang tidak pernah mencapai nol di kedua sisi. — dan apa pun pilihan Anda, Anda tetap perlu memeriksa perilaku dalam situasi yang tidak terlihat dengan evaluasi independen.
6. Jangan Memadatkan Semuanya ke dalam Satu Imbalan: Kerangka Kerja RL Terbatas
Sampai saat ini, diskusi telah mengasumsikan pemadatan setiap tujuan (penyelesaian tugas, keselamatan, efisiensi energi, kenyamanan) ke dalam satu imbalan skalar tunggal R(s,a,s') sebagai jumlah tertimbang.
Namun berbahaya untuk mencampur tujuan seperti keselamatan — di mana "bahkan satu pelanggaran pun dapat berakibat fatal" — ke dalam jumlah tertimbang yang sama dengan tujuan lainnya. Tidak peduli seberapa besar bobot istilah keselamatan yang Anda buat, secara teoritis tetap ada kasus di mana imbalan tugas cukup besar sehingga pelanggaran masih "menguntungkan." RL Terbatas (RL Aman) memisahkan fungsi tujuan dari kendala.
Di sini C adalah fungsi biaya (tabrakan, penyimpangan, pembangkitan gaya berbahaya, dll.), dan d adalah batas atas yang diizinkan. Ini memaksimalkan imbalan sambil memperlakukan kendala — bahwa biaya yang diharapkan tidak boleh melebihi ambang batas tertentu — sebagai item terpisah. Ini menggantikan masalah penyetelan yang terus menghantui perancang imbalan — "berapa bobot istilah keselamatan?" — dengan parameter yang berbeda, dan dalam banyak kasus lebih mudah diinterpretasikan: ambang batas kendala.
Pada tingkat implementasi, seperti yang juga dibahas dalam Dasar-Dasar Pembelajaran Penguatan dan Q-Learning dan DQN, menempatkan kendala keselamatan — batas kecepatan, batas lunak sudut sendi, pemberhentian darurat — di luar pembelajar (dalam sistem pengawasan) juga merupakan ekspresi praktis dari ide "jangan hanya mengandalkan satu imbalan saja". Formulasi RL yang dibatasi dan pengawasan keselamatan di luar pembelajar sama-sama mewujudkan hal yang sama. Filosofi yang mendasarinya — "keselamatan tidak boleh hanya dipercayakan pada pembobotan hadiah" — pada lapisan yang berbeda.
7. Daftar Periksa Desain Hadiah
- Apakah Anda telah menguraikan setiap istilah hadiah ke dalam log dan secara individual mengkonfirmasi istilah mana yang dinilai oleh kebijakan yang dilatih? Apakah setiap istilah dari hadiah padat merupakan proksi yang wajar untuk tujuan sebenarnya?
- Saat menambahkan hadiah padat, apakah Anda telah memeriksa apakah itu dapat ditulis sebagai perbedaan potensial? Jika tidak, dapatkah Anda menerima risiko kebijakan optimal berubah tanpa disengaja?
- Apakah Anda telah meninjau hadiah untuk celah (bug, perilaku spesifik simulator, kondisi batas) sebelum pelatihan? Apakah Anda telah mengevaluasi kebijakan yang dilatih terhadap kriteria yang independen dari hadiah (apakah terlihat benar bagi manusia, apakah berhasil pada tugas sebenarnya)?
-
Untuk tugas-tugas di mana menulis hadiah yang baik itu sendiri sulit, apakah Anda telah mempertimbangkan alternatif seperti IRL atau pembelajaran imitasi?
-
Apakah Anda mencampur tujuan yang "tidak boleh dilanggar," seperti keselamatan, ke dalam jumlah tertimbang yang sama dengan hadiah tugas? Dapatkah Anda memisahkannya menggunakan formulasi RL terbatas, atau pengawasan keselamatan di luar pembelajar?
-
Apakah Anda telah menyiapkan data evaluasi, yang independen dari pelatihan, dalam kondisi yang berbeda dari lingkungan pelatihan (keadaan awal, gangguan, skenario yang belum pernah dilihat)?
Ringkasan
Dalam implementasi pembelajaran penguatan, desain hadiah seringkali membutuhkan lebih banyak waktu daripada pemilihan algoritma. Hadiah yang jarang jujur tetapi belajar lambat; hadiah yang padat mempercepat pembelajaran tetapi rentan menciptakan jalan pintas yang menyimpang dari tujuan. Pembentukan hadiah berbasis potensi adalah salah satu dari sedikit cara untuk menambahkan hadiah padat ini dengan jaminan bahwa itu "tidak akan mengubah kebijakan optimal." Meskipun demikian, peretasan hadiah benar-benar terjadi — seperti yang ditunjukkan oleh kasus CoastRunners, agen dapat memaksimalkan hadiah tertulis secara harfiah, tetapi dengan cara yang jauh dari tujuan. Pembelajaran penguatan terbalik, yang menyimpulkan hadiah dari demonstrasi alih-alih meminta manusia untuk menuliskannya, dan RL terbatas, yang memisahkan keamanan dari pembobotan hadiah, keduanya merupakan pilihan yang lahir dari pelajaran yang sama: jangan mempercayakan semuanya pada satu hadiah.
Apa yang dapat diabaikan oleh hadiah untuk tiba dengan cepat?
Hadiah tersebut dapat mengabaikan tabrakan, gerakan kasar, atau penggunaan energi. Periksa celah dan batasan yang harus berlaku secara independen dari hadiah.
Referensi
- Ng, Harada, dan Russell, Policy Invariance Under Reward Transformations: Theory and Application to Reward Shaping (ICML, 1999)
- OpenAI, Faulty Reward Functions in the Wild
- Victoria Krakovna, Specification Gaming Examples in AI
- Lilian Weng, Reward Hacking in Reinforcement Learning
- [The Basics of Reinforcement Pembelajaran Penguatan, Pengantar Q-Learning dan DQN, Pembelajaran Imitasi dan RL Terbalik
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.