Makaleler
Teknolojiyi üretin, deneyin ve inceleyin. Uygulama, deney ve araştırmalarla çalışma ilkelerini kaydediyoruz.
← Öğrenme rehberi

Pekiştirmeli öğrenme — Öğrenme rehberi

Pekiştirmeli öğrenme — Temel ilkelerden uygulamaya uzanan düzenli öğrenme yolları.

Temel ilkelerden uygulamaya uzanan düzenli öğrenme yolları.

  1. Fundamentals · 6 min okuma

    Takviyeli Öğrenmenin Temelleri — MDP'ler, Bellman Denklemleri ve Robotlar için Keşif

    Takviyeli öğrenme, bir ajanın gözlemlerden eylemler seçtiği ve gecikmeli ödülleri maksimize ettiği kapalı bir döngüdür. Bu giriş niteliğindeki metin, MDP'leri, değer fonksiyonlarını, politikaları, Bellman denklemlerini, keşif ve sömürüyü, ödül tasarımını ve simülasyondan gerçek bir robota giden yolu açıklamaktadır.

  2. Fundamentals · 5 min okuma

    Q-Learning ve DQN — Q-Tablosundan Derin Pekiştirmeli Öğrenmeye

    Q-öğrenme, eylem değerlerini Bellman optimumluk hedefiyle günceller. Bu giriş niteliğindeki kılavuz, tablo halindeki bir Q-tablosundan Derin Q-Ağına giden yolu izleyerek, deneyim tekrarı, hedef ağlar, aşırı tahmin ve robot yığınında güvenli yerleştirme konularını açıklamaktadır.

  3. Fundamentals · 5 min okuma

    Politika Gradyanları, PPO ve SAC — Robotlar için Kararlı Sürekli Kontrol

    Politika gradyanları, yönlendirme, itme ve eklem torkunun sürekli kalabilmesi için politikayı doğrudan günceller. Bu makale, Aktör-Eleştirmen, PPO ve SAC'yi birbirine bağladıktan sonra kırpma, entropi düzenlemesi, değerlendirme ve simülasyondan gerçek hayata aktarım için güvenlik sınırını ele almaktadır.

  4. Fundamentals · 7 min okuma

    Ödül Tasarımına Giriş — RL'de "Neyi En Üst Düzeye Çıkarmalı" Sorusu Neden En Zor Kısım?

    Takviyeli öğrenme uygulamalarında, ödül fonksiyonu tasarımı, algoritmadan daha çok sonucu belirler. Bu makale, seyrek ve yoğun ödül, potansiyel tabanlı ödül şekillendirmenin politika değişmezliği, ödül manipülasyonunun gerçek örnekleri, ters takviyeli öğrenme ve kısıtlı takviyeli öğrenmeyi ele almaktadır.

  5. Fundamentals · 4 min okuma

    Model Tabanlı Takviyeli Öğrenme ve Simülasyondan Gerçeğe

    Gerçek makineler için dünya modelleri, tahmin hatası, MPC, alan rastgeleleştirme, sistem tanımlama ve güvenlik izleme.

  6. Fundamentals · 5 min okuma

    Pekiştirmeli Öğrenmeye Giriş: Taklit Öğrenme ve Ters Pekiştirmeli Öğrenme

    Davranış Klonlama, DAgger ve ters pekiştirme öğrenmesi, ödüllerin yazılması zor olduğunda gösterimlerden yararlanır. Bu giriş niteliğindeki metin, kovaryat kayması, ödül çıkarımı, VLA bağlantıları, değerlendirme, güvenlik ve veri kaynağı konularını kapsamaktadır.

  7. Fundamentals · 10 min okuma

    π0 Açıklaması — Akış Eşleştirme, VLA Eylem Üretimini Nasıl Değiştirdi?

    Physical Intelligence'ın π0'ına yönelik kaynak tabanlı teknik kılavuz: PaliGemma VLM ve özel Eylem Uzmanı, koşullu akış eşleştirmesiyle sürekli eylem üretimi, yedi robot tipi arasında çapraz vücutlama eğitimi ve RT-2 ve OpenVLA gibi otoregresif VLA modellerinden farkı.

  8. Fundamentals · 7 min okuma

    Çoklu Ajanlı Takviyeli Öğrenmeye Giriş — Karşı Tarafın da Öğrendiği Bir Dünyada Optimizasyon

    Birden fazla ajanın aynı anda öğrenmesi durumunda, tek ajanlı MDP artık geçerli değildir. Bu makale, denklemler ve diyagramlarla birlikte, durağan olmama, işbirlikçi/rekabetçi/karma ortamlar, CTDE, kredi atama problemi ve MADDPG ile QMIX'i düzenlemektedir.

Search this field →