個人開発 — インフラ構築・ロボット開発・技術動向調査・企業研究
タグ · 全2件

#模倣学習

2026年9月4日 強化学習入門

π0(パイ・ゼロ)徹底解説 — フローマッチングはVLAの行動生成をどう変えたか

Physical Intelligenceが2024年に発表したπ0を、原論文の記述に基づいて分解する。PaliGemma VLMバックボーンと専用Action Expertの併走構成、条件付きフローマッチングによる連続行動生成、7種類のロボットにまたがるクロスエンボディメント学習まで、RT-2/OpenVLA型の自己回帰VLAと何が違うのかを数式付きで検証する。

2026年9月3日 強化学習入門

強化学習入門:模倣学習と逆強化学習 — 手本から方策と目的を学ぶ

Behavior Cloning、DAgger、逆強化学習は、報酬を手書きしにくいロボット課題で人や既存システムの実演を使う。共変量シフト、報酬推定、VLAとの接続、評価と安全を式と図で解説する。