Physical Intelligenceが2024年に発表したπ0を、原論文の記述に基づいて分解する。PaliGemma VLMバックボーンと専用Action Expertの併走構成、条件付きフローマッチングによる連続行動生成、7種類のロボットにまたがるクロスエンボディメント学習まで、RT-2/OpenVLA型の自己回帰VLAと何が違うのかを数式付きで検証する。
2026年9月3日 強化学習入門Behavior Cloning、DAgger、逆強化学習は、報酬を手書きしにくいロボット課題で人や既存システムの実演を使う。共変量シフト、報酬推定、VLAとの接続、評価と安全を式と図で解説する。