ニューラルネットワークの基礎から、強化学習、物体検出・認識、生成モデルまでを、実装と数式の両面から解説します。
バウンディングボックスで物体を囲むObject Detectionと、ピクセル単位で意味を割り当てるSemantic Segmentation。両者の違いから、Instance/Panoptic Segmentationとの関係、R-CNNからDETR/DINOに至る代表アルゴリズムの系譜、点群を対象にした3D版まで、画像認識の基礎を体系的に整理する。
2026年9月4日 機械学習入門生成モデルはデータ分布を表現し、画像・文・音声・行動を生成する。尤度、VAE、GAN、拡散モデル、評価と安全を整理する。
2026年9月4日 機械学習入門機械学習はモデル選びより、問題定義、データ分割、損失、評価、運用時の変化を設計する作業である。
2026年9月4日 機械学習入門ニューラルネットワークは線形変換と非線形活性化を重ね、勾配降下で損失を小さくする関数近似器である。
2026年9月4日 機械学習入門姿勢推定は画像から人体・物体のキーポイントや6D姿勢を推定する。座標系、損失、遮蔽、評価、安全を整理する。
2026年9月4日 強化学習入門複数のエージェントが同時に学習すると、単一エージェントのMDPは成り立たなくなる。非定常性、協調・競争・混合設定、CTDE、信用割当問題、MADDPGとQMIXまでを式と図で整理する。
2026年9月4日 強化学習入門強化学習の実装の中で、アルゴリズムよりも報酬関数の設計が結果を左右することが多い。疎な報酬と密な報酬、ポテンシャルベース報酬シェイピングの方策不変性、報酬ハッキングの実例、逆強化学習と制約付きRLまでを整理する。
2026年9月3日 強化学習入門Behavior Cloning、DAgger、逆強化学習は、報酬を手書きしにくいロボット課題で人や既存システムの実演を使う。共変量シフト、報酬推定、VLAとの接続、評価と安全を式と図で解説する。
2026年9月3日 強化学習入門強化学習を「正解ラベルを当てる学習」ではなく、観測から行動を選び、遅れて返る報酬を最大化する閉ループとして捉える。MDP、価値関数、方策、ベルマン方程式、探索と活用、シミュレーション実装までをロボットの例で図解する。
2026年9月3日 強化学習入門世界モデル、予測誤差、MPC、Domain Randomization、安全監視を通じ、学習した方策を実機へ移す方法を解説する。
2026年9月3日 強化学習入門連続した操舵角や関節トルクを扱うため、方策を直接更新する方策勾配法からActor-Critic、PPO、SACまでをつなげて解説する。クリッピング、エントロピー正則化、評価指標、Sim-to-Realの安全境界を図と式で整理する。
2026年9月3日 強化学習入門Q学習がベルマン最適方程式を使って行動価値を更新する仕組みを、表形式からニューラルネットワークによるDQNまで追う。経験再生、ターゲットネットワーク、過大評価、安全なロボット適用を図と式で解説する。