ニューラルネットワークの基礎から、強化学習、物体検出・認識、生成モデルまでを、実装と数式の両面から解説します。
以下は編集したおすすめの順番です。初めての方は1から、目的が決まっている方は必要な記事へ進んでください。
機械学習はモデル選びより、問題定義、データ分割、損失、評価、運用時の変化を設計する作業である。
ニューラルネットワークは線形変換と非線形活性化を重ね、勾配降下で損失を小さくする関数近似器である。
バウンディングボックスで物体を囲むObject Detectionと、ピクセル単位で意味を割り当てるSemantic Segmentation。両者の違いから、Instance/Panoptic Segmentationとの関係、R-CNNからDETR/DINOに至る代表アルゴリズムの系譜、点群を対象にした3D版まで、画像認識の基礎を体系的に整理する。
Ultralyticsが2024年9月に公開したYOLO11を、公式ドキュメントと論文レベルの一次情報に基づいて分解する。C3k2ブロック、C2PSA注意機構、アンカーフリー検出ヘッド、DFL/CIoU損失、n/s/m/l/xの実測ベンチマークまで、YOLOv8からの変更点を一つずつ検証する。
NVIDIA/香港大学らがNeurIPS 2021で発表したSegFormerを、原論文の記述に基づいて分解する。位置エンコーディングを持たない階層型MiTエンコーダ、パラメータ効率に優れたAll-MLPデコーダ、有効受容野の議論、B0からB5までの実測mIoU/パラメータ数まで、設計思想を数式付きで検証する。
姿勢推定は画像から人体・物体のキーポイントや6D姿勢を推定する。座標系、損失、遮蔽、評価、安全を整理する。
生成モデルはデータ分布を表現し、画像・文・音声・行動を生成する。尤度、VAE、GAN、拡散モデル、評価と安全を整理する。