ロボティクスとAIの技術がどこから来て、現在どの方式が競合・融合し、次に何が課題になるかを整理します。
以下は編集したおすすめの順番です。初めての方は1から、目的が決まっている方は必要な記事へ進んでください。
フィルタベースからグラフ最適化、そして学習ベース・AIネイティブへ。SLAM(自己位置推定と地図構築の同時実行)がたどってきた進化の系譜と、現在の研究動向を整理する。
LOAM系列から直接法によるFAST-LIO、そして2026年発表のD-LIOまで。LiDARとIMUを使った自己位置推定・地図構築の進化を、newbotでの実装と対比しながら整理する。
特徴点ベースの古典的手法から深層学習ベースのエンドツーエンド推定、そして3D Gaussian Splatting/NeRFによる地図表現の刷新まで。カメラだけで自己位置と地図を求めるVisual-SLAMの現在地を整理する。
NMSフリー化が進むYOLOファミリーと、COCOで60mAPを突破したRF-DETRをはじめとするtransformer系検出器。テキストプロンプトだけで検出できるオープン語彙検出まで、2026年時点の物体検出の勢力図を整理する。
transformerベースのSegFormer/Mask2Formerから、プロンプトで任意の物体を切り出せるSegment Anything系列まで。固定クラスから脱却しつつあるセグメンテーション技術の現在地を整理する。
Ollamaの月間ダウンロード数は3年で520倍に増加した。オープンウェイトモデルの急速な性能向上と量子化技術の成熟が、大規模言語モデルを家庭のPCで動かせるものに変えつつある現状を整理する。
環境の力学を学習し、頭の中で未来をシミュレートする「World Model」。Ha & SchmidhuberのVAE+RNNからDreamerV3、Genie 3、Sora、そしてLeCunが提唱するJEPAまで、生成か非生成かで割れる潮流と、物理的整合性という共通の壁を整理する。
カメラ映像と自然言語指示を1つのモデルに統合し、ロボットの動作を直接出力するVision-Language-Action。RT-2からOpenVLA、Physical Intelligenceのπ0系列まで、知覚と制御を分離しない設計思想の広がりを整理する。
Tesla OptimusとFigure 03が工場に入り、Boston Dynamics Atlasは油圧から全電動へ切り替わった。Unitreeが価格破壊を主導する一方、1XのNEOは家庭向けに動画世界モデルで自己学習を始めている。競合とオープンな課題を整理する。