Contents — find the section you need
随着2026年的到来,人形机器人正从“演示阶段”迈向“在工厂、仓库和部分家庭中实际运行”。本文概述了当前的市场格局,特斯拉、Figure AI、波士顿动力、Unitree、Agility Robotics、1X Technologies 和 Sanctuary AI 等公司各自采取不同的策略——垂直整合,打造类似汽车制造商的产品;采用 VLA 基础模式;摆脱液压系统;积极降价;瞄准家庭市场;以及成为通用型企业员工。
图片:Honda / Toyota logos, Wikimedia Commons.
这两家公司都因其在人形机器人研究领域的参与而在此被提及——本田公司是因为其ASIMO系列机器人,丰田公司是因为丰田研究院与波士顿动力公司的合作。
人形机器人控制示意图
图表:由Duskcoil创建。一个典型的层级结构,将任务级决策(由VLA执行)、关节级执行(由全身控制执行)以及来自物理世界的观测反馈分开。远程操作和仿真作为训练路径而非运行时输入显示。不同的实现方式对这些层的集成方式有所不同。
理解人形机器人的关键在于分别考察硬件(执行器和机构)和软件(全身控制和任务执行)。硬件问题——仅靠双足行走就存在跌倒、接触和功率密度方面的限制——以及执行通用任务指令的智能问题,是两个独立的技术挑战,进展速度也各不相同。如今的竞争格局很大程度上取决于各公司押注的是哪一个方面。
在一个典型的层级结构中,视觉语言助理(VLA)将视觉和语言转化为任务或技能目标,而全身控制器则将该目标转换为满足姿态和接触限制的关节指令。
传承:从ASIMO退役到今天
本田于2018年停止了ASIMO的研发,该项目于2022年正式终止。当时,本田表示将把为ASIMO开发的技术转向更实际的应用领域,例如护理和灾害响应支持。此后,本田没有宣布任何作为ASIMO直接继任者的完整人形机器人。 2026年,本田展示了一款据称传承了ASIMO精神的新型机器人,但其定位更侧重于研究和技术演示,而非商业通用机器人。这种转变——从ASIMO以“高精度双足行走”为目标,到如今领先企业将目光投向“在工厂和仓库中实际运行的经济效益”——反映了整个行业的重心转移。
执行器之争:电动 vs. 液压
影响人形机器人物理性能的最重要设计决策之一在于其关节的驱动方式。液压执行器具有高功率密度(单位重量输出),能够轻松实现爆发式、强劲的运动,但同时也存在漏油、噪音、维护成本高以及在工业环境中操作不便等问题。电动执行器(电机加减速齿轮)运行安静、易于维护,并且与人工智能控制回路配合良好,但要达到液压系统级别的爆发力,则需要高扭矩密度电机和足够坚固的减速机构来承受。
波士顿动力公司的 Atlas 正是这种转变的体现。Atlas 多年来一直采用液压驱动,在波士顿动力公司宣布将于 2024 年停产液压 Atlas 后,立即推出了全电动新型号。据称,此次转变的动机并非仅仅是为了提升性能,而是为了实现“可扩展的实用性”——大规模生产、易于维护以及在工业车间部署。液压系统动力强劲,但体积庞大、噪音大,并且在标准工厂环境中难以维护。电动化带来了更安静、更灵活的运动、更好的维护性以及与人工智能控制回路的更高兼容性,而目前面临的挑战是,电机和齿轮的设计在多大程度上能够赶上液压系统曾经擅长的瞬时高输出性能。波士顿动力公司在2026年国际消费电子展(CES)上发布了电动版Atlas的量产版本,电动化已经从“研发阶段的选择”转变为“量产阶段的前提”。
主要厂商的现状
特斯拉Optimus以垂直整合为武器,重新利用汽车量产生产线。第三代(V3)Optimus拥有37个关节,一只拥有22个自由度和50个驱动器的机械手,身高173厘米,重57公斤,并计划于2026年下半年在弗里蒙特工厂开始量产。早期生产的样机将首先用于训练数据收集,马斯克对早期量产的预期较为谨慎,称其“速度会相当慢”。目标售价为2万至3万美元。
Figure AI则以宝马斯帕坦堡工厂的实际应用为武器。上一代 Figure 02 参与组装了约 3 万辆宝马汽车,其继任者 Figure 03 则采用名为“Helix 02”的人工智能系统来协调手、臂、躯干和腿部,处理排序工作——识别、分类和重新排列位置和方向各异的零件。值得注意的是,它能够同时完成运动和操作相结合的任务,例如在推动重型推车的同时操作零件。
波士顿动力 Atlas 的强大之处在于其集成了大型行为模型 (LBM),该模型由波士顿动力与丰田研究院 (TRI) 合作开发。2025 年 8 月,一台配备 LBM 的 Atlas 展示了一系列长时间连续的任务序列,这些任务结合了物体操作和运动,重点展示了如何快速添加以前需要手动编程的新动作,而无需编写代码。与现代汽车合作,计划于 2026 年开设一个机器人元工厂应用中心 (RMAC),利用在现代工厂收集的数据训练 Atlas 机器人。
优树 以价格优势为制胜法宝。G1(身高 1.32 米,重约 35 公斤,23 个自由度,EDU 版本可达 43 个自由度)的直销价为 13,500 美元起,仅在 2025 年就出货超过 5,500 台,据报道占据了约 32% 的全球市场份额。其高端机型 H2(身高 1.80 米,重 70 公斤,31 个自由度)在中国国内的起售价为 29,900 美元,北美地区的 Toborlife 公司已于 2026 年 2 月开始接受预订。正是由于研究机构能够负担得起这样的价格区间,优树正在成为人形机器人研究的实际实验平台。
Agility Robotics 的 Digit 机器人以实际运行时间为优势,在物流运营中发挥着重要作用。在 GXO 位于佐治亚州的物流中心,机器人即服务 (Robots-as-a-Service) 已从试点阶段过渡到全面部署,单站处理周转箱数量突破 10 万个。在舍弗勒位于切罗的工厂,Digit 自 2025 年初以来一直用于洗衣机的装卸作业。据报道,Digit 在 GXO、舍弗勒、丰田汽车加拿大制造公司和 Mercado Libre 等公司的累计运行时间已超过 6.5 万小时。Agility 本身计划于 2026 年通过 SPAC 合并上市。
1X Technologies 则以本土市场为优势。NEO 机器人高约 168 厘米,售价 2 万美元,计划于 2026 年面向美国普通家庭发售。自 OpenAI 领投的 A2 轮融资以来,双方在资金和产品模型方面持续开展合作。该公司在加州海沃德开设的工厂年产能为1万台,目标是在2027年底前将年产能提升至10万台以上。
Sanctuary AI 以名为“Carbon”的人工智能控制系统为核心,开发出一款名为Phoenix的通用工作机器人。据称,第八代Phoenix能够处理来自十几个行业的客户指定的数百项任务,并且能够在大约24小时内学会一项新任务。尽管如此,目前关于其商业出货量和定价的第三方验证信息仍然有限,值得注意的是,与竞争对手相比,Sanctuary AI 的实机验证信息也相对较少。
向基于学习的全身控制的转变
双足行走控制过去主要依赖于基于零力矩点 (ZMP,一种由重心和地面反作用力推导而来的经典指标,用于判断不跌倒的条件) 或运动发散分量 (DCM) 的行走模式生成,并结合二次规划 (QP) 实现的全身控制 (WBC)。这些方法基于模型,易于解释,但适应未知地形或干扰需要额外的调整。
当前趋势是将模拟中的强化学习与域随机化(一种在模拟运行中随机化质量、摩擦力、延迟和其他参数的技术,以构建能够应对与真实机器之间差异的鲁棒策略——详见基于模型的强化学习和模拟到真实迁移简介)相结合,旨在以比基于模型的控制更少的人工操作,获得包括跑酷和舞蹈等动态动作在内的多样化技能。纵观研究现状,目前存在四种并存的趋势:基于模型的步态生成、基于QP的全身控制、通过深度强化学习实现模拟到真实迁移,以及结合这些趋势的混合方法——该领域尚未完全形成统一的方法。能够自行从跌倒中恢复(起身)并能迅速适应不熟悉的地面——这些“不起眼却至关重要”的问题在实际操作中层出不穷——正逐渐成为衡量基于学习的方法是否真正实用的标尺。
与 VLA 和基础模型的联系
视觉-语言-动作 (VLA) 模型技术正逐渐应用于任务级指令理解和动作生成(详情请参见VLA 技术趋势)。Figure AI 的 Helix、Boston Dynamics/TRI 的大型行为模型以及 1X 的 NEO World 模型都秉持着将“观察、理解和行动”整合到单一模型中的设计理念。 1X 特别采用了一种设计,该设计会提示一个拥有 140 亿参数的视频生成模型“想象一段正在执行的任务的短视频”,然后通过逆动力学模型(一种将生成的视频转换为具体运动指令的模型)将该想象的视频转换为实际的关节指令——这种设计将视频世界模型直接与机器人控制连接起来,并与接下来要介绍的“世界模型”趋势直接相关(详情请参见世界模型技术趋势)。
未解决的挑战
数据收集瓶颈:虽然语言模型可以利用互联网规模的文本进行训练,但互联网上几乎不存在机器人动作数据(成对的观测和动作)。利用VR头显、动作捕捉服和可穿戴外骨骼进行远程操作的数据采集占据主导地位,但报告显示,即使使用专用硬件设备(价格在5万至15万美元之间),单个操作员每天也只能采集不到200个演示数据——这表明数据采集本身已成为物理人工智能供应链中的一个瓶颈。
成本:截至2026年,价格范围很广:从面向研究的Unitree G1(1.35万美元起),到作为通用型机器人销售的Tesla Optimus和1X NEO(2万至3万美元),再到企业级EDU设备(4万至7万美元)。但能够抵消人工成本的应用场景仍然有限,早期部署主要集中在“劳动力严重短缺的简单重复性任务”上。
安全性:与工业机器人手臂相比,在与人共享空间中移动的、具有与人类大致相当的质量和输出的自主机器的跨行业安全标准远不成熟。跌倒时的行为、通信中断时的故障保护以及力控制的上限,目前仍由各公司独立设计。
全身控制的鲁棒性:在仿真环境中训练的策略在实际硬件上的表现,往往会在训练过程中未充分涵盖的条件下下降,例如地面摩擦系数、负载的重心位置等等。像跑酷这样炫酷的演示,与日常在仓库地面或湿滑表面上的鲁棒性,并不一定代表同样的性能水平。
这些挑战正沿着三个不同的方向并行解决——硬件(电气化、降低成本)、数据(从远程操作、仿真和视频中学习)以及软件(将全身控制与VLA基础模型集成)——而到2026年,这就是现实:没有任何一项技术突破能够一次性解决所有问题。
成功的步行演示是否证明工厂已准备就绪?
任务成功率、耐力、恢复能力、人机交互和维护需要分别评估。
简短的演示并不能证明其能够持续运行。参考资料
-
关于在家庭服务器上运行本地 AI,另请参阅本地 LLM 的技术趋势"
评论
请先登录。
暂无数据。