刚刚闭幕的2026世界人工智能(885728)大会(WAIC)上,具身智能展区参展企业从去年的80余家增至200余家。展台风向也随之变化:前几年各家比谁的机器人走得稳、跳得高,后来比谁的VLA模型参数大。
而今年,争论的焦点变成了一个更根本的问题:机器人的“大脑”,到底应该长什么样?
先交代背景,VLA即视觉-语言-动作模型(Vision-Language-Action),让机器人把看到的画面和听到的指令直接翻译成动作。2023年以来,它被普遍视为具身智能大脑的标准件,头部公司搭载的几乎都是VLA或其变体。
但这个默认答案在2026年被公开挑战,观察者网根据WAIC观察,将之大致分为三个方向。
路线一:把系统做成大脑
大会开幕前两天,深圳人形机器人(886069)公司逐际动力(LimX Dynamics)发布具身大脑系统LimX COSA0.5,同时放出一段约三分钟的视频:全尺寸人形机器人(886069)Oli无远程操控、无剪辑,一镜到底完成取衣、收纳、搬箱、拾物等一整屋家务。
公开报道显示,此前全球仅有Figure AI的全尺寸人形机器人(886069)做出过同一量级演示。
逐际动力创始人张巍的逻辑是,“模型只是技能,系统才是真大脑”,COSA把认知、技能和运控拆成三层,VLA只占其中一层。
这一判断并非孤例,分层架构已是目前行业内规模最大的阵营。
Figure AI的自研模型Helix采用双系统架构,慢速系统负责场景理解,以200Hz高频运行的快速系统负责动作执行;英伟达(NVDA)去年3月发布的人形机器人(886069)基础模型GR00T N1,直接模仿人类快思考与慢思考的认知分工;同月,北京人形机器人(886069)创新中心发布“慧思开物”平台,以具身大脑加具身小脑的架构实现一套软件驱动多种构型的机器人;智源研究院的RoboOS、智元的GO-1、智平方的GOVLA也是分层思路的变体。
VLA没有退出,只是从“大脑”被降级为“器官”。
路线二:一个模型通吃
反对分层的对立阵营同样兵强马壮。
今年3月发布AWE3.0的它石智航,口号是“不VLA、不仿真、不遥操”,其自研的AWE(AI World Engine,AI世界引擎)用一个统一模型完成感知、决策与动作生成。
对此,它石智航联合创始人兼首席科学家丁文超解释称,VLA处理的只是像素、颜色、轮廓这类视网膜级信息,而对时间、空间、力和环境交互的物理直觉,VLA给不了;他还直言,分层的大小脑是两个不相干的东西凑在一起。
自变量机器人创始人王潜反对分层的理由更偏工程,他在接受媒体采访时表示,分层链路里一个微小错误会被级联放大,层数越多放大越快,因此自变量从成立起就坚持大小脑统一的端到端大模型WALL-A。
海外的Skild AI走的也是用一个通用模型控制所有机器人的路径。
路线三:让场景决定大脑
第三条路线不从架构出发,而从场景倒推。
做无人环卫装备的酷哇科技6月初发布交互式世界动作模型CooWAIM2.0,让模型在行动前与世界在隐空间里对弈几轮,但刻意只看未来2到3秒。
论文消融实验显示,不推演时规划评分为82.8,推演2秒升至87.3,拉长到4秒只再涨到87.9,边际收益明显收窄。
不预测远期,只看眼前几步,因为环卫车不需要预判十分钟后的街道。
据酷哇介绍,截至2025年,酷哇产品已落地全球50多个城市,累计合同金额约50亿元。
同类的还有仓储和特种场景。
极智嘉在本届WAIC全球首秀人形拣选机器人Gino1,无需提前建模即可抓取异形、软质、透明包裹,能力边界完全围绕仓库场景设定;有行业观察报道显示,云深处的全天候工业人形机器人(886069)DR02已完成变电站实地作业验证并启动商用。
这条路线上的公司不追求理解整个世界,只求大脑在自己的场景里足够好用。
分歧的本质是数据观
三条路线争的是架构,比拼的则是数据。
分层派走真机数据、合成数据与互联网视频的混合配方;统一派押注真人在真实场景中操作的HumanCentric数据,认为遥操作数据撑不起千万小时量级;场景派则依赖数千台在岗机器人每天回流的真实作业经验。
但需要泼冷水的是,三条路线目前都未经过大规模商业验证。
一镜到底的演示是精心布置的考场,单点任务的纪录是极限成绩,2秒推演的优势则被框死再特定场景中。
自动驾驶行业刚刚走过相似的路径,分段式与端到端争了数年,最终分出胜负的不是论文和发布会,而是百万辆车上路跑出来的接管里程。2026年提出了问题,答案写在产线上,而“大脑”的定义权,最终大概率属于把机器人卖出去最多、活的最久的那家公司。
