8月20日,北京亦创国际会展中心,2026世界机器人大会(WRC)第二天。光轮智能——这家2023年成立、仅31个人、估值却已突破150亿元的公司,在这里宣布开源10万小时全模态人类行为数据集。
同日,宇树科技(688836)创始人王兴兴在WRC论坛上表示:“纯语言大模型的输入输出完全在数字向量空间内运行,几乎不存在损失与偏差;而机器人的每一次物理输入输出都会产生偏差与信息损失——这是物理智能和数字智能的本质区别。”
普通人类视频数据,充其量是“看别人做事”——只有画面。机器人看了一百遍人拿杯子,知道杯子长什么样、手怎么伸过去,但不知道抓握时手指用多大力、手腕旋转多少度、碰到杯壁时阻力怎么变化。
光轮智能这次开源的10万小时数据集,在第一视角视频之外,还塞进了腕部近场视角、三维手部姿态、三维全身姿态、深度信息、帧级动作语义标注(V7级)、视觉惯性里程计等一系列“课本”。用联合创始人兼总裁杨海波的话说,普通视频只能告诉机器人“发生了什么”,全模态数据能告诉它“下一步应该怎么行动”。
10万小时是什么概念?截至今年初,全球高质量真实物理交互数据总量大约50万小时。光轮智能这一开源,等于把全球存量的1/5直接摆上了台面。
但这不是终点。行业共识是,训练通用具身模型至少需要千万小时级数据。10万小时,是一声发令枪,不是终点线。
一家估值150亿元的数据公司,把最核心的资产免费放出来,图什么?
杨海波在世界人工智能(885728)大会期间说过一句很直白的话:“目前数据领域缺乏统一标准,所以什么标准最有价值,可能就是事实标准。当大家都去买同一份数据,认同它,它就逐渐成为事实标准。”
热闹归热闹,有几件事需要想清楚。
10万小时不等于千万小时。VLABench最新评测显示,当前所有主流VLA模型在标准测试集上的进展得分均低于15%——核心原因不是架构问题,而是训练数据覆盖范围太窄。
开源数据和商业级数据之间有“质量鸿沟”。学术界用的开源数据集和企业训练量产模型用的商业级数据,在标注精度、场景覆盖、失败案例多样性上差距明显。
仿真不是万能药。物理建模有极限,视觉与力觉的一致性、长期任务中的误差累积、柔性物体的精确模拟,都是“硬骨头”。光轮智能自己也承认,更底层的仿真器和求解器仍是国内亟待攻关的领域。
“数据驱动”不是唯一路线。具身智能的技术路线远没有收敛:端到端VLA、世界模型、传统规划+学习混合路线各有支持者。把所有赌注压在“数据规模决定一切”上,可能为时尚早。
2027年能否算平经济账,仍有不确定性。杨海波判断今年是“跑通”阶段,明年或有望在部分场景算平经济账。但机器人硬件成本下降速度、场景泛化能力、部署运维成本,这些变量都还在快速变化中。
2009年,李飞飞团队发布Im-ageNet,1400万张标注图片,直接引爆了深度学习革命。那个时刻之所以被称为“ImageNet时刻”——不是因为数据集本身有多了不起,而是因为它第一次让全世界的研究者在同一个基准上竞争,数据、算法、评估标准全部公开透明。
具身智能还没有等到自己的ImageNet时刻。
光轮智能的10万小时全模态开源数据集,可能是朝那个方向迈出的一步。但它能不能成为机器人领域的ImageNet,不取决于任何一家公司,而取决于有多少人用它、多少模型基于它训练、多少论文引用它、多少企业在它之上建立商业生态。
杨海波说,2026年是具身智能数据规模化的元年。王兴兴说,未来10年在AI大爆发下,整个产业的进化速度将大幅提升,“可能比我们预想的更快”。
机器人的聪明程度,最终不取决于它在展台上能翻几个跟头,而取决于它“读过多少书”。而这本书,正在被一页一页地写出来。
