十万小时数据开源机器人离“看懂”世界还有多远?

2026-08-21 03:22:24
分享
文章提及标的
C宇树-W--
人工智能--
查看股票机会下载客户端

8月20日,北京亦创国际会展中心,2026世界机器人大会(WRC)第二天。光轮智能——这家2023年成立、仅31个人、估值却已突破150亿元的公司,在这里宣布开源10万小时全模态人类行为数据集。

同日,宇树科技(688836)创始人王兴兴在WRC论坛上表示:“纯语言大模型的输入输出完全在数字向量空间内运行,几乎不存在损失与偏差;而机器人的每一次物理输入输出都会产生偏差与信息损失——这是物理智能和数字智能的本质区别。”

普通人类视频数据,充其量是“看别人做事”——只有画面。机器人看了一百遍人拿杯子,知道杯子长什么样、手怎么伸过去,但不知道抓握时手指用多大力、手腕旋转多少度、碰到杯壁时阻力怎么变化。

光轮智能这次开源的10万小时数据集,在第一视角视频之外,还塞进了腕部近场视角、三维手部姿态、三维全身姿态、深度信息、帧级动作语义标注(V7级)、视觉惯性里程计等一系列“课本”。用联合创始人兼总裁杨海波的话说,普通视频只能告诉机器人“发生了什么”,全模态数据能告诉它“下一步应该怎么行动”。

10万小时是什么概念?截至今年初,全球高质量真实物理交互数据总量大约50万小时。光轮智能这一开源,等于把全球存量的1/5直接摆上了台面。

但这不是终点。行业共识是,训练通用具身模型至少需要千万小时级数据。10万小时,是一声发令枪,不是终点线。

一家估值150亿元的数据公司,把最核心的资产免费放出来,图什么?

杨海波在世界人工智能(885728)大会期间说过一句很直白的话:“目前数据领域缺乏统一标准,所以什么标准最有价值,可能就是事实标准。当大家都去买同一份数据,认同它,它就逐渐成为事实标准。”

热闹归热闹,有几件事需要想清楚。

10万小时不等于千万小时。VLABench最新评测显示,当前所有主流VLA模型在标准测试集上的进展得分均低于15%——核心原因不是架构问题,而是训练数据覆盖范围太窄。

开源数据和商业级数据之间有“质量鸿沟”。学术界用的开源数据集和企业训练量产模型用的商业级数据,在标注精度、场景覆盖、失败案例多样性上差距明显。

仿真不是万能药。物理建模有极限,视觉与力觉的一致性、长期任务中的误差累积、柔性物体的精确模拟,都是“硬骨头”。光轮智能自己也承认,更底层的仿真器和求解器仍是国内亟待攻关的领域。

“数据驱动”不是唯一路线。具身智能的技术路线远没有收敛:端到端VLA、世界模型、传统规划+学习混合路线各有支持者。把所有赌注压在“数据规模决定一切”上,可能为时尚早。

2027年能否算平经济账,仍有不确定性。杨海波判断今年是“跑通”阶段,明年或有望在部分场景算平经济账。但机器人硬件成本下降速度、场景泛化能力、部署运维成本,这些变量都还在快速变化中。

2009年,李飞飞团队发布Im-ageNet,1400万张标注图片,直接引爆了深度学习革命。那个时刻之所以被称为“ImageNet时刻”——不是因为数据集本身有多了不起,而是因为它第一次让全世界的研究者在同一个基准上竞争,数据、算法、评估标准全部公开透明。

具身智能还没有等到自己的ImageNet时刻。

光轮智能的10万小时全模态开源数据集,可能是朝那个方向迈出的一步。但它能不能成为机器人领域的ImageNet,不取决于任何一家公司,而取决于有多少人用它、多少模型基于它训练、多少论文引用它、多少企业在它之上建立商业生态。

杨海波说,2026年是具身智能数据规模化的元年。王兴兴说,未来10年在AI大爆发下,整个产业的进化速度将大幅提升,“可能比我们预想的更快”。

机器人的聪明程度,最终不取决于它在展台上能翻几个跟头,而取决于它“读过多少书”。而这本书,正在被一页一页地写出来。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME