不靠生成也能预测未来,千里智驾WA-JEPA探索世界—动作模型新路径利好

2026-09-18 15:56:23
来源:投资界
分享
AIME

问财摘要

1、近日,千里智驾联合多所大学发布并开源了世界—动作模型WA-JEPA,为自动驾驶模型理解场景、预测未来和生成驾驶动作探索了新路径。WA-JEPA没有把生成逼真的未来画面作为目标,而是在高维隐空间中预测与驾驶规划更相关的信息。 2、WA-JEPA进行了三项关键改造,包括未来掩码预训练、引入条件流匹配、将未来场景表征与自车动作放入同一预测器中联合生成。WA-JEPA整体包含约4.81亿个可训练参数,在世界模型研究中保持了相对紧凑的规模。 3、在评测协议下,WA-JEPA在NAVSIM-v2开环规划基准中取得91.7EPDMS,在HUGSIM的436个闭环场景中取得0.4462HD-Score,展现出一定的零样本迁移能力。 4、目前,千里智驾已同步开放论文、代码、模型权重及评测流程,希望为世界—动作模型在自动驾驶领域的复现、比较与后续研究提供公开基线。
免责声明 内容由AI生成

近日,千里智驾联合电子科技大学、东南大学、北京邮电大学、天津大学发布并开源世界—动作模型WA-JEPA,为自动驾驶模型如何理解场景、预测未来并生成驾驶动作,探索了一条新的技术路径。

当前,部分自动驾驶世界模型通过生成未来视频来学习环境变化。这类方法能够呈现直观的未来画面,但也需要投入大量计算资源还原纹理、光影等视觉细节。WA-JEPA没有把“生成逼真的未来画面”作为目标,而是基于V-JEPA的视频语义表征能力,在高维隐空间中预测道路结构、交通参与者关系及运动趋势等与驾驶规划更相关的信息。

针对原始V-JEPA并非为自动驾驶规划设计的问题,WA-JEPA进行了三项关键改造:首先,通过未来掩码预训练,让模型根据历史画面推演尚未发生的场景变化;其次,引入条件流匹配,学习未来表征从噪声到目标状态的变化过程,降低确定性回归容易产生“平均化预测”的问题;最后,将未来场景表征与自车动作放入同一预测器中联合生成,让模型在预测世界变化的同时规划车辆轨迹。

WA-JEPA整体包含约4.81亿个可训练参数,在世界模型研究中保持了相对紧凑的规模。其第一阶段训练只需连续驾驶视频,不依赖目标检测、语义分割等额外人工感知标注,有助于更充分地利用大规模驾驶数据。

在论文采用的统一评测协议下,WA-JEPA在NAVSIM-v2开环规划基准中取得91.7EPDMS,较对比实验中的最强端到端基线和最强世界—动作模型基线分别提升1.6和1.3。在HUGSIM的436个闭环场景中,模型未经针对性训练或微调,取得0.4462HD-Score,为同一复现协议下的最佳结果,展现出一定的零样本迁移能力。

目前,千里智驾已同步开放论文、代码、模型权重及评测流程,希望为世界—动作模型在自动驾驶领域的复现、比较与后续研究提供公开基线。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME