今天,2026世界人工智能(885728)大会暨人工智能(885728)全球治理高级别会议(WAIC2026)在上海世博、张江、西岸“三地四馆”正式启幕。本次大会以“智能伙伴共创未来”为主题,有1100余家企业参展,3000余项展品集中亮相,其中300余款产品将全球首发。
其中,最火热的黑科技无疑是超节点。
传统AI服务器通常装8张加速卡。模型越来越大,一台机器装不下,最直接的办法就是继续增加服务器,8卡变成64卡,64卡扩到千卡,再由千卡走向万卡集群。
卡多了,通信也多了。
大模型训练时,每张卡只负责一部分参数和计算任务,一张卡算完以后,要把结果传给下一张卡,不同卡上的数据还要反复同步、汇总、再分发。
芯片计算可能只需要几十微秒,数据等待、通信和同步,却可能逐渐占据越来越多时间。尤其到了MoE大模型时代,系统每处理一批数据,都要在不同“专家”之间频繁转发,模型参数越大,参与计算的芯片越多,一张卡稍微慢一点,其他卡就可能停下来等它。
这就像64个人分散在8栋办公楼里完成一项工作,每个人都很聪明,真正拖慢效率的,往往是找人、传文件、开会和等待回复。
超节点做的事情,是把这些人搬进同一座大厅。
通过Scale-up高速互联,把几十张甚至数百张AI芯片接入同一个低时延通信域,再通过统一协议、内存编址和软件调度,让不同芯片可以更直接地访问数据。
物理上仍然是很多芯片。
逻辑上,它们开始接近一台大型计算机。
在华为展台,昇腾950超节点(Atlas950SuperPoD)真机被围得水泄不通,它是业界最大规模超节点,具备超大带宽,超低时延,实现业界最大256TB内存统一编址,以单柜64卡为基本单元,支持1000多张NPU卡高速互联,像一台计算机一样工作。工作人员介绍:“它带宽超大,时延超低,它不是一堆卡,它是一台‘会思考的整机’。”
据介绍,昇腾超节点引领架构创新,基于灵衢互联协议实现跨物理节点的统一内存编址,超大带宽、超低时延满足万亿及十万亿大模型高效训练和推理。
有人问:“这面墙到底值多少钱?”我查了一下,华为Atlas950SuperPod(万卡级旗舰)价格估算约5.6亿元/套(满配8192卡),这妥妥一堵最贵的墙。有观众盯着参数牌喃喃自语:“这哪是芯片,这是魔术。”
业界最大规模超节点:华为展台的昇腾950超节点(Atlas950SuperPoD)
在华为对面,东方算芯的展台上写着“14约等于4”,他们带来全球首款软件定义近存计算3D AI芯片“巅峯DF1000”,还首次公开展出基于该芯片的超节点“拓域TY64”、AI服务器“擎元QY100”及AI计算集群“慧算HS512”。
东方算芯带来全球首款软件定义近存计算3D AI芯片“巅峯DF1000”等展品
据现场工作人员介绍,DF1000的最大突破可概括为“14约等于4”,尽管采用14纳米制程工艺,其算力利用率和能效比已比肩4纳米制程的高性能芯片。
在中科曙光(603019)展台,一部scaleX十万卡超智融合集群系统同样被一波波观众审视着,这是国内规模最大、技术领先的AI4S(科学智能)计算集群,已经落地于郑州国家超算互联网核心节点。
在昆仑芯的展台,展示了32卡/64卡超节点产品和256卡超节点产品。其中,昆仑芯256卡超节点产品最高支持256卡极速互联,性能较上一代提升25%,推理效率提升50%。据介绍,该产品已完成对文心、DeepSeek、智谱(HK2513)、MiniMax等主流模型的适配,推理效率显著提升。它能按需像搭乐高一样,从几百卡一路扩到几十万卡、乃至百万卡级的超大规模集群,在最大化计算效率的同时,可使数据中心整体建设周期(883436)缩短约30%。
昆仑芯展台展示了32卡/64卡超节点产品和256卡超节点产品
阿里也亮出Agentic时代“超级算力地基”,磐久AL128超节点服务器,搭载平头哥首次亮相的自研训推一体AI芯片真武M890,搭配自研互联芯片ICN Switch1.0,单机柜128张AI芯片紧密耦合,组成一台“计算机”。
阿里巴巴磐久AL128超节点服务器在展会亮相
新华三的展台上,展示了S80000系列超节点,它将计算、互联、供电和液冷进行整柜集成,构建了从Scale-Up到Scale-Out的统一全互联架构,旨在解决卡间通信拥塞难题。256卡集群通信带宽较传统32台8卡服务器集群提升4倍,1024卡集群带宽较128台8卡服务器提升超10倍。
新华三展台展示了S80000系列超节点
超节点技术的密集亮相,标志着中国AI算力基础设施正从简单堆叠服务器向“整机级”系统设计加速演进。超节点集群的落地,将为我国人工智能(885728)大模型的持续迭代和行业应用提供坚实的算力底座。
