近日,产业预判:2026年全球AI服务器出货量同比增幅升至近31%,算力建设规模持续冲高的背后,全行业共性痛点愈发凸显:硬件堆叠门槛持续降低,但让十万级规模的算力稳定、高效地产出价值,正成为算力竞赛下半场的核心命题。
7月,曙光8000十万卡AI超集群上线,支撑这套超大规模体系高效运转的核心底座,正是Gridview 7.0超智融合算力管理平台。从资源调度到业务支撑再到集群运维,这套平台给出了大规模算力高效落地的完整解法。
▍全链路可观测:构建完整算力运营底座
对于十万卡级超大规模集群,故障定位难、运维粒度粗是普遍痛点。传统监控体系覆盖维度有限,硬件故障、链路异常往往需要人工逐层排查,难以支撑7×24小时稳定运营。
Gridview 7.0构建了存/算/传/管/用全链路可观测体系,覆盖芯片级到集群级六级监控维度,监控指标超2亿项,既可宏观掌握集群整体利用率,也能微观定位单张加速卡的通信链路异常,实现万卡集群精细化运维。
除此之外,平台配套三员分离安全合规体系、全栈国产化适配、开箱即用部署能力,以及Token计量运营模式,早已突破传统调度器范畴,成为一套完整的算力运营基础设施,可适配超算中心、行业算力平台等多场景商业化运营需求。
算力产业的竞争重心,正从“能不能建起来”转向“能不能用得好”。如果说算力建设的上半场比拼的是规模扩张速度,下半场的核心则是利用效率与精细化运营。Gridview 7.0以统一平台实现双引擎调度、全链路智能支撑,为超算与智算协同发展提供了可行路径,也印证了行业共识:算力的核心价值,从来不在硬件规模本身,而在于算力最终产出的实际成果。
▍双智能体协同:从“管资源”向“提效率”延伸
传统算力管理平台多止步于资源调度与状态监控,用户需自行完成软件环境部署、参数调优、故障排查,大量研发时间消耗在算力适配环节,而非核心业务创新。
Gridview 7.0内置科研智能体与运维智能体双体系,将平台能力从资源管理延伸至业务全流程支撑。科研智能体预置主流计算软件环境与自动化流程,用户无需从零搭建环境,聚焦业务需求即可获取计算成果;运维智能体则实现万级节点自动化运维,故障预警、报错分析、资源优化推荐均可智能响应,大幅降低大规模集群的运维门槛。
落地数据显示,在材料研发、基因测序(885578)等典型科研场景中,依托平台智能化支撑,用户从需求提出到成果交付的端到端研发效率提升可达300%。
▍双引擎原生融合:打通科学计算与智能计算的资源墙
长期以来,科学计算与智能计算分属两套独立体系:Slurm承载科学计算作业,Kubernetes支撑AI训练任务,资源割裂、无法动态调配,峰谷期利用率差异悬殊,造成大量算力闲置浪费。
Gridview7.0采用自研MetaStack + K8s双引擎原生融合架构,通过底层调度引擎打通两套体系,计算节点可在双引擎间灵活无感迁移,实现同一算力池错峰复用。例如日间承载高优先级AI训练,夜间切换运行科学仿真计算,从根源打破两类算力的资源壁垒。
实测数据显示,平台单集群可支撑10000 +计算节点稳定运行,双擎并行模式下作业吞吐率达813万作业/小时,性能较原生开源Slurm提升近8倍;全年可用性达99.99%,可支撑单作业10万+核规模稳定运行。针对万卡集群中高频查询易阻塞调度核心节点的行业通病,平台采用数控分离架构,查询与调度链路分流互不干扰,筑牢了大规模集群的生产稳定性底线。
