本报讯记者王健生报道近日,DeepSeek发布DeepSeek-V4-Pro1.6T旗舰模型(1.86万亿参数)及DeepSeek-V4-Flash284B高效模型(2840亿)。由智源研究院牵头研发的众智FlagOS第一时间对两个“巨无霸”模型进行全量适配,已经完成DeepSeek-V4-Flash在8款以上AI芯片上的全量适配与推理部署,包括海光、沐曦、华为昇腾(886058)、摩尔线程(688795)(FP8)、昆仑芯、平头哥真武、天数、英伟达(NVDA)(FP8)等芯片。FlagOS同时正在推进DeepSeek-V4-Pro模型在多个芯片的迁移适配,后续即将开源。
DeepSeek-V4-Flash是深度求索推出的V4系列两大模型之一,采用混合专家(MoE)架构,总参数量284B,激活参数仅13B,支持100万Token上下文长度。
围绕DeepSeek-V4-Flash多芯适配,此次FlagOS系统软件技术栈突破了三大关键技术:FlagGems全算子替代(实现多芯片统一适配)、为o-group采用独立张量并行策略解锁更多低显存场景,以及“FP4+FP8混合精度”的原生权重到FP8/BF16的精度路径转换。这三项关键技术,使DeepSeekV4能够在当前各种厂商的主流AI芯片上稳定运行,而非仅限于支持FP4和大显存的少数高端AI加速卡。
