今天,DeepSeek宣布,正式开源面向华为昇腾(886058)算力平台的基础设施组件,涵盖TileLang高级语言编译工具、计算库、分布式通信库。所有组件与此前面向英伟达(NVDA)平台的开源组件一一对应。这意味着,国产AI算力在软件生态上又补上关键一环。
DeepSeek的LOGO TileLang编程模型,能充分发挥芯片特性
DeepSeek在开源说明中表示,建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的、同时能达到硬件性能上限的高级语言。TileLang正是在这样的背景下诞生。相比英伟达(NVDA)CUDA语言,TileLang编程更简单,能显著提高开发效率、简化代码逻辑;相比其他同类高级语言,TileLang编程模型可以充分发挥芯片特性,达到硬件的性能上限。TileLang路线首先在英伟达(NVDA)成熟平台上得到验证,如今已承载DeepSeek V4系列模型训练中大部分算子的实现,是DeepSeek探索AGI新范式、开发高性能算子的核心工具。
TileLang昇腾版,写得更简单,性能不打折
本次开源的TileLang昇腾版本,对昇腾Ascend C底层指令进行封装,提供高级语言的编程方式,同时不损失硬件性能。这正是TileLang的设计初衷。
DeepSeek称,目前其训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。TileLang昇腾版本作为一个开源工作,也希望能对更多AI芯片建立高可用软件生态起到示范作用。
开源“全家桶”覆盖计算、通信、注意力、筛选
本次开源还包括昇腾平台核心计算与通信组件,为不同使用场景提供可复用的基础能力。DeepGEMM加速通用矩阵运算;DeepEP提供高效的大规模跨设备通信;TileKernels提供数据处理所需的常规向量计算和访存算子;FlashMLA提供稀疏注意力算子,提升长上下文处理效率;DeepSelect实现高效的数据筛选。在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。
华为团队深度支持,推进昇腾950超节点方案
DeepSeek透露,在面向昇腾平台的研发过程中,华为团队给予了毫无保留的大力支持。双方紧密合作,共同推进基于昇腾950的128卡超节点方案,并共同对计算与通信进行了深度优化。
DeepSeek表示,将持续推进技术创新,与社区共同建设开放的软件生态、共同进步。对于普通用户来说,这些“底层组件”听起来遥远,却决定了大模型训练和推理的效率。软件生态越完善,AI芯片越能被充分使用,大模型能力迭代和落地应用也就有了更扎实的底座。
