行业观察

DeepSeek开源昇腾全套训练组件:国产算力补上软件生态关键一环

Published 2026-10-06 Author Source 腾讯网(量子位Q资讯) · https://new.qq.com/rain/a/20260930A04SCS00 · 2026-09-30 Tags AI-Native Organization / Self as Product / Launch
DeepSeek宣布开源TileLang及五类昇腾平台基础组件,与英伟达版一一对应,国产大模型与国产芯片的协同从推理走向训练。

9月30日,DeepSeek通过官方渠道宣布,正式开源面向华为昇腾算力平台的全套基础设施组件,包括TileLang高级语言编译工具,以及DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect五类计算与通信库的昇腾版本。据官方说明,这批组件与其此前面向英伟达平台开源的组件一一对应,覆盖矩阵运算、跨设备通信、访存、稀疏注意力和数据筛选等大模型训练的关键环节。

技术细节上,TileLang昇腾版对昇腾原生Ascend C底层指令做了封装,开发者可以用Python风格的高级语法写算子而不损失性能。DeepSeek披露,其训练V4系列模型所用的大部分算子由TileLang实现,而这些算子在昇腾上均已具备对应的高性能版本。测试数据显示,DeepGEMM-Ascend的BF16矩阵乘法最高达到硬件上限的99.8%;DeepEP-Ascend在昇腾950DT上的分发与聚合带宽分别达到373至375GB/s和345至347GB/s;FlashMLA稀疏注意力的预填充与解码算子性能最高分别为410和360 TFLOPS。华为团队参与其中,双方共同推进了基于昇腾950的128卡超节点方案。

【AICOR点评】这件事的意义不在单点性能,而在生态位。CUDA的护城河是二十年沉淀的开发者习惯与代码存量,单靠芯片参数无法撼动。DeepSeek把自家训练验证过的软件栈整体搬到昇腾并开源,等于把迁移门槛从模型厂商一侧转给了芯片厂商一侧——任何国产芯片只要接住这套标准,就有机会直接承接前沿模型的训练负载。对企业而言,算力国产化的决策依据正在从政策驱动转向生态成熟度驱动,这一信号值得所有在做AI基础设施选型的组织认真跟踪。

Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.

For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.

← Back to News