AI AI工具情报站
AI资讯ai-products

DeepSeek 开源面向华为昇腾平台的基础设施组件

公众号:DeepSeek(深度求索)2026-09-30T02:01:00.000Z

核心亮点

DeepSeek 开源面向华为昇腾计算平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台的开源组件一一对应。这是国产算力软件栈补位的关键一步,让同一套高效内核可在昇腾上跑。

具体能力或事件经过

这套组件覆盖矩阵乘、通信、内核、注意力等底层算子。DeepGEMM 对应通用矩阵乘,DeepEP 对应专家并行通信,FlashMLA 对应 MLA 注意力,DeepSelect 对应路由选择。它们把 DeepSeek 在英伟达上验证过的优化,平移到昇腾,降低迁移成本。

技术细节

TileLang 是面向 tile 级编程的编译工具,让开发者用更高层抽象写高效内核;DeepGEMM 做 FP8/低精度矩阵乘;DeepEP 是 MoE 的 all-to-all 通信;FlashMLA 是 MLA 的 FlashAttention 式实现;DeepSelect 管专家路由。逐项对应英伟达版,说明是系统性移植而非单点。

与竞品对比

此前高效推理内核多绑定英伟达 CUDA 生态。DeepSeek 把等价实现搬到昇腾,削弱 CUDA 锁定,给国产卡一个可直接用的软件底座。相比只做模型权重开源,补基础设施更实在,因为它决定模型能不能真正高效跑起来。

行业影响或适用场景

对昇腾生态,这是稀缺的高质内核补给,提升国产卡跑前沿 MoE 的效率与可用性。对受出口管制的用户,意味着少依赖英伟达即可部署强模型。对整个国产 AI 栈,是"模型+算力+软件"闭环补上的重要一环。

数据口径与可信度

信息来自 DeepSeek 公众号,属一手发布。组件性能、与英伟达版的对齐程度、在昇腾各型号上的实测数据未详述。引用时保留"据称"的限定,真实收益需在具体硬件上验证,尤其不同昇腾型号的兼容与峰值利用。

风险与边界

开源不等于开箱即用:昇腾各代指令与内存层级不同,调优仍要投入。组件成熟度、与框架(如 PyTorch)的集成度,决定落地难度。若仅权重可携而内核不全,迁移收益会打折。需关注后续维护与社区适配节奏。

市场定位

DeepSeek 以"模型强且基建全开源"立差异化,既帮国产算力,也巩固开发者生态。对昇腾,是官方级的软件补给;对竞品卡,提示"光有硬件不够,软件得跟上"。这是国产 AI 自主可控叙事里的关键拼图。

延伸观察

算力自主不只是买得到卡,更要有能跑满卡的软件。DeepSeek 此举把"模型+内核"一起开源,降低国产栈的冷启动成本。未来谁的软件生态更完整,谁就拿到部署强模型的入口,硬件性能差距会被软件补平一部分。

进一步分析

说白了,DeepSeek 把在英伟达上跑通的高效内核,逐一对搬到华为昇腾。这不是秀权重,而是补最缺的底层软件,让强模型能在国产卡上真正高效跑。对受管制用户是解脱,对国产栈是闭环关键。但开箱易用性仍看调优与集成。

实操建议

想在昇腾部署 DeepSeek 类模型的团队,优先试用这套组件而非自建内核,关注与训练/推理框架的集成文档。先在目标昇腾型号上跑对齐测试,记录吞吐与利用率。评估时把"内核可用性"计入总拥有成本,别只比硬件峰值算力,软件往往决定实际账单。

一句话结论

说白了,DeepSeek 把英伟达版高效内核逐一对搬到华为昇腾,补国产算力最缺的底层软件。它让强模型能在国产卡高效跑、削弱 CUDA 锁定;但开箱易用性仍看调优与框架集成,落地前先跑对齐测试。