DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布
9517点击    2026-09-30 15:43

来自 DeepSeek 团队的底层 AI 芯片工具开源了。


9 月 30 日上午,DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,覆盖 TileLang 高级语言编译工具、高性能计算库和分布式通信库。根据 DeepSeek 的介绍,这些组件与其此前面向英伟达平台开源的组件一一对应。


DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布


此次发布包含 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,分别承担矩阵运算、跨设备通信、常规向量计算与访存、稀疏注意力和数据筛选等任务,共同支撑模型运行中的关键环节。


华为则将双方围绕昇腾 950 及超节点开展的联合创新成果在 CANN 社区开源,覆盖模型部署、大规模训练、超长文本 KV Cache 池化与 Agentic RL 等实践,并披露了 DeepSeek-V4.1-Flash 的部分离线推理性能数据。


开源项目链接:


  • TileLang: https://github.com/tile-ai/tilelang
  • DeepGEMM Ascend: https://github.com/deepseek-ai/DeepGEMM-Ascend
  • DeepEP Ascend: https://github.com/deepseek-ai/DeepEP-Ascend
  • TileKernels: https://github.com/deepseek-ai/TileKernels
  • FlashMLA: https://github.com/deepseek-ai/FlashMLA
  • DeepSelect: https://github.com/deepseek-ai/DeepSelect


这次开源让我们得以了解 DeepSeek 在国产 AI 算力上开发工具、核心算子和通信组件等方面的进展。而对于开发者来说,现在也可以在更接近模型实际需求的工具基础上开展优化,减少从底层重新实现关键能力的工作。


把前沿模型的算子开发经验带到昇腾


对大模型而言,芯片的理论算力只是起点。模型中的运算如何拆分、数据如何搬运、计算与访存如何衔接都会影响硬件最终能发挥多少性能。这些工作很大一部分落在算子实现上。


用较底层的语言编写算子,开发者就可以精细控制硬件,但也需要处理更多执行细节。模型结构持续变化,新算子不断出现,开发效率与性能优化便需要同时考虑。TileLang 试图解决的正是这个问题。据 DeepSeek 的介绍,其希望提供一种编程更简单、同时能够充分利用芯片计算资源的高级语言,降低高性能算子的开发难度。


DeepSeek 表示,相比于 CUDA 语言,TileLang 的编程模型能够简化代码逻辑、提高算子开发效率和项目可靠性。同时,其设计又强调充分利用硬件资源。团队称,这条技术路线已经在英伟达平台得到验证,目前承载了 DeepSeek V4 系列模型训练中大部分算子的实现。


此次开源的昇腾版本进一步将这一编程方式扩展到国产算力平台。DeepSeek 表示,相比昇腾原生的 Ascend C 底层语言,TileLang 昇腾版大幅简化了编程模型,同时保持硬件性能。据团队披露,DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。


这意味着此次发布已经覆盖了一组源于真实模型训练需求的算子。对于研究者来说,新模型结构往往需要新的计算方式,如果算子的实现与调优门槛下降,验证模型想法所需的工程投入也有望降低。


这套高级语言仍然需要硬件软件接口的支撑。华为介绍,昇腾通过开放的 Ascend C 编程接口与 PTO ISA 底层指令体系,支持 TileLang 的编译对接,有经验的开发者也可以继续进行底层手工调优。


五项组件,覆盖计算与通信关键环节


与 TileLang 一同发布的计算和通信组件,为开发者提供了可复用的基础能力。


DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布


这几项能力覆盖了不同类型的性能瓶颈。矩阵运算关系到计算单元的利用率,向量计算与访存关系到数据处理效率,稀疏注意力和筛选算子则服务于模型更具体的计算需求。


当模型跨越多张加速卡运行时,通信会成为单独需要优化的环节。单卡上的计算再快,如果数据无法及时到达下一步计算所在的设备,整个任务仍然会等待。


DeepSeek 表示,在多项关键测试用例中,此次开源组件的计算与通信性能已接近硬件上限。此次成套开源后,模型团队可以复用已经实现的基础组件,把更多精力投入自身的模型结构和应用需求,在某个环节出现瓶颈时,也能够查看并进一步修改实现。


超节点上的通信优化


此次合作还涉及昇腾 950 机型和 128 卡超节点方案,双方对计算与通信进行了联合优化。


华为提供的方案包括 SuperPoD Flex 与 UBL128 组网。据介绍,UBL128 超节点采用全互联设计,昇腾同时提供 ASC-COMM 高性能自定义通信编程库,支持通信算子以及通算融合算子的开发。


在此基础上,DeepSeek 开发了高性能 DeepEP 通信库,覆盖 EP、CP、PP、FSDP 等模式下的通信算子,分别对应专家并行、上下文并行、流水线并行和全分片数据并行等模型分布式执行方式。


这些并行方式需要传输的数据不同,通信发生的时机也不同。例如,专家并行需要把数据分发给相应专家,再汇聚计算结果。通信与计算的组织方式,会影响设备是否需要等待以及整个任务的执行效率。


华为披露,相关测试中 Dispatch 带宽达到 375 GB/s,Combine 带宽达到 347 GB/s,并称其接近硬件上限。对于大模型集群,这类优化的意义在于让新增的硬件资源能够更有效地参与计算。模型规模扩大、上下文变长,都会改变计算和通信的需求。可见,双方的合作深入到了模型计算方式与硬件互联之间。


V4.1 Flash 推理数据


在具体部署上,华为披露了基于 EP32 部署策略的 DeepSeek-V4.1-Flash 离线推理测试结果。


DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布


TPOT 衡量输出阶段每个 token 的生成耗时,吞吐则衡量单位时间内输出的 token 数量。两组结果呈现了不同 token 生成时延目标下的吞吐表现:在通稿给出的测试中,允许更长的 TPOT,对应更高的每卡输出吞吐。


数据均来自 Offline 推理模式,统计的是不带框架的纯模型性能,不包含 Serving 调度和框架负载均衡的影响,所列测试条件还包括 ContextLength 为 128K,以及 DSpark 投机接受率为 0.85。实际服务还需要考虑请求调度、负载变化和框架开销。


作为一组注明条件的模型执行测试,这些结果为评估昇腾平台上的部署方案提供了参考。对于准备开展部署的团队,能够复现测试并了解参数选择,往往比单独看到一个性能数字更有用。


可复用的联合优化成果


此次计划开放的实践,覆盖从单卡、单机到大规模部署的多个场景,也包含基于 PyTorch 原生框架的模型预训练、低精度量化训练、LoRA 微调和 Agentic RL 等内容。


其中,超长文本 KV Cache 池化涉及长上下文推理中的缓存管理,Agentic RL 则进一步涉及智能体与环境交互过程中的训练基础设施。这些方向说明,对大模型的联合优化正在延伸到模型部署与训练的具体流程。


此次的开源可以帮助开发者理解一项能力如何进入完整任务。计算库和通信库提供可调用的实现,部署及训练实践则提供组合这些实现的参考路径,减少团队各自探索配置与调优方法的成本。


对昇腾软件生态而言,这次发布增加了一套来自前沿模型实际需求的高级语言工具和基础组件,也给其他团队提供了可研究、可修改的工程范本。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner