news 2026/9/25 3:01:32

MindSpeed LLM支持哪些模型?Qwen3/DeepSeek/GLM等100+大模型清单全解

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MindSpeed LLM支持哪些模型?Qwen3/DeepSeek/GLM等100+大模型清单全解

MindSpeed LLM支持哪些模型?Qwen3/DeepSeek/GLM等100+大模型清单全解

【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM

MindSpeed LLM 是面向华为昇腾(Ascend)芯片生态的大语言模型分布式训练套件,目前已内置支持百余个业界常用 LLM 大模型的预训练与微调,覆盖 Qwen3、DeepSeek、GLM 三大主力系列的稠密模型、MoE 稀疏模型和状态空间模型。本文带你快速读懂这份模型清单,找到你最需要的模型及对应训练脚本。

一图看懂:MindSpeed LLM 支持哪些模型

MindSpeed LLM 按模型架构把支持的大模型分为四大类,并提供 Megatron 与 FSDP2 双训练后端:

  • Dense Model(稠密模型):Qwen3 系列等,传统 Transformer 结构
  • MoE Model(混合专家模型):DeepSeek、Qwen3-MoE、GLM 系列等
  • SSM Model(状态空间模型):Mamba2 等
  • Linear Model(线性注意力模型):Qwen3-Next 等

官方完整清单见 supported_models.md,每个模型都标注了序列长度、训练后端、推荐集群规模与认证状态(【Pass】官方测试通过 / 【Test】内部测试中)。

稠密模型清单:Qwen/LLaMA/GLM 全覆盖

稠密模型适合单机或中小集群快速上手,是新手入门的首选:

模型系列支持规格推荐集群规模训练后端
Qwen30.6B ~ 32B1x8 ~ 2x8Mcore / FSDP2
Qwen2.50.5B ~ 72B1x8 ~ 16x8Mcore
LLaMA3.18B ~ 405B1x8 ~ 36x8Mcore
LLaMA3.2 / 3.31B / 3B / 70B1x8 ~ 4x8Mcore
GLM4 / ChatGLM36B / 9B1x8 ~ 2x8Mcore
DeepSeek-R1-Distill1.5B ~ 70B1x8 ~ 4x8Mcore
InternLM2.51.8B ~ 20B1x8 ~ 2x8Mcore
Mistral / Gemma27B / 9B / 27B1x8 ~ 2x8Mcore

💡 集群规模格式为「节点数 × 卡数」,例如1x8表示 1 台 8 卡机器,单机 8 卡即可跑通 Qwen3-8B 训练。

Qwen2.5 系列在 MindSpeed LLM 上的微调性能对比,可以看到其相对业界方案的训练效率优势:

MoE 稀疏模型清单:DeepSeek/GLM 旗舰级

MoE 模型参数大、激活少,是超大参数训练的主战场。MindSpeed LLM 支持的旗舰级稀疏模型:

模型规格推荐集群规模训练后端
DeepSeek-V3671B64x8Mcore
DeepSeek-V3.2671B32x16Mcore
DeepSeek-V4-Flash284B8x16Mcore
GLM5 / GLM5.2MoE-744B32x16Mcore / FSDP2
Qwen3-235B-A22BMoE16x16Mcore / FSDP2
Qwen3-Next-80B-A3BMoE4x16Mcore / FSDP2
LongCat-FlashMoE-560B8x16Mcore
MiniMax-M2.7MoE-229B8x16FSDP2
Step-3.5-FlashMoE-196B12x16FSDP2
Mixtral8x7B / 8x22B8x8Mcore

这些模型对应的训练脚本都放在 examples/mcore/ 和 examples/fsdp2/ 目录下,例如 pretrain_deepseek3_671b_4k_ptd.sh、pretrain_glm5_744b_4k_A3_ptd.sh。

状态空间模型:Mamba 系列

SSM 模型处理长序列时计算与内存效率更高,MindSpeed LLM 支持 Mamba2(2.7B/8B)、Mamba2Hybrid 与 Mamba3 Demo,预训练入口为 pretrain_mamba.py。

训练后端怎么选:Mcore 还是 FSDP2

清单中的「训练后端」字段有三个取值,直接决定你跑模型的方式:

  • Legacy:历史实现,维护中的老版本
  • Mcore:基于 Megatron 的主流实现,支持 TP/PP/VP/EP/CP/DP 等多种并行策略,大模型首选
  • FSDP2:PyTorch 官方分布式训练方案 + FSDP Turbo 加速,支持 FSDP+EP、FSDP+CP 组合,新模型适配最快(天级适配 Qwen3-Next 就是靠它)

FSDP2 的模型加载与并行包装由 model_factory.py 完成,模型注册表见 model_registry.py。

快速上手:三步跑通你的模型

  1. 选脚本:按pretrain_模型名_参数_序列长度_训练方案_产品.sh的命名规则到 examples/ 找对应脚本,微调脚本以tune_开头
  2. 看规模:脚本中NNODES/NPUS_PER_NODE指定了机器数与每机 NPU 数,照此准备硬件
  3. 转权重:HF 权重需先转为训练格式,转换流程如下图所示(逐层处理、队列装配):

权重转换工具入口为 convert_ckpt_v2.py,配套文档见 tools 目录。更多细节可参考快速入门(Megatron 后端)和快速入门(FSDP2 后端)。

常见问题:你的模型不在清单里怎么办?

  • 多模态模型(图文理解、文生视频等)由 MindSpeed MM 专项维护,不在本仓库清单内
  • Mamba2 系列未提供开源词表,建议自行构建词表
  • 若清单中找不到目标模型,可参考 模型适配文档 自行扩展,FSDP2 后端基于 Transformers 原生模型开发,适配成本远低于 Mcore 后端

提示:无法直接访问 Hugging Face 时,可前往 ModelScope 下载模型权重,并核对文件正确性与安全性。

总结

你的需求推荐选择
单机 8 卡新手入门Qwen3-8B、GLM4-9B(1x8 集群)
中参数量生产训练Qwen2.5-72B、LLaMA3.1-405B
超大 MoE 旗舰训练DeepSeek-V3-671B、GLM5-744B
追求快速模型适配FSDP2 后端 + examples/fsdp2/

MindSpeed LLM 的模型清单仍在持续扩展(GLM5.2、DeepSeek-V4-Flash、MiniMax-M2.7 已陆续上线),完整列表请随时查看 模型支持文档。

【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/25 2:54:43

MySQL报错only_full_group_by:原因、排查与SQL改写实战

最近群里一位老同事贴了张报错截图,红彤彤一行英文:this is incompatible with sql_modeonly_full_group_by。这大概是 MySQL 5.7 之后后端同学最常撞见的“老朋友”了。很多人第一反应是“SQL 哪里写错了”,但把 SQL 翻来覆去看,…

作者头像 李华
网站建设 2026/9/25 2:54:35

USB转I2C适配器实现400KHz总线扫描与Excel导出实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华