MindSpeed LLM支持哪些模型?Qwen3/DeepSeek/GLM等100+大模型清单全解
【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM
MindSpeed LLM 是面向华为昇腾(Ascend)芯片生态的大语言模型分布式训练套件,目前已内置支持百余个业界常用 LLM 大模型的预训练与微调,覆盖 Qwen3、DeepSeek、GLM 三大主力系列的稠密模型、MoE 稀疏模型和状态空间模型。本文带你快速读懂这份模型清单,找到你最需要的模型及对应训练脚本。
一图看懂:MindSpeed LLM 支持哪些模型
MindSpeed LLM 按模型架构把支持的大模型分为四大类,并提供 Megatron 与 FSDP2 双训练后端:
- Dense Model(稠密模型):Qwen3 系列等,传统 Transformer 结构
- MoE Model(混合专家模型):DeepSeek、Qwen3-MoE、GLM 系列等
- SSM Model(状态空间模型):Mamba2 等
- Linear Model(线性注意力模型):Qwen3-Next 等
官方完整清单见 supported_models.md,每个模型都标注了序列长度、训练后端、推荐集群规模与认证状态(【Pass】官方测试通过 / 【Test】内部测试中)。
稠密模型清单:Qwen/LLaMA/GLM 全覆盖
稠密模型适合单机或中小集群快速上手,是新手入门的首选:
| 模型系列 | 支持规格 | 推荐集群规模 | 训练后端 |
|---|---|---|---|
| Qwen3 | 0.6B ~ 32B | 1x8 ~ 2x8 | Mcore / FSDP2 |
| Qwen2.5 | 0.5B ~ 72B | 1x8 ~ 16x8 | Mcore |
| LLaMA3.1 | 8B ~ 405B | 1x8 ~ 36x8 | Mcore |
| LLaMA3.2 / 3.3 | 1B / 3B / 70B | 1x8 ~ 4x8 | Mcore |
| GLM4 / ChatGLM3 | 6B / 9B | 1x8 ~ 2x8 | Mcore |
| DeepSeek-R1-Distill | 1.5B ~ 70B | 1x8 ~ 4x8 | Mcore |
| InternLM2.5 | 1.8B ~ 20B | 1x8 ~ 2x8 | Mcore |
| Mistral / Gemma2 | 7B / 9B / 27B | 1x8 ~ 2x8 | Mcore |
💡 集群规模格式为「节点数 × 卡数」,例如
1x8表示 1 台 8 卡机器,单机 8 卡即可跑通 Qwen3-8B 训练。
Qwen2.5 系列在 MindSpeed LLM 上的微调性能对比,可以看到其相对业界方案的训练效率优势:
MoE 稀疏模型清单:DeepSeek/GLM 旗舰级
MoE 模型参数大、激活少,是超大参数训练的主战场。MindSpeed LLM 支持的旗舰级稀疏模型:
| 模型 | 规格 | 推荐集群规模 | 训练后端 |
|---|---|---|---|
| DeepSeek-V3 | 671B | 64x8 | Mcore |
| DeepSeek-V3.2 | 671B | 32x16 | Mcore |
| DeepSeek-V4-Flash | 284B | 8x16 | Mcore |
| GLM5 / GLM5.2 | MoE-744B | 32x16 | Mcore / FSDP2 |
| Qwen3-235B-A22B | MoE | 16x16 | Mcore / FSDP2 |
| Qwen3-Next-80B-A3B | MoE | 4x16 | Mcore / FSDP2 |
| LongCat-Flash | MoE-560B | 8x16 | Mcore |
| MiniMax-M2.7 | MoE-229B | 8x16 | FSDP2 |
| Step-3.5-Flash | MoE-196B | 12x16 | FSDP2 |
| Mixtral | 8x7B / 8x22B | 8x8 | Mcore |
这些模型对应的训练脚本都放在 examples/mcore/ 和 examples/fsdp2/ 目录下,例如 pretrain_deepseek3_671b_4k_ptd.sh、pretrain_glm5_744b_4k_A3_ptd.sh。
状态空间模型:Mamba 系列
SSM 模型处理长序列时计算与内存效率更高,MindSpeed LLM 支持 Mamba2(2.7B/8B)、Mamba2Hybrid 与 Mamba3 Demo,预训练入口为 pretrain_mamba.py。
训练后端怎么选:Mcore 还是 FSDP2
清单中的「训练后端」字段有三个取值,直接决定你跑模型的方式:
- Legacy:历史实现,维护中的老版本
- Mcore:基于 Megatron 的主流实现,支持 TP/PP/VP/EP/CP/DP 等多种并行策略,大模型首选
- FSDP2:PyTorch 官方分布式训练方案 + FSDP Turbo 加速,支持 FSDP+EP、FSDP+CP 组合,新模型适配最快(天级适配 Qwen3-Next 就是靠它)
FSDP2 的模型加载与并行包装由 model_factory.py 完成,模型注册表见 model_registry.py。
快速上手:三步跑通你的模型
- 选脚本:按
pretrain_模型名_参数_序列长度_训练方案_产品.sh的命名规则到 examples/ 找对应脚本,微调脚本以tune_开头 - 看规模:脚本中
NNODES/NPUS_PER_NODE指定了机器数与每机 NPU 数,照此准备硬件 - 转权重:HF 权重需先转为训练格式,转换流程如下图所示(逐层处理、队列装配):
权重转换工具入口为 convert_ckpt_v2.py,配套文档见 tools 目录。更多细节可参考快速入门(Megatron 后端)和快速入门(FSDP2 后端)。
常见问题:你的模型不在清单里怎么办?
- 多模态模型(图文理解、文生视频等)由 MindSpeed MM 专项维护,不在本仓库清单内
- Mamba2 系列未提供开源词表,建议自行构建词表
- 若清单中找不到目标模型,可参考 模型适配文档 自行扩展,FSDP2 后端基于 Transformers 原生模型开发,适配成本远低于 Mcore 后端
提示:无法直接访问 Hugging Face 时,可前往 ModelScope 下载模型权重,并核对文件正确性与安全性。
总结
| 你的需求 | 推荐选择 |
|---|---|
| 单机 8 卡新手入门 | Qwen3-8B、GLM4-9B(1x8 集群) |
| 中参数量生产训练 | Qwen2.5-72B、LLaMA3.1-405B |
| 超大 MoE 旗舰训练 | DeepSeek-V3-671B、GLM5-744B |
| 追求快速模型适配 | FSDP2 后端 + examples/fsdp2/ |
MindSpeed LLM 的模型清单仍在持续扩展(GLM5.2、DeepSeek-V4-Flash、MiniMax-M2.7 已陆续上线),完整列表请随时查看 模型支持文档。
【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考