Qwen3.8-9B 数学与代码能力实测:从 GSM8K 到 MMLU 的评测结果全解读
【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9B
Qwen3.8-9B 是 Empero 团队最新发布的开源推理模型,它将 Qwen3.8 2.4T A95B 大模型的数学与代码推理能力,蒸馏进 9B 参数的紧凑架构。本文基于官方评测数据,从 GSM8K 数学推理到 MMLU 综合能力,对 Qwen3.8-9B 评测结果进行逐项解读,并给出部署与使用建议。这份成绩单里有惊喜也有需要理性看待的地方,读完你就知道它到底值不值得上手。
一、Qwen3.8-9B 是什么:9B 参数如何复刻 2.4T 大模型的推理能力
先说结论:Qwen3.8-9B 是一棵"大树上嫁接的幼苗"——它不是从零训练的,而是把 Qwen3.8 2.4T A95B(教师模型)的思维过程,完整"蒸馏"进了 Qwen3.5-9B 的架构(学生模型)。
💡蒸馏(Distillation):让大模型输出高质量答案和思考过程,再用这些"教师轨迹"去训练小模型,让小模型学会大模型的推理方式,而不是自己瞎猜。
几个关键数字:
| 项目 | 数值 |
|---|---|
| 参数量 | 9B(全参数微调,非 LoRA 适配器) |
| 教师模型 | Qwen3.8 2.4T A95B |
| 训练数据 | 约 70,000 条精选教师轨迹 |
| 训练方式 | SFT(离线蒸馏) |
| 上下文长度 | 262,144 token(原生支持) |
| 许可证 | Apache-2.0(可商用) |
架构上它继承自 Qwen3.5-9B:32 层 Transformer、hidden size 4096,采用线性注意力与全注意力混合的 Gated DeltaNet 设计(每 4 层穿插一层全注意力),详见 config.json。这意味着它在长上下文场景下内存占用更友好,但运行前需要安装配套的flash-linear-attention与causal_conv1d内核。
最直观的特点藏在对话模板里:模型每次回答都会先输出一段<think>...</think>思维链(见 chat_template.jinja),再给出最终答案——这正是从教师模型那里学来的"深度思考"习惯。
二、Qwen3.8-9B 评测方法:CoT 协议与评分口径详解
评测使用的是 EleutherAI 的lm-evaluation-harness,HF 后端,基座模型与蒸馏模型采用完全相同的设置,保证公平对比。
由于两个模型都是推理模型,评测采用思维链(CoT)协议:
- GSM8K:使用
gsm8k_cot协议; - MMLU:使用
mmlu_flan_cot_zeroshot协议,覆盖全部 57 个学科、约 1,700 道题。
评分口径分为两档:
- ✅Flexible-extract(灵活抽取):只要最终答案正确就算对,是主要参考指标;
- 🔒Strict-match(严格匹配):要求答案格式完全一致,更严苛。
采样参数统一为temperature=0.6, top_p=0.95, top_k=20(Qwen3.5 官方推荐设置),完整评测表见 README.md。
三、GSM8K 数学推理实测:准确率全解读
GSM8K 是 8,500 道小学数学应用题,考察模型的多步算术推理能力,是衡量"数学能力"最常用的基准之一。Qwen3.8-9B 的成绩如下:
| 指标 | Qwen3.5-9B(基座) | Qwen3.8-9B | 变化 |
|---|---|---|---|
| exact_match(灵活抽取) | 0.885 | 0.870 | −0.015 |
| exact_match(严格匹配) | 0.875 | 0.850 | −0.025 |
📌解读:87% 的准确率依然是很强的数学推理水平,但相比基座模型小幅回落了 1.5 个百分点。原因并不神秘——README 中明确指出,模型学习的是教师轨迹,继承了教师"遇到简单题也会长篇思考"的习惯,过度推敲反而容易在简单题上出错。也就是说,这不是能力退步,而是推理风格带来的副作用。
四、MMLU 综合能力实测:57 学科平均分暴涨 20 个点
如果说 GSM8K 是"小幅波动",那么 MMLU 就是"质的飞跃"。MMLU 覆盖 STEM、人文、社科等 57 个学科,是衡量大模型综合知识面与泛化能力的黄金标准:
| 指标 | Qwen3.5-9B(基座) | Qwen3.8-9B | 变化 |
|---|---|---|---|
| acc(灵活抽取) | 0.546 | 0.751 | +0.205 |
| acc(严格匹配) | 0.251 | 0.511 | +0.260 |
🚀解读:灵活抽取得分从 54.6% 飙升至 75.1%,直接提升 20.5 个百分点;严格匹配得分更是从 25.1% 翻倍到 51.1%。这说明蒸馏不仅教会了模型"怎么想",更把教师模型庞大的知识储备和严谨的作答格式"搬"了过来——这是 9B 参数规模下非常惊人的结果。
五、为什么数学与代码是 Qwen3.8-9B 蒸馏的重点
README 里有一句话很关键:训练数据的配比刻意向硬核数学与竞赛编程倾斜,因为这两个领域正是蒸馏在 9B 规模下"性价比"最高的地方。
- 🧮数学:GSM8K 的高分证明了多步推理能力被成功继承;
- 💻代码:模型原生支持函数调用(Function Calling),无需额外的工具微调即可接入代码解释器、API 等工具,配合
<think>思维链,写代码时会先"想清楚再动手"; - 🛠️工具使用:对话模板内置了
<tool_call>调用格式(见 chat_template.jinja),适合构建 Agent 应用。
一句话总结:它不是为了刷分而生,而是为了"在单卡上跑出大模型级别的推理表现"而生。
六、快速部署 Qwen3.8-9B:本地运行参数与注意事项
想亲自复现这份评测?只需几步:
- 环境要求:较新的
transformers(支持 Qwen3.5 架构)+ Gated DeltaNet 内核(flash-linear-attention和匹配 CUDA 的causal_conv1d); - 下载权重文件(model.safetensors)与配置文件(config.json、generation_config.json);
- 运行推理时务必使用推荐的采样参数。
from transformers import AutoModelForCausalLM, AutoTokenizer import torch model_id = "empero-ai/Qwen3.8-9B" tok = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, dtype=torch.bfloat16, device_map="auto") # 关键:宽松采样 + 足够长的输出上限 out = model.generate(inputs, max_new_tokens=16384, temperature=0.6, top_p=0.95, top_k=20, do_sample=True)⚠️三个使用提醒:
- 不要用贪心解码:推理模型在长文本生成时,贪心解码(greedy)容易陷入重复循环,务必保持采样模式;
- 留足输出长度:每次回答都有
<think>思考块,建议max_new_tokens=16384,前端展示时记得剥离<think>...</think>部分; - 纯文本微调:视觉能力继承自基座模型,本次评测未覆盖多模态场景。
七、总结:Qwen3.8-9B 评测成绩单该怎么看
把两份成绩单放在一起看:
| 评测维度 | 表现 | 结论 |
|---|---|---|
| GSM8K 数学推理 | 87.0%(灵活抽取) | 强,小幅回落属推理风格副作用 |
| MMLU 综合能力 | 75.1%(灵活抽取) | 暴涨 20.5 个百分点,最大亮点 |
| 代码与工具调用 | 原生函数调用 + 竞赛编程轨迹 | 适合 Agent / 代码场景 |
| 部署成本 | 9B 单卡可跑,262K 上下文 | 性价比极高 |
Qwen3.8-9B 的评测结果告诉我们:蒸馏路线在 9B 规模上完全走得通。它用 GSM8K 的稳定表现守住了数学推理的基本盘,用 MMLU 的暴涨证明了知识迁移的威力。对于想在单卡 GPU 上获得接近大模型推理体验的开发者来说,这份成绩单足够有说服力。
如果你正准备把它接入自己的项目,建议从 README.md 的 Quickstart 开始,先复现一遍 GSM8K 与 MMLU 评测,再结合业务场景调整采样参数——毕竟,纸面数据终归要落到真实任务里才算数。
【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考