news 2026/8/20 18:01:17

Qwen3.8-9B 数学与代码能力实测:从 GSM8K 到 MMLU 的评测结果全解读

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Qwen3.8-9B 数学与代码能力实测:从 GSM8K 到 MMLU 的评测结果全解读

Qwen3.8-9B 数学与代码能力实测:从 GSM8K 到 MMLU 的评测结果全解读

【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9B

Qwen3.8-9B 是 Empero 团队最新发布的开源推理模型,它将 Qwen3.8 2.4T A95B 大模型的数学与代码推理能力,蒸馏进 9B 参数的紧凑架构。本文基于官方评测数据,从 GSM8K 数学推理到 MMLU 综合能力,对 Qwen3.8-9B 评测结果进行逐项解读,并给出部署与使用建议。这份成绩单里有惊喜也有需要理性看待的地方,读完你就知道它到底值不值得上手。

一、Qwen3.8-9B 是什么:9B 参数如何复刻 2.4T 大模型的推理能力

先说结论:Qwen3.8-9B 是一棵"大树上嫁接的幼苗"——它不是从零训练的,而是把 Qwen3.8 2.4T A95B(教师模型)的思维过程,完整"蒸馏"进了 Qwen3.5-9B 的架构(学生模型)。

💡蒸馏(Distillation):让大模型输出高质量答案和思考过程,再用这些"教师轨迹"去训练小模型,让小模型学会大模型的推理方式,而不是自己瞎猜。

几个关键数字:

项目数值
参数量9B(全参数微调,非 LoRA 适配器)
教师模型Qwen3.8 2.4T A95B
训练数据约 70,000 条精选教师轨迹
训练方式SFT(离线蒸馏)
上下文长度262,144 token(原生支持)
许可证Apache-2.0(可商用)

架构上它继承自 Qwen3.5-9B:32 层 Transformer、hidden size 4096,采用线性注意力与全注意力混合的 Gated DeltaNet 设计(每 4 层穿插一层全注意力),详见 config.json。这意味着它在长上下文场景下内存占用更友好,但运行前需要安装配套的flash-linear-attentioncausal_conv1d内核。

最直观的特点藏在对话模板里:模型每次回答都会先输出一段<think>...</think>思维链(见 chat_template.jinja),再给出最终答案——这正是从教师模型那里学来的"深度思考"习惯。

二、Qwen3.8-9B 评测方法:CoT 协议与评分口径详解

评测使用的是 EleutherAI 的lm-evaluation-harness,HF 后端,基座模型与蒸馏模型采用完全相同的设置,保证公平对比。

由于两个模型都是推理模型,评测采用思维链(CoT)协议:

  • GSM8K:使用gsm8k_cot协议;
  • MMLU:使用mmlu_flan_cot_zeroshot协议,覆盖全部 57 个学科、约 1,700 道题。

评分口径分为两档:

  • Flexible-extract(灵活抽取):只要最终答案正确就算对,是主要参考指标;
  • 🔒Strict-match(严格匹配):要求答案格式完全一致,更严苛。

采样参数统一为temperature=0.6, top_p=0.95, top_k=20(Qwen3.5 官方推荐设置),完整评测表见 README.md。

三、GSM8K 数学推理实测:准确率全解读

GSM8K 是 8,500 道小学数学应用题,考察模型的多步算术推理能力,是衡量"数学能力"最常用的基准之一。Qwen3.8-9B 的成绩如下:

指标Qwen3.5-9B(基座)Qwen3.8-9B变化
exact_match(灵活抽取)0.8850.870−0.015
exact_match(严格匹配)0.8750.850−0.025

📌解读:87% 的准确率依然是很强的数学推理水平,但相比基座模型小幅回落了 1.5 个百分点。原因并不神秘——README 中明确指出,模型学习的是教师轨迹,继承了教师"遇到简单题也会长篇思考"的习惯,过度推敲反而容易在简单题上出错。也就是说,这不是能力退步,而是推理风格带来的副作用

四、MMLU 综合能力实测:57 学科平均分暴涨 20 个点

如果说 GSM8K 是"小幅波动",那么 MMLU 就是"质的飞跃"。MMLU 覆盖 STEM、人文、社科等 57 个学科,是衡量大模型综合知识面与泛化能力的黄金标准:

指标Qwen3.5-9B(基座)Qwen3.8-9B变化
acc(灵活抽取)0.5460.751+0.205
acc(严格匹配)0.2510.511+0.260

🚀解读:灵活抽取得分从 54.6% 飙升至 75.1%,直接提升 20.5 个百分点;严格匹配得分更是从 25.1% 翻倍到 51.1%。这说明蒸馏不仅教会了模型"怎么想",更把教师模型庞大的知识储备和严谨的作答格式"搬"了过来——这是 9B 参数规模下非常惊人的结果。

五、为什么数学与代码是 Qwen3.8-9B 蒸馏的重点

README 里有一句话很关键:训练数据的配比刻意向硬核数学与竞赛编程倾斜,因为这两个领域正是蒸馏在 9B 规模下"性价比"最高的地方。

  • 🧮数学:GSM8K 的高分证明了多步推理能力被成功继承;
  • 💻代码:模型原生支持函数调用(Function Calling),无需额外的工具微调即可接入代码解释器、API 等工具,配合<think>思维链,写代码时会先"想清楚再动手";
  • 🛠️工具使用:对话模板内置了<tool_call>调用格式(见 chat_template.jinja),适合构建 Agent 应用。

一句话总结:它不是为了刷分而生,而是为了"在单卡上跑出大模型级别的推理表现"而生。

六、快速部署 Qwen3.8-9B:本地运行参数与注意事项

想亲自复现这份评测?只需几步:

  1. 环境要求:较新的transformers(支持 Qwen3.5 架构)+ Gated DeltaNet 内核(flash-linear-attention和匹配 CUDA 的causal_conv1d);
  2. 下载权重文件(model.safetensors)与配置文件(config.json、generation_config.json);
  3. 运行推理时务必使用推荐的采样参数。
from transformers import AutoModelForCausalLM, AutoTokenizer import torch model_id = "empero-ai/Qwen3.8-9B" tok = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, dtype=torch.bfloat16, device_map="auto") # 关键:宽松采样 + 足够长的输出上限 out = model.generate(inputs, max_new_tokens=16384, temperature=0.6, top_p=0.95, top_k=20, do_sample=True)

⚠️三个使用提醒

  • 不要用贪心解码:推理模型在长文本生成时,贪心解码(greedy)容易陷入重复循环,务必保持采样模式;
  • 留足输出长度:每次回答都有<think>思考块,建议max_new_tokens=16384,前端展示时记得剥离<think>...</think>部分;
  • 纯文本微调:视觉能力继承自基座模型,本次评测未覆盖多模态场景。

七、总结:Qwen3.8-9B 评测成绩单该怎么看

把两份成绩单放在一起看:

评测维度表现结论
GSM8K 数学推理87.0%(灵活抽取)强,小幅回落属推理风格副作用
MMLU 综合能力75.1%(灵活抽取)暴涨 20.5 个百分点,最大亮点
代码与工具调用原生函数调用 + 竞赛编程轨迹适合 Agent / 代码场景
部署成本9B 单卡可跑,262K 上下文性价比极高

Qwen3.8-9B 的评测结果告诉我们:蒸馏路线在 9B 规模上完全走得通。它用 GSM8K 的稳定表现守住了数学推理的基本盘,用 MMLU 的暴涨证明了知识迁移的威力。对于想在单卡 GPU 上获得接近大模型推理体验的开发者来说,这份成绩单足够有说服力。

如果你正准备把它接入自己的项目,建议从 README.md 的 Quickstart 开始,先复现一遍 GSM8K 与 MMLU 评测,再结合业务场景调整采样参数——毕竟,纸面数据终归要落到真实任务里才算数。

【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/20 18:01:10

gruf 认证与安全:内置 Basic Auth 拦截器实战指南

gruf 认证与安全&#xff1a;内置 Basic Auth 拦截器实战指南 【免费下载链接】gruf gRPC Ruby Framework 项目地址: https://gitcode.com/gh_mirrors/gr/gruf 在微服务架构中&#xff0c;gRPC 服务的认证与安全是每个团队绕不开的话题。gruf 是一款优雅的 Ruby gRPC 框…

作者头像 李华
网站建设 2026/8/20 17:58:54

DeepSeek V4 Flash 实战指南:从 API 调用到本地部署的完整落地流程

1. 先搞清楚 DeepSeek V4 Flash 到底是个什么定位最近关于 DeepSeek V4 Flash 的讨论很多&#xff0c;标题里“杀疯了”、“跻身前五”这些说法&#xff0c;核心指向一个事实&#xff1a;这是一个在性能、成本和速度之间找到了新平衡点的模型。它不是那个参数规模最大、能力最强…

作者头像 李华
网站建设 2026/8/20 17:58:25

FF14终极启动器XIVLauncher完全指南

FF14终极启动器XIVLauncher完全指南 【免费下载链接】FFXIVQuickLauncher Custom launcher for FFXIV 项目地址: https://gitcode.com/GitHub_Trending/ff/FFXIVQuickLauncher 凌晨一点&#xff0c;进度条停在98%已经快半小时——这是今晚第三次了。XIVLauncher&#xf…

作者头像 李华