Spark-X2.5-4B基准测试深度解读:AIME 90.7、SWE-Bench Pro 44.4,真实数据看它如何越级同规模开源模型
【免费下载链接】Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。项目地址: https://ai.gitcode.com/SparkLLM/Spark-X2.5-4B
Spark-X2.5-4B 是一款面向端侧与轻量部署的 4B 级开源大语言模型,主打对话、写作、翻译、推理、编码、工具调用与智能体工作流,并原生支持最高 1M tokens 上下文窗口和 200 多种语言。本文基于官方基准测试真实数据,逐项解读它的 AIME 90.7、SWE-Bench Pro 44.4 等成绩,看看这个"小钢炮"究竟如何越级挑战同规模乃至更大参数的开源模型。
一、先认识 Spark-X2.5-4B:4B 参数背后的三大设计
在拆分数之前,先用 3 个关键点理解它的定位:
- 效率优先的混合注意力架构:36 层中每 4 层包含 1 层全注意力 + 3 层滑动窗口注意力(窗口 512 tokens),大幅降低长上下文计算开销,这是它能"扛住" 1M 上下文的底气。层类型排布可以直接在 config.json 中看到;
- 原生 1M 上下文:
max_position_embeddings设为 1,048,576,见 config.json,无需外挂长文本技巧; - 大规模强化学习后训练:预训练语料约 20 万亿 tokens,再通过 SFT + 多领域强化学习 + MOPD 蒸馏整合,在华为昇腾集群上完成,重点强化推理、编码与指令跟随。
📦 仓库中模型权重以 5 个分片存放(model-00001-of-00005.safetensors至model-00005-of-00005.safetensors),分片映射关系见 model.safetensors.index.json。
二、数学推理基准测试:AIME 90.7 有多强?
数学竞赛题是检验模型"硬推理"能力的试金石。官方数据(思考模式,推荐采样参数 temperature=1.0、top_p=0.95,与 generation_config.json 一致)如下:
| 数学基准 | Spark-X2.5-4B | Qwen3.5-9B | Qwen3.5-4B | Gemma4-12B |
|---|---|---|---|---|
| AIME 2026 | 90.7 | 88.2 | 83.0 | 82.1 |
| HMMT Feb 2026 | 81.2 | 70.8 | 69.7 | 65.6 |
| IMO-AnswerBench | 74.2 | 69.8 | 68.5 | 57.2 |
| Gaokao 2026(满分150) | 133.4 | 135.5 | 130.3 | 130.6 |
三个值得注意的信号:
- AIME 90.7:不仅领先同规模的 Qwen3.5-4B 近 8 分,甚至超过 9B、12B 级的对手,是典型"越级"表现;
- HMMT 81.2:对 Qwen3.5-9B 领先 10 分以上,差距拉开越明显,说明优势并非单题运气;
- 高考 133.4:与 9B 级模型基本打平,中文数学场景不掉队。
💡 通俗理解:让一个 4B 模型做 AIME 达到 90.7 分,相当于小学生解出了研究生水平的竞赛题——这靠的是强化学习对推理链的系统性训练,而非单纯堆参数。
三、代码与智能体基准测试:SWE-Bench Pro 44.4 的含金量
代码修复与智能体(Agent)能力是当前小模型竞争最激烈的赛道,这也是 Spark-X2.5-4B 的主场:
| 基准 | Spark-X2.5-4B | Qwen3.5-9B | Qwen3.5-4B | Gemma4-12B |
|---|---|---|---|---|
| SWE-Bench Pro | 44.4 | 33.8 | 29.4 | 21.9 |
| SWE-Bench Multilingual | 53.3 | 43.3 | 27.7 | 32.5 |
| τ³-bench | 30.4 | 9.3 | 6.7 | 13.3 |
| MCP-Atlas | 54.6 | 47.4 | 40.8 | 30.5 |
| BrowseComp | 40.9 | 8.3 | 14.3 | 10.0 |
| BFCL-V4 | 65.1 | 66.1 | 50.3 | 37.4 |
关键解读:
- SWE-Bench Pro 44.4:真实 GitHub Issue 修复任务上领先 9B 模型约 11 分,是 Gemma4-12B 的 2 倍——对"本地修 Bug 助手"类应用是质变级提升;
- τ³-bench 30.4 vs 9.3:在复杂多轮工具调用场景领先近 3 倍,多智能体/工具调用是其明显强项;
- BrowseComp 40.9 vs 8.3:信息检索类任务差距接近 5 倍,适合做联网问答与资料整理场景。
⚖️ 客观说,SWE-Bench Verified(41.6)与 SciCode(34.7)上它落后于 Qwen3.5-9B 和 Gemma4-12B,说明"越级"主要体现在 Pro 版与多语言等更难、更贴近真实工程的场景中。
四、通用能力与指令跟随:93.0 的 IFEval 意味着什么
日常使用体验更多取决于通用能力,这一组数据体现的是"听话程度"和知识储备:
| 基准 | Spark-X2.5-4B | Qwen3.5-9B | Qwen3.5-4B | Gemma4-12B |
|---|---|---|---|---|
| IFEval | 93.0 | 91.5 | 89.8 | 94.8 |
| IFBench | 75.0 | 64.5 | 59.2 | 73.5 |
| GPQA(研究生级问答) | 67.4 | 77.2 | 67.2 | 72.8 |
| AA-LCR(逻辑推理) | 56.3 | 63.0 | 57.0 | 55.3 |
| HLE(专家级知识) | 12.3 | 14.3 | 8.6 | 13.1 |
- IFEval 93.0:仅次于 12B 级 Gemma4,意味着"按要求格式输出、限制字数、用指定语言回答"这类约束它基本都能稳定执行——这是智能体和 RAG 应用最看重的能力;
- GPQA 67.4与 9B 模型相当:科学专业知识上没有因参数小而明显缩水。
五、为什么 4B 能越级?混合注意力架构一句话讲清
Spark-X2.5-4B 用 36 层 Transformer 实现了"1 全注意力 + 3 滑动窗口"的循环排布(配置见 config.json):
- 滑动窗口层只看最近 512 个 tokens,计算量极小、KV Cache 占用低,负责处理局部细节;
- 全注意力层每 4 层出现一次,负责跨全文档的信息打通,保住 1M 长上下文能力;
- 模型实现细节可查看 modeling_spark.py,对话行为模板见 chat_template.jinja(默认开启思考模式)。
效果就是:长上下文场景下推理速度更快、显存占用更低,官方称其在多硬件平台的 TTFT/TOPT 指标优于同级模型。对新手来说,这意味着用消费级显卡甚至 NPU 也能跑百万级上下文的实用服务。
六、新手快速上手:三种最省事的体验方式
Spark-X2.5-4B 采用 Apache 2.0 协议(见 LICENSE),可商用。官方支持 vLLM、SGLang、llama.cpp、MLX 等推理框架,完整部署命令参考 README.md。新手推荐由易到难:
- Ollama(最简单):安装 Ollama v0.34.1 及以上版本后执行
ollama run SparkLLM/Spark-X2.5-4B,即可本地对话; - LM Studio(图形界面):2.34.0 及以上运行时原生支持
spark2_5架构,拖入模型即可使用; - SGLang / vLLM(生产部署):一条 docker 命令即可拉起 OpenAI 兼容 API 服务,详细参数见 README.md 的 Quickstart 章节。
⚙️ 采样建议:按官方推荐 temperature=1.0、top_p=0.95、top_k=-1,思考模式默认开启;若需关闭思考,在请求中设置"chat_template_kwargs": {"enable_thinking": false}即可。
七、总结:谁最适合用 Spark-X2.5-4B?
✅适合你,如果:
- 想在单卡/端侧设备跑"数学推理 + 代码修复 + 工具调用"三合一的轻量模型;
- 需要 1M 长上下文但预算有限(文档问答、长报告分析);
- 做多语言场景(覆盖 200+ 语言,SWE-Bench Multilingual 53.3 领先同级)。
⚠️需要权衡:
- 纯知识型深度问答(GPQA、HLE)上仍不如 9B~12B 模型;
- 若追求 SWE-Bench Verified 标准题型的极致分数,Qwen3.5-9B 仍是更稳的选择。
📊 一句话总结:AIME 90.7 + SWE-Bench Pro 44.4,Spark-X2.5-4B 证明了 4B 参数也能在竞赛数学与真实工程任务上"越级",是目前端侧开源模型中智能体能力的第一梯队选手。
注:对比数据中 * 号项来自公开模型卡/论文,"–" 表示暂无分数;完整基准表格见 README.md 的 Benchmarks 章节。
【免费下载链接】Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。项目地址: https://ai.gitcode.com/SparkLLM/Spark-X2.5-4B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考