news 2026/9/1 10:10:16

GLM-5 SWE-bench Pro 62.1分深度解读:开源SWE修复能力真相

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GLM-5 SWE-bench Pro 62.1分深度解读:开源SWE修复能力真相

GLM-5 SWE-bench Pro 62.1分深度解读:开源SWE修复能力真相

【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5

GLM-5 系列旗舰模型 GLM-5.2 在 SWE-bench Pro 上取得 62.1 分,登顶开源大模型 SWE 代码修复能力榜。这篇文章带你读懂这个分数背后的真相:它测的是什么、与闭源前沿差多少、开源第一意味着什么,以及新手如何快速上手部署 GLM-5 系列。

SWE-bench Pro 是什么?62.1 分意味着什么?

🎯 先说结论:62.1 分是当前开源模型在 SWE-bench Pro 上的最高分,比 GPT-5.5(58.6)高出 3.5 分,比 Gemini 3.1 Pro(54.2)高出近 8 分。

SWE-bench 系列是业界公认的"SWE 修复能力"标尺,考察模型能否像工程师一样:读懂仓库代码 → 定位真实 Bug → 写出补丁 → 通过测试。而SWE-bench Pro 是其中最硬核的版本——题目来自更复杂的真实工业级仓库,语言覆盖更广,对模型的长程推理、代码定位与多轮迭代能力要求更高。

上图为 GLM-5.2 在 8 项基准上的完整成绩(所有模型均以最大思考力度评测)。可以看到,除了 SWE-bench Pro 的 62.1,GLM-5.2 在 Terminal-Bench 2.1 上更是拿下81.0 分,与 Claude Opus 4.8(85.0)仅差 4 分。

数据来源:README_zh.md 中的官方评测说明

读懂 62.1:一张表看透开源 vs 闭源差距

基准测试GLM-5.2Claude Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-bench Pro62.169.258.654.2
Terminal-Bench 2.181.085.084.074.0
DeepSWE46.258.058.010.0
MCP-Atlas77.077.875.369.2

📊 三个关键信号:

  • 开源第一,且优势扩大:对比上一代 GLM-5.1 的 58.4 分,GLM-5.2 一次提升了 3.7 分,拉开与同类开源模型的差距。
  • 闭源差距缩至 7.1 分:69.2 vs 62.1,在两年前的开源圈几乎是不可想象的数字。
  • Terminal-Bench 2.1 接近追平:81.0 对 85.0,说明 GLM-5 系列的"智能体工程"能力已贴近闭源天花板。

54.9 → 62.1:GLM-5 系列是如何一路爬升的?

62.1 分并非一蹴而就,而是 GLM-5 系列三代进化的结果。上图展示的是 GLM-5.1 时期的编码评测(SWE-Bench Pro 54.9,当时已是开源领先),而 GLM-5.2 在此基础上再上台阶。

1️⃣ 规模翻倍:744B 参数 + 稀疏注意力

相比 GLM-4.5,GLM-5 将参数从 355B(激活 32B)扩展到744B(激活 40B),预训练数据从 23T 增至28.5T tokens。更妙的是集成了 DeepSeek 稀疏注意力(DSA),让长上下文部署成本大幅降低——这也是它敢冲击 1M token 上下文的底气。

2️⃣ slime:异步强化学习基础设施

传统 RL 训练太慢,撑不起大规模后训练。GLM 团队自研了 slime 异步 RL 框架,大幅提升训练吞吐,让"更细粒度的后训练迭代"成为可能——这是 SWE 修复这类长链路任务能持续提分的关键。

3️⃣ 从 Vibe Coding 到 Agentic Engineering

GLM-5 系列最核心的进化不是"写对一行代码",而是长程智能体能力:拆解复杂问题、设计实验、读结果、定位瓶颈,并在数百轮迭代、数千次工具调用中持续优化——运行越久,结果越好。

上图为 GLM-5 首代模型的全面成绩单:SWE-bench Verified 77.8、SWE-bench Multilingual 73.3、t²-Bench 89.7,在开源模型中处于第一梯队,与 Claude Opus 4.5 的差距已非常有限。

从榜单到真实工程:GLM-5 的实战表现

榜单分数之外,官方还准备了更贴近真实工作场景的验证。在内部评估套件CC-Bench-V2上,GLM-5 在前端构建成功率达到98.0%(超越 Claude Opus 4.5 的 93.0%),大仓库探索能力 65.6%,长程多步链式任务 52.3%——均优于上一代 GLM-4.7,并与闭源旗舰掰手腕。

更有趣的验证是Vending Bench 2:让模型在一年时间跨度里"经营"一个模拟自动售货机生意。GLM-5 最终账户余额$4,432,开源第一,直逼 Claude Opus 4.5 的 $4,967。能赚钱,才说明规划、资源管理和抗干扰能力是真的。

新手快速上手:GLM-5 系列部署指南

💡 不需要写一行代码,你也能用起来:

模型获取

GLM-5 全系列(GLM-5 / 5.1 / 5.2)均为 744B-A40B 的 MoE 架构,提供BF16 与 FP8两种精度,可同时在 Hugging Face 与 ModelScope 两大模型平台下载。FP8 版本显存占用更低,适合资源有限的环境。

主流部署框架

官方验证了以下推理框架(详见 README.md):

框架最低版本适合场景
SGLangv0.5.13.post1+高性能生产部署
vLLMv0.23.0+通用推理服务
Transformersv0.5.12+快速原型验证
KTransformersv0.5.12+消费级硬件混合推理
Unslothv0.1.47-beta+量化与微调

若使用Ascend NPU平台,官方提供了完整部署示例,涵盖 MoE 算子融合、PD 分离、W8A8 量化等 7 项优化,可参考 example/ascend.md。

关键参数:思考力度

GLM-5 支持reasoning_effort参数控制思考力度,分maxhigh两档,默认即为max——复现榜单成绩无需任何设置;追求低延迟时可显式传reasoning_effort="high";设置enable_thinking=false可完全关闭思考。

微调与技能生态

  • 微调支持 Slime(GLM 团队同款 RL 框架)与 ms-swift(支持 SFT / PPO / GRPO)
  • 仓库内附赠 skills/glm-master-skill/SKILL.md,是 GLM 生态技能(OCR、图像生成、视觉理解等)的导航总览
  • 许可协议见 LICENSE,可自由用于研究与商业场景

常见问题速答

Q:SWE-bench Pro 62.1 分是 GLM-5 还是 GLM-5.2?A:62.1 分来自系列最新旗舰GLM-5.2(最大思考力度评测);前代 GLM-5.1 为 58.4 分。GLM-5 作为系列首代,在 SWE-bench Verified 上得 77.8 分。

Q:与闭源模型还有多大差距?A:SWE-bench Pro 差 7.1 分(62.1 vs 69.2),DeepSWE 差 11.8 分仍是短板;但在 Terminal-Bench 2.1 上仅差 4 分,部分真实工程指标(前端构建成功率)已反超。

Q:个人开发者值得本地部署吗?A:744B 参数对显存要求不低,推荐 FP8 版本 + KTransformers 混合推理方案;也可直接通过 API 平台调用 GLM-5.2 服务,是新手最快上手的姿势。

总结

62.1 分不只是"开源第一"的标题,它标志着三件事:开源 SWE 修复能力进入 60+ 时代与闭源前沿差距压缩到个位数Agentic Engineering 取代单点代码生成成为竞争主线。对新手而言,现在正是用 GLM-5 系列体验"会自主修 Bug 的 AI 工程师"的最佳时机——下载 FP8 权重、跑通 SGLang,或直接用 API,半小时即可上手。

【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 10:09:46

10 分钟搭好团队知识库:Outline 部署与协作实战

10 分钟搭好团队知识库:Outline 部署与协作实战 【免费下载链接】outline The fastest knowledge base for growing teams. Beautiful, realtime collaborative, feature packed, and markdown compatible. 项目地址: https://gitcode.com/GitHub_Trending/ou/out…

作者头像 李华
网站建设 2026/9/1 10:08:35

宇树机器人二次开发实战:从SDK环境搭建到运动控制与调试

在实际机器人技术领域,宇树科技(Unitree)是一个绕不开的名字。从早期惊艳四座的仿生四足机器人,到如今面向消费级市场的通用人形机器人,宇树的产品迭代速度和市场声量都令人瞩目。其产品线覆盖了从科研教育、工业巡检到…

作者头像 李华
网站建设 2026/9/1 10:07:35

yuzu模拟器免费教程:5分钟在电脑和手机上跑起来Switch游戏

yuzu模拟器免费教程:5分钟在电脑和手机上跑起来Switch游戏 【免费下载链接】yuzu 任天堂 Switch 模拟器 项目地址: https://gitcode.com/GitHub_Trending/yu/yuzu yuzu模拟器是一款完全开源免费的任天堂 Switch 模拟器,它让《塞尔达传说&#xff…

作者头像 李华
网站建设 2026/9/1 10:07:07

神马影视8.8源码部署实战:从解压到上线的完整流程

简介:一套面向影视站点开发与运维人员的视频播放网站后台管理系统源码,基于maccms内核,8.8优化版在性能、稳定性与功能细节上做了调整,适合用于搭建私人影视库、学习CMS二次开发或部署测试。资源压缩包共1个文件,类型为…

作者头像 李华
网站建设 2026/9/1 10:05:47

Tool Calling、Skills与MCP:Agent工具调用的三大核心概念解析

1. 核心概念拆解:先分清三个词各管什么 近年来 Agent 类应用大量出现,大家总会看到三个高频词:Tool Calling、Skills、MCP。不少初接触的人会把它们混为一谈:都是“让模型调用外部工具”的东西,到底有什么区别&#xf…

作者头像 李华
网站建设 2026/9/1 10:04:31

Cursor Origin 深度解析:从代码补全到项目级AI编程助手实战

这类工具最值得先看的不是功能列表,而是能不能在普通环境里稳定跑起来,以及它到底改变了你写代码的哪个环节。Cursor Origin 上线,很多人第一反应是“又一个 AI 编辑器”,但真正值得琢磨的是它为什么开始强调“代码仓库”这个能力…

作者头像 李华