每周一问 | 参数没变、价格没涨,Qwen 3.8 Max 的代码能力凭什么一个月暴涨近 3 倍?
「每周一问」是一个固定栏目:每周锁定一个 AI 领域的热门事件,抛出一个值得深挖的问题,再给出一篇尽量通俗、但足够专业的解答。不求面面俱到,只求把一个问题讲透。
〇、本周 AI 圈速览(2026.08.31 – 09.06)
先看这一周都发生了什么:
- 9 月 2 日,阿里千问发布Qwen 3.8 Max-0902:代码能力一个月内大幅跳涨,在 Code Arena WebDev 类目以1691 分登顶,超越 Claude Opus 5;API 价格维持输入 $2 / 输出 $6 每百万 tokens不变;
- OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 / Mythos 5.1、Google 的 Gemini 3.8 Flash、Meta 的 Muse Spark 1.3 相继亮相——大模型正式进入**"周更"节奏**;
- DeepSeek 在"DeepSeek 时刻"一年多之后,放出了V4 预览版,再次引发市场关注。
一、本期问题
先用一张图看清这次发布到底"暴涨"了多少:
数据摘要(0902 版 vs 上一版本):
| 基准测试 | 上一版本 | 0902 版 | 变化 | 考察什么 |
|---|---|---|---|---|
| TerminalBench 3.0 | 11.3 | 29.0 | +157% | 真实终端环境中的智能体任务 |
| DeepSWE 1.1 | 56.6 | 69.3 | +22% | 真实仓库级的 SWE 修复任务 |
| Code Arena WebDev | — | 1691 分(全球第一) | 登顶 | 真人用户盲测投票的人类偏好 |
问题来了:
从官方口径看,0902 是同一 Max 系列基座上的月度后训练(post-training)更新,基座没换、上下文窗口还是 1M、API 价格一分没涨。那么——
这多出来的"代码能力",到底是从哪里冒出来的?一个月涨 157%,是模型突然变聪明了,还是另有原因?
这个问题背后,其实藏着大模型领域一个核心认知问题:模型的能力,到底是由预训练决定的,还是由后训练决定的?下面我们逐层拆开。
二、TL;DR:先给结论
赶时间的朋友看这三句话:
- 能力的"原材料"早就备齐了。预训练阶段模型已经读过海量代码,知识与推理潜质都藏在参数里,只是没有被"唤醒";
- 后训练改变的是"行为策略"。0902 版的跃升主要来自官方所说的 Coding 与 Cowork 方向的后训练——尤其是代码强化学习和智能体(Agentic)训练,它们教会模型把潜质稳定地用在正确的场景上;
- 11.3 → 29.0 本质是"从没练过到练过"的跨越。TerminalBench 考察的是"在真实终端里干活"的智能体能力,上一版本在这块几乎空白,补上一整块能力栈,分数自然呈现爆炸式增长——这是补短板,不是智力跃迁。
三、详解:能力到底从哪里来?
3.1 先破除一个误解:后训练不是"往模型里塞新知识"
很多人下意识认为:模型能力提升 = 学了新东西。但对于同基座的版本更新来说,更准确的理解是——预训练决定上限,后训练决定你能调用多少上限。
打个比方:一个大学生,大一到大四的教材(预训练语料)早就读完了。考前一个月开始刷题、模考、总结错题(后训练),期末成绩从 70 分提到 90 分——他并没有突然变聪明,而是学会了**“在考试这个特定场景下,正确调用已有知识”**。
学术界给这个现象起过一个名字:elicitation(能力激发)。当然,也有研究认为强化学习(RL)后训练确实能让模型学到新的组合泛化能力——"激发派"与"学习派"之争至今没有完全定论。但业界已有共识:
对于代码这类"可验证"任务,RL 后训练的激发效率极高。这正是 Qwen 3.8 Max-0902 这类"月更版本"的技术底座。
3.2 后训练流水线:代码能力的四个台阶
一张图看清现代大模型的代码能力是怎么一层层"练"出来的:
台阶 1:预训练 —— 决定上限
用数万亿 token 的代码 + 文本做下一个词预测。模型在这个阶段学到的不是"怎么写代码",而是语言、逻辑与代码世界的统计规律。此时它像一个博览群书但从没参加过考试的学生:能力以"潜质"的形式存在,但不知道何时使用、如何使用。
台阶 2:监督微调(SFT)—— 教会"怎么说话"
用高质量的人工标注"指令 → 回答"数据微调。这一步主要是教会模型对话格式与人类表达习惯:理解需求、给出结构化回答、该用代码块时用代码块。
台阶 3:可验证奖励强化学习(RLVR)—— 教会"写对代码"
传统 RLHF 依赖人类标注偏好:贵、慢、主观。而代码任务天然自带"标准答案",于是出现了RLVR(RL with Verifiable Rewards)——让机器自动当裁判:
# 一个极简的 RLVR 奖励函数示意(伪代码)defreward(response,task):code=extract_code(response)# 从回答中抽取代码try:ifnotcompiles(code):# ① 能编译吗?return0.0ifnotpasses_unit_tests(code,task.tests):# ② 单元测试过吗?return0.2ifrun(code)==task.expected_output:# ③ 运行结果对吗?return1.0return0.4exceptTimeoutError:# ④ 死循环 / 超时return0.0奖励完全客观、可自动化、可大规模并行:模型对同一道题生成成百上千个解法,机器自动打分,强化学习算法把高分行为的概率推高、低分行为的概率压低。没有人类标注的瓶颈,训练规模可以想开多大开多大。
台阶 4:智能体强化学习(Agentic RL)—— 教会"把活干完"
这是0902 版的主要发力点,也是这两年行业竞争的主战场。
单轮"给题写码"和"在真实工程环境里完成任务"完全是两回事。Agentic 训练的做法是把模型扔进沙箱环境:
- 给它一个终端、一个仓库、一个任务(例如"修复这个 failing test");
- 让它多轮自主操作:读文件 → 写代码 → 跑测试 → 读报错 → 定位问题 → 修改 → 再跑;
- 不看中间过程,只按最终任务完成度给奖励。
这训练的是长链条行为策略:什么时候该探索、什么时候该止损、报错之后先查什么、上下文里哪些信息值得记下来。TerminalBench 考察的正是这种能力——它模拟的是开发者日常真正的样子:不是在聊天框里问代码,而是在终端里让 AI 替你把整件事干完。
3.3 为什么偏偏是 TerminalBench 涨得最猛?
先分清三类基准的定位:
| 基准类型 | 代表 | 考察什么 | 特点 |
|---|---|---|---|
| 静态代码基准 | HumanEval / MBPP 类 | 单函数补全 | 早年主流,如今普遍饱和,易受数据污染影响 |
| 环境交互基准 | TerminalBench、DeepSWE | 真实环境中的多轮智能体任务 | 贴近真实工作,方差大、难度高 |
| 人类偏好竞技场 | Code Arena WebDev | 真人用户盲测投票 | 反映"好不好用",而非"对不对" |
现在就能解释那个反差了:
- TerminalBench 11.3 → 29.0(+157%):11.3 的基线说明上一版本基本没有专门训练过"终端智能体"场景——不是模型笨,是没练过这个"题型"。0902 版把这块能力栈专门补上,分数自然跳涨。
- DeepSWE 56.6 → 69.3(+22%):上一版本已经有不错的 SWE 底子,边际提升自然难得多。
这符合机器学习的普遍规律:从 0 分到 60 分容易,从 85 分到 95 分难。所以以后再看到"XX 模型暴涨 N 倍"的新闻,先问两个问题:涨的是哪个基准?基线是多少?基线越低、任务越新,"暴涨"越常见。
3.4 Code Arena WebDev 1691 分:登顶人类偏好竞技场意味着什么?
Code Arena 采用类 Elo 机制:真人用户盲测两个模型的真实 Web 开发产出,投票分高下。它的价值在于:
- ✅ 贴近真实使用体验,"刷榜"难度大;
- ✅ 综合考察代码正确性、页面美观度、交互细节等真实开发者在意的东西;
- ⚠️ 但要注意:偏好 ≠ 正确性(用户可能投给更好看的前端,而不是更正确的逻辑);Elo 分数存在置信区间,第一名与第二名可能差距很小。
1691 分超越 Claude Opus 5,意味着国产模型在"用户实际觉得好用"这个维度上,已经具备了与顶级闭源模型正面掰手腕的实力——这在一年前还难以想象。
3.5 为什么价格可以一分不涨?
很多人好奇:能力涨这么多,为什么 API 价格不变?拆开成本结构就明白了:
| 环节 | 算力量级 | 成本性质 | 是否影响 API 定价 |
|---|---|---|---|
| 预训练 | 极大(万卡集群 · 月级) | 厂商一次性重资产投入 | 间接(长期摊销) |
| 后训练(RL) | 中(比预训练低 1~2 个数量级) | 厂商迭代投入 | 基本不影响 |
| 推理 | 单次请求 | 用户按 token 付费 | 直接决定 |
推理成本由参数规模、架构效率、KV cache 优化决定——0902 版这些都没变,所以 $2/$6 不需要变。
这也是"同基座月更版本"策略的商业逻辑:基座是重资产,后训练是轻资产。基座打磨一次,后训练可以按月快速迭代,版本更新又快又便宜,还能持续制造话题——一鱼多吃。
3.6 冷静看待:三个注意事项
- 基准分数 ≠ 你的实际体验。评测集存在污染与过拟合风险,榜单上领先两三分,与你的实际代码质量没有必然联系。最可靠的做法永远是:拿你自己的仓库、自己的任务,做小规模盲测。
- 暴涨要看绝对值。11.3 → 29.0 很震撼,但按满分 100 计,29.0 依然意味着约七成任务搞不定。智能体编程这个领域,所有人都还在爬坡。
- 周更时代的选型焦虑是真实的。与其每周追榜单第一,不如建立自己的评测集,把"选模型"从玄学变成可复现的工程流程。
四、对开发者的三点启示
- 建立自己的 eval。维护 20~50 个来自真实业务的测试任务(最好带可自动验证的结果),每次模型更新跑一遍。自己的数据永远比榜单可信,这已经是很多团队的标准实践。
- 关注 agentic 能力,而非单纯的代码生成。2026 年编程模型的竞争焦点,已经从"写对一个函数"转移到"在终端里把整个任务干完"。模型与编码智能体工具链(Claude Code、Cline 等 CLI / IDE 工具)的适配质量,会成为越来越重要的选型维度。
- 性价比窗口是真实的。第一梯队的代码能力 + $2/$6 的价格 + 1M 上下文,对个人开发者和中小团队来说,是当下实实在在的红利期,值得动手试一试。
五、一句话总结
模型的能力上限在预训练时就已注定,但你能实际用到多少,取决于后训练把它"解锁"到什么程度。
Qwen 3.8 Max-0902 的暴涨不是魔法,而是"基座潜质 + 可验证奖励的代码强化学习 + 智能体训练"三件事叠加的结果。这也预示着未来一年大模型竞争的主战场:从堆参数,转向练后训练。