news 2026/9/8 15:29:32

每周一问 | 参数没变、价格没涨,Qwen 3.8 Max 的代码能力凭什么一个月暴涨近 3 倍?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
每周一问 | 参数没变、价格没涨,Qwen 3.8 Max 的代码能力凭什么一个月暴涨近 3 倍?

每周一问 | 参数没变、价格没涨,Qwen 3.8 Max 的代码能力凭什么一个月暴涨近 3 倍?

「每周一问」是一个固定栏目:每周锁定一个 AI 领域的热门事件,抛出一个值得深挖的问题,再给出一篇尽量通俗、但足够专业的解答。不求面面俱到,只求把一个问题讲透。


〇、本周 AI 圈速览(2026.08.31 – 09.06)

先看这一周都发生了什么:

  • 9 月 2 日,阿里千问发布Qwen 3.8 Max-0902:代码能力一个月内大幅跳涨,在 Code Arena WebDev 类目以1691 分登顶,超越 Claude Opus 5;API 价格维持输入 $2 / 输出 $6 每百万 tokens不变;
  • OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 / Mythos 5.1、Google 的 Gemini 3.8 Flash、Meta 的 Muse Spark 1.3 相继亮相——大模型正式进入**"周更"节奏**;
  • DeepSeek 在"DeepSeek 时刻"一年多之后,放出了V4 预览版,再次引发市场关注。

一、本期问题

先用一张图看清这次发布到底"暴涨"了多少:

数据摘要(0902 版 vs 上一版本):

基准测试上一版本0902 版变化考察什么
TerminalBench 3.011.329.0+157%真实终端环境中的智能体任务
DeepSWE 1.156.669.3+22%真实仓库级的 SWE 修复任务
Code Arena WebDev1691 分(全球第一)登顶真人用户盲测投票的人类偏好

问题来了:

从官方口径看,0902 是同一 Max 系列基座上的月度后训练(post-training)更新,基座没换、上下文窗口还是 1M、API 价格一分没涨。那么——

这多出来的"代码能力",到底是从哪里冒出来的?一个月涨 157%,是模型突然变聪明了,还是另有原因?

这个问题背后,其实藏着大模型领域一个核心认知问题:模型的能力,到底是由预训练决定的,还是由后训练决定的?下面我们逐层拆开。


二、TL;DR:先给结论

赶时间的朋友看这三句话:

  1. 能力的"原材料"早就备齐了。预训练阶段模型已经读过海量代码,知识与推理潜质都藏在参数里,只是没有被"唤醒";
  2. 后训练改变的是"行为策略"。0902 版的跃升主要来自官方所说的 Coding 与 Cowork 方向的后训练——尤其是代码强化学习智能体(Agentic)训练,它们教会模型把潜质稳定地用在正确的场景上;
  3. 11.3 → 29.0 本质是"从没练过到练过"的跨越。TerminalBench 考察的是"在真实终端里干活"的智能体能力,上一版本在这块几乎空白,补上一整块能力栈,分数自然呈现爆炸式增长——这是补短板,不是智力跃迁

三、详解:能力到底从哪里来?

3.1 先破除一个误解:后训练不是"往模型里塞新知识"

很多人下意识认为:模型能力提升 = 学了新东西。但对于同基座的版本更新来说,更准确的理解是——预训练决定上限,后训练决定你能调用多少上限

打个比方:一个大学生,大一到大四的教材(预训练语料)早就读完了。考前一个月开始刷题、模考、总结错题(后训练),期末成绩从 70 分提到 90 分——他并没有突然变聪明,而是学会了**“在考试这个特定场景下,正确调用已有知识”**。

学术界给这个现象起过一个名字:elicitation(能力激发)。当然,也有研究认为强化学习(RL)后训练确实能让模型学到新的组合泛化能力——"激发派"与"学习派"之争至今没有完全定论。但业界已有共识:

对于代码这类"可验证"任务,RL 后训练的激发效率极高。这正是 Qwen 3.8 Max-0902 这类"月更版本"的技术底座。

3.2 后训练流水线:代码能力的四个台阶

一张图看清现代大模型的代码能力是怎么一层层"练"出来的:

台阶 1:预训练 —— 决定上限

用数万亿 token 的代码 + 文本做下一个词预测。模型在这个阶段学到的不是"怎么写代码",而是语言、逻辑与代码世界的统计规律。此时它像一个博览群书但从没参加过考试的学生:能力以"潜质"的形式存在,但不知道何时使用、如何使用

台阶 2:监督微调(SFT)—— 教会"怎么说话"

用高质量的人工标注"指令 → 回答"数据微调。这一步主要是教会模型对话格式与人类表达习惯:理解需求、给出结构化回答、该用代码块时用代码块。

台阶 3:可验证奖励强化学习(RLVR)—— 教会"写对代码"

传统 RLHF 依赖人类标注偏好:贵、慢、主观。而代码任务天然自带"标准答案",于是出现了RLVR(RL with Verifiable Rewards)——让机器自动当裁判:

# 一个极简的 RLVR 奖励函数示意(伪代码)defreward(response,task):code=extract_code(response)# 从回答中抽取代码try:ifnotcompiles(code):# ① 能编译吗?return0.0ifnotpasses_unit_tests(code,task.tests):# ② 单元测试过吗?return0.2ifrun(code)==task.expected_output:# ③ 运行结果对吗?return1.0return0.4exceptTimeoutError:# ④ 死循环 / 超时return0.0

奖励完全客观、可自动化、可大规模并行:模型对同一道题生成成百上千个解法,机器自动打分,强化学习算法把高分行为的概率推高、低分行为的概率压低。没有人类标注的瓶颈,训练规模可以想开多大开多大。

台阶 4:智能体强化学习(Agentic RL)—— 教会"把活干完"

这是0902 版的主要发力点,也是这两年行业竞争的主战场。

单轮"给题写码"和"在真实工程环境里完成任务"完全是两回事。Agentic 训练的做法是把模型扔进沙箱环境:

  • 给它一个终端、一个仓库、一个任务(例如"修复这个 failing test");
  • 让它多轮自主操作:读文件 → 写代码 → 跑测试 → 读报错 → 定位问题 → 修改 → 再跑;
  • 不看中间过程,只按最终任务完成度给奖励

这训练的是长链条行为策略:什么时候该探索、什么时候该止损、报错之后先查什么、上下文里哪些信息值得记下来。TerminalBench 考察的正是这种能力——它模拟的是开发者日常真正的样子:不是在聊天框里问代码,而是在终端里让 AI 替你把整件事干完。

3.3 为什么偏偏是 TerminalBench 涨得最猛?

先分清三类基准的定位:

基准类型代表考察什么特点
静态代码基准HumanEval / MBPP 类单函数补全早年主流,如今普遍饱和,易受数据污染影响
环境交互基准TerminalBenchDeepSWE真实环境中的多轮智能体任务贴近真实工作,方差大、难度高
人类偏好竞技场Code Arena WebDev真人用户盲测投票反映"好不好用",而非"对不对"

现在就能解释那个反差了:

  • TerminalBench 11.3 → 29.0(+157%):11.3 的基线说明上一版本基本没有专门训练过"终端智能体"场景——不是模型笨,是没练过这个"题型"。0902 版把这块能力栈专门补上,分数自然跳涨。
  • DeepSWE 56.6 → 69.3(+22%):上一版本已经有不错的 SWE 底子,边际提升自然难得多。

这符合机器学习的普遍规律:从 0 分到 60 分容易,从 85 分到 95 分难。所以以后再看到"XX 模型暴涨 N 倍"的新闻,先问两个问题:涨的是哪个基准?基线是多少?基线越低、任务越新,"暴涨"越常见。

3.4 Code Arena WebDev 1691 分:登顶人类偏好竞技场意味着什么?

Code Arena 采用类 Elo 机制:真人用户盲测两个模型的真实 Web 开发产出,投票分高下。它的价值在于:

  • ✅ 贴近真实使用体验,"刷榜"难度大;
  • ✅ 综合考察代码正确性、页面美观度、交互细节等真实开发者在意的东西;
  • ⚠️ 但要注意:偏好 ≠ 正确性(用户可能投给更好看的前端,而不是更正确的逻辑);Elo 分数存在置信区间,第一名与第二名可能差距很小。

1691 分超越 Claude Opus 5,意味着国产模型在"用户实际觉得好用"这个维度上,已经具备了与顶级闭源模型正面掰手腕的实力——这在一年前还难以想象。

3.5 为什么价格可以一分不涨?

很多人好奇:能力涨这么多,为什么 API 价格不变?拆开成本结构就明白了:

环节算力量级成本性质是否影响 API 定价
预训练极大(万卡集群 · 月级)厂商一次性重资产投入间接(长期摊销)
后训练(RL)中(比预训练低 1~2 个数量级)厂商迭代投入基本不影响
推理单次请求用户按 token 付费直接决定

推理成本由参数规模、架构效率、KV cache 优化决定——0902 版这些都没变,所以 $2/$6 不需要变。

这也是"同基座月更版本"策略的商业逻辑:基座是重资产,后训练是轻资产。基座打磨一次,后训练可以按月快速迭代,版本更新又快又便宜,还能持续制造话题——一鱼多吃。

3.6 冷静看待:三个注意事项

  1. 基准分数 ≠ 你的实际体验。评测集存在污染与过拟合风险,榜单上领先两三分,与你的实际代码质量没有必然联系。最可靠的做法永远是:拿你自己的仓库、自己的任务,做小规模盲测。
  2. 暴涨要看绝对值。11.3 → 29.0 很震撼,但按满分 100 计,29.0 依然意味着约七成任务搞不定。智能体编程这个领域,所有人都还在爬坡。
  3. 周更时代的选型焦虑是真实的。与其每周追榜单第一,不如建立自己的评测集,把"选模型"从玄学变成可复现的工程流程。

四、对开发者的三点启示

  1. 建立自己的 eval。维护 20~50 个来自真实业务的测试任务(最好带可自动验证的结果),每次模型更新跑一遍。自己的数据永远比榜单可信,这已经是很多团队的标准实践。
  2. 关注 agentic 能力,而非单纯的代码生成。2026 年编程模型的竞争焦点,已经从"写对一个函数"转移到"在终端里把整个任务干完"。模型与编码智能体工具链(Claude Code、Cline 等 CLI / IDE 工具)的适配质量,会成为越来越重要的选型维度。
  3. 性价比窗口是真实的。第一梯队的代码能力 + $2/$6 的价格 + 1M 上下文,对个人开发者和中小团队来说,是当下实实在在的红利期,值得动手试一试。

五、一句话总结

模型的能力上限在预训练时就已注定,但你能实际用到多少,取决于后训练把它"解锁"到什么程度。

Qwen 3.8 Max-0902 的暴涨不是魔法,而是"基座潜质 + 可验证奖励的代码强化学习 + 智能体训练"三件事叠加的结果。这也预示着未来一年大模型竞争的主战场:从堆参数,转向练后训练。



版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/8 15:28:32

基于FPGA的MoE模型推理实现:从架构拆解到工程实践

1. MoE模型到底是什么——用“多个小专家”拼出大模型 MoE全称是Mixture of Experts,混合专家模型。这两年它在大模型圈子里火得厉害,很多人第一次听到这个名字,是在GPT-4、Mixtral这些模型的架构说明里——只要一提到“稀疏激活”“专家路由…

作者头像 李华
网站建设 2026/9/8 15:28:26

ponytail使用指南:npx技能包统一开发工具

1. 从“马尾辫”说起:这个项目到底解决什么问题第一次看到 ponytail 这个名字,我第一反应是:谁给项目起这么个名字,跟发型较上劲了?后来翻了一下它的定位才明白,这个名字其实挺传神——马尾辫的核心特征是把…

作者头像 李华
网站建设 2026/9/8 15:26:58

浏览器自动化测试工具选型指南:Selenium与Playwright实战对比

这几年经常有同事和朋友问我:你手里有没有好用的 浏览器开源自动化测试工具 ?我第一反应不是甩一个GitHub链接,而是反问一句:你打算用在哪?因为同样是“浏览器自动化”,UI冒烟测试、接口回归、爬虫采集、…

作者头像 李华
网站建设 2026/9/8 15:26:19

RPCS3 汉化补丁怎么配置:三步给 PS3 游戏换上中文界面

RPCS3 汉化补丁怎么配置:三步给 PS3 游戏换上中文界面 【免费下载链接】rpcs3 PlayStation 3 emulator and debugger 项目地址: https://gitcode.com/GitHub_Trending/rp/rpcs3 RPCS3 是一款运行在电脑上的 PS3 模拟器,能模拟原版主机的硬件环境来…

作者头像 李华
网站建设 2026/9/8 15:26:07

AI编程工具免费与付费怎么选?从工作流需求出发的选型指南

前两天群里一个朋友问我:“是不是该花20美元订阅Cursor?”我没有直接回答,而是反问他:你每天进IDE的第一件事是写新代码,还是翻旧代码?你手上有没有超过3万行的老工程?你写的代码最后要不要进商…

作者头像 李华
网站建设 2026/9/8 15:25:44

RoboTTT

作者团队与单位分析作者与单位本文由 11 位作者组成,横跨三大机构:NVIDIA(8人):Yevgen Chebotar、Ruijie Zheng、Fengyuan Hu、Yunhao Ge、Jimmy Wu、Tianyuan Dai、Scott Reed、Yuke Zhu、Linxi "Jim" Fan斯…

作者头像 李华