「美版 DeepSeek」第一次交卷:Beam 追到了 GLM-5.2,但差了最新一代一整代
2026 年 10 月 5 日,美国的 Reflection 发布Beam—— 它的第一个开放权重模型。
一天后,法国的 Mistral 发布Mistral Large 4,它有史以来最大的模型。两家在发布时不约而同地选了同一组对照目标:GLM、Kimi、DeepSeek、Qwen。
这篇文章不讲「谁第一」,讲三件更有信息量的事:
① 「美版 DeepSeek」这个外号哪里不对;② 两组能说明格局的第三方数据;③ 两家的商业模式其实在抄同一条路。
一、先把两组第三方数据放在最前面
这两组数字不是厂商说的,是平台侧的:
① Hugging Face:过去一年,中国模型占平台总下载量约 41%
而且是月度下载和累计下载双双超过美国。
② Vercel AI Gateway:开放权重模型处理了平台 56% 的生产 token(2026 年 8 月)
这个比例在去年 12 月还不到 10%。
第二条尤其值得停一下。它说的是生产流量,不是下载量、不是 star 数。
八个月从不到 10% 到 56%—— 这意味着开放权重模型已经不是「研究者的替代品」,
而是真在跑业务。
这两组数据是后面所有对比的背景板:不是因为「西方终于也开源了」值得写,
而是因为开源这条赛道上,追赶的方向和几年前反过来了。
二、「美版 DeepSeek」这个外号,有一半是错的
先说名字的来源。Reflection 成立于2024 年,两位创始人都来自 Google DeepMind:
- CEO Misha Laskin—— 曾负责 Gemini 的reward modeling
- CTO Ioannis Antonoglou—— 参与AlphaGo / AlphaZero,后来领导 Gemini 的RLHF工作
但它最初并不是要做「美版 DeepSeek」。公司一开始聚焦自主编程,
想用强化学习做一个能独立完成复杂任务的系统;而且当时的判断是 ——
西方会持续出现足够强的开放模型,Reflection 可以直接在上面做。
真正改掉这条路线的,是 DeepSeek V3。
按创始人的说法:在中国开放模型快速推进、而西方长期没有对等替代品之后,
公司决定自己训练前沿开放模型,目标逐渐明确为
「把开放模型的前沿带回西方」。
所以「美版 DeepSeek」这个外号,指的是「位置」——西方阵营里对标 DeepSeek 的那一个 ——
而不是「路线」。
而路线恰恰相反。看 Beam 的强化学习规模:
| 项 | 数字 |
|---|---|
| 同时占用的 GPU | 10,500 张 Nvidia GB300 |
| 连续训练时长 | 4 周 |
| 生成的 rollouts | 超过 1 亿 |
最后一轮 RL 就同时占了一万多张最新的 GB300。加上公司融资数十亿美元、
拿到英伟达的大额投资、通过合作锁定大量算力 ——
它是「重量级版 DeepSeek」,不是低成本版。
这一点如果不说清,读者会把「美版 DeepSeek」自动理解成「便宜的那个」,而事实相反。
三、Beam 的定位:不比绝对能力,比「单位算力换多少智能」
Beam 的基本参数:
- MoE 架构,总参 501B,每 token 激活 23B
- 面向coding / reasoning / agent三类负载
- 预训练23.8 万亿 token
- 发布时还在最后的红队测试阶段;权重、技术报告、开发工具计划10 月内放出
它自己主打的是什么?不是绝对能力,是推理效率。
官方宣称:在某些高级推理任务上,Beam 能用GLM-5.2 约 1/4 到 1/3 的推理算力达到相当的性能。
这是一个「单位算力产出」的卖点。Misha 把 Beam 定位成
「mainstay model」(主力模型)——企业可以长期跑的那个,而不是只追排行榜的最大模型。
这个定位并不新鲜:DeepSeek 当初打动市场的逻辑里,也有一部分是
「不在于它是不是第一,而在于达到某个能力要花多少钱」。
但差别在成本结构上:DeepSeek 的叙事里有「低成本」这个前提,
而 Reflection 的前提是一万多张 GB300 和数十亿美元融资。
同一个道理,两种完全不同的实现路径。
四、差距有多大:Beam 追平的是上一代
官方承认Kimi K3 在绝对能力上仍然领先。把基准表摊开看,这个「差一代」是具体的:
| 基准 | Beam | GLM-5.2 | GLM-5.3 | Kimi K3 | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|
| DeepSWE v1.1(Agent 编程) | 44.4 | 44.0 | 61.0 | 68.0 | 74.2 |
| Terminal Bench v2.1 | 80.1 | — | 88.2 | 88.3 | 90.6 |
| Humanity’s Last Exam | 36.2 | — | 42.3 | 46.9 | — |
怎么读这张表
- Beam 44.4 对 GLM-5.2 44.0—— 几乎打平。这是它「追上了上一代」的证据
- 但对 GLM-5.3 的 61.0、Kimi K3 的 68.0、DeepSeek V4.1 Flash 的 74.2—— 差距是一整个代际,不是小数点后的差距
- Terminal Bench 和 HLE 上也是一致的模式:Beam 落在「最新一代中国模型」之下
所以准确的说法是:Beam 把美国的开放模型拉回到了中国顶级模型的附近,
但只追平了上一代的 GLM-5.2,和中国最新一轮开放模型还差大约一代。
五、Mistral Large 4:从零自训的万亿参数,和一份「自测」
Mistral 这边压力更大。两三年前它是开放模型领域最有代表性的公司,
但随着 DeepSeek / Qwen / Kimi / GLM 快速迭代,它在前沿能力榜上的存在感持续下滑。
今年 9 月,CEO Arthur Mensch 在采访里被直接问:Mistral 的模型已经掉出
Artificial Analysis 排名的前 20,是不是被美国和中国落下了?
他当时的回答是:新一代大模型即将发布,公司已规划了明年两代产品;
新融资的很大一部分将用于扩大训练算力,未来可调用的训练算力可能增加约 20 倍。
两周后,Mistral Large 4 发布。
| 项 | 数字 |
|---|---|
| 激活参数 | 52B |
| 总参数 | 1.05 万亿 |
| 视觉编码器 | 16 亿参数 |
| 多模态 | 原生支持 |
| 语言 | 160+ |
| 上下文 | 100 万 token |
| 训练硬件 | 约3,800 张 Nvidia Grace Blackwell |
| 训练地点 | 欧洲、Mistral 自己的数据中心,从零训练 |
| 发布状态 | API 预览已开;完整权重 10 月底放出 |
「从零自训 + 欧洲自有数据中心」是这一版最值得注意的定位选择——
它不只是技术参数,也是商业主张(见第七节)。
它给的三个成绩
- Coding Agent Index:超过 DeepSeek V4 Pro 和 Qwen 3.8 Max,低于 Kimi K3
- Surge AI 盲测(代码质量):3.74—— 低于 Claude Opus 5 的 4.22,
但高于 Kimi K3 的 3.59、GLM-5.3 的 3.60、GLM-5.2 的 3.40 - AutomationBench(657 个跨应用业务流程,含 Gmail / Sheets / Slack / Salesforce):
超过 Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro,低于 GLM-5.3
⚠️ 这里必须写清一条边界:以上数据大部分来自 Mistral 自己的测试,
而且Large 4 还在公开预览阶段,真正的权重尚未放出。
其中 Surge AI 那个第三方盲测是少数非自测的数据点。
六、安全能力:一个不常被提的卖点
Mistral 这次专门介绍了网络安全能力,这在开源模型发布里不常见:
- Artificial Analysis Cyber Index 全球前 5
- 「复现并修复真实漏洞」任务上达到82%——该测试的最高分
- Cybench完成93%的挑战
而它强调的重点不是分数,是机制:Mistral 特意指出,
部分闭源模型因为安全拒答机制,几乎无法完成某些漏洞复现任务;
而开放权重模型允许企业自定义安全策略,可以部署在私有云或本地环境。
这是一个把「开源」当作安全论据、而不是安全风险的论证结构。
它成立与否取决于场景 —— 但作为一种商业话术,它是对「开源更危险」这一常见说法的正面反驳。
七、两家的商业模式,其实在抄同一条路
模型之外,Reflection 和 Mistral 走的是国产厂商已经初步验证过的那条路。
Reflection:全栈 AI 基础设施
- 向上:基础模型 → 推理 → Agent → 软件 → 企业部署
- 向下:算力管理、集群调度,长期自建数据中心
- Misha 给的公式:收入潜力 = 智能密度 × 算力规模 × 企业信任
- 他的论证:开放模型本身不一定直接赚钱,但能创造巨大的推理需求——
就像Kubernetes 本身开源,却推动了云市场 - 它甚至把自己类比早期的 AWS 和 GCP:AWS 起初是亚马逊为了解决自己的服务器基础设施问题,
Google Cloud 来自支撑搜索业务的大规模分布式能力。
Reflection 的逻辑是:为了训练前沿模型,它本来就得解决万亿 token 服务、
数十亿 Agent 沙箱、GPU 调度这些问题 ——这些内部技术最终可以像云计算一样对外输出
Mistral:欧洲版全栈 AI
- 同时建自研模型 + 企业定制平台 + 欧洲算力基础设施
- 主张小而高效、可定制、可部署的开放模型比只追最大规模的通用模型更符合企业需求
- Arthur 的判断:欧洲企业不能把核心 AI 能力建立在「外国厂商是否愿意继续提供服务」之上,
也不能把技术底座交给别国的模型 —— 所以不只是自训模型,还要在欧洲建数据中心
八、两家对「为什么必须开源」的判断,已经趋同
这是全文最值得记的一段。
一个在欧洲、一个在美国,但两位创始人对开放模型的判断越来越接近:
核心判断:AI 市场已经从**「谁能提供最好用的 API」,
走到「谁拥有模型、谁控制基础设施」**。
Misha 把闭源 API 比作「租房」:过去三年,企业调用 OpenAI / Anthropic / Google 的模型,
本质上是租智能。这在市场早期足够简单、足够高效。
但当 AI 真正进入企业核心业务,事情就变了——
「几年前还很小的创业公司长成了大企业,大企业自己也开始真正用 AI,
于是所有权市场自然出现。」
如果要「拥有智能」,就必须能在自己的基础设施上部署模型、控制数据、修改模型、做定制——
而这就要求模型必须足够开放。
Ioannis 从技术角度补了一句:最前沿的开放模型和闭源模型的差距在缩小,
「没有技术原因决定开放模型必须永远落后」。只要人才和算力足够,
开放模型完全有能力达到闭源模型的水平。过去企业不用开放模型,核心原因只是「能力不够」;
现在一批中国开放模型已经能直接替代闭源模型完成大量任务,商业迁移的前提已经成立。
Arthur 的判断几乎一样:随着开放模型能力提升,大量企业不再需要为闭源模型继续支付 API 溢价。
他最近说,Mistral 接触到的约 99% 的企业场景,都可以用开放模型完成。
九、那为什么过去一年是中国模型跑在前面?
两家对这个问题的判断也高度一致,而且都不是「某一家公司运气好」。
Misha 的解释(历史视角):美国其实曾经拥有最强的开放模型,Llama 3 是一个明显节点。
但当时美国的 AI 商业市场由 API 主导,
Meta 或其他公司没有足够强的商业动机去持续开放最前沿的能力。
中国的情况不同。DeepSeek V3 是一个重要转折点——
中国的开放「智能」第一次在全球形成规模化影响,此后出现了更集中的开放模型推进。
Misha 认为,其中很大一部分动力来自「建设自己的开放权重生态本身就有产业和战略价值」。
他还补了一句很实在的:
「事实上,这些中国实验室直到最近都没怎么赚钱。
只有现在,它们的模型能力足够强、市场也成熟到愿意为开放智能付费,才开始产生真正的收入。」
Arthur 的解释(工程视角):中国顶尖实验室的算力低于美国几家最大的 AI 公司,但仍高于 Mistral;
同时它们会充分利用互联网上的数据,而且迭代方式已经工业化。
这些条件让它们能够快速迭代。
小结
- 「美版 DeepSeek」指的是位置,不是路线。Reflection 的最后一轮 RL 就占了10,500 张 GB300、跑了 4 周—— 它是重量级版,不是低成本版
- Beam 追平的是上一代:DeepSWE v1.1 上 44.4 对 GLM-5.2 的 44.0 几乎打平,但对 GLM-5.3(61.0)、Kimi K3(68.0)、DeepSeek V4.1 Flash(74.2)差一整代。官方也承认 Kimi K3 仍领先
- 它的卖点是「单位算力产出」,定位主力模型而非排行榜模型
- Mistral Large 4 = 52B 激活 / 1.05T 总参 / 100 万上下文 / 160+ 语言,在欧洲自有数据中心、约 3,800 张 GB300 上从零训练;权重 10 月底才放,且多数成绩来自自测
- 两组第三方数据是最硬的背景:Hugging Face 过去一年中国模型占约41%下载;Vercel AI Gateway 上开放权重模型处理了56%的生产 token(去年 12 月不到 10%)
- 商业模式趋同:两家都在往「全栈」走(模型 → 推理 → 部署 → 算力),区别是 Reflection 讲美国式全栈、Mistral 讲欧洲主权全栈
- 判断趋同:市场从「租智能」转向「拥有智能」;开放与闭源的能力差距在缩小;没有技术原因决定开放模型必须永远落后
参考资料
| 内容 | 来源 | 页面日期 | 核验时间 |
|---|---|---|---|
| 全部模型参数、基准表、Hugging Face 41% / Vercel 56% 两组数据、创始背景与引语、商业模式、对中国模型的判断 | Overseas open-source models are accelerating their development pace again: Mistral and the “US version of DeepSeek” show their hands simultaneously — 36Kr(InfoQ 稿) | 2026-10-08 | 2026-10-09 |
| 事件交叉确认(标题与同日发布) | 海外开源模型重新提速:"美版 DeepSeek"第一次交卷,Mistral同时亮牌 — InfoQ | 2026-10-08 | 标题与日期已核;正文未读取(页面正文被截断) |
| Mistral Large 4 的独立报道(用于确认万亿参数与开放权重时间点) | Mistral推出万亿参数开放权重模型 Mistral Large 4 | 2026-10-07 | 2026-10-09 |
⚠️ 核验边界(必须写明)
- 基准数字(Beam 的 DeepSWE / Terminal Bench / HLE,Mistral 的 Coding Agent Index / Surge AI 盲测 / AutomationBench / Cyber Index)全部来自厂商自测或厂商转述的第三方测试,
本文只做转述,不做独立复现。- Mistral Large 4 的完整权重 10 月底才发布—— 在此之前所有能力数字都应视为预览阶段的自测结果。
- Beam 的权重、技术报告、开发工具在撰写时也尚未放出(官方计划 10 月内)。
- Hugging Face 的 41% 与 Vercel 的 56%是本文引用的两组关键第三方数据,
但均为二手转述(来自 36Kr / InfoQ 文章),未直接访问两个平台的原始数据源。- 「美版 DeepSeek」是媒体叫法,不是 Reflection 的官方定位。