news 2026/10/11 4:30:33

「美版 DeepSeek」第一次交卷:Beam 追到了 GLM-5.2,但差了最新一代一整代

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
「美版 DeepSeek」第一次交卷:Beam 追到了 GLM-5.2,但差了最新一代一整代

「美版 DeepSeek」第一次交卷:Beam 追到了 GLM-5.2,但差了最新一代一整代

2026 年 10 月 5 日,美国的 Reflection 发布Beam—— 它的第一个开放权重模型。
一天后,法国的 Mistral 发布Mistral Large 4,它有史以来最大的模型。

两家在发布时不约而同地选了同一组对照目标:GLM、Kimi、DeepSeek、Qwen。

这篇文章不讲「谁第一」,讲三件更有信息量的事:
① 「美版 DeepSeek」这个外号哪里不对;② 两组能说明格局的第三方数据;③ 两家的商业模式其实在抄同一条路。

一、先把两组第三方数据放在最前面

这两组数字不是厂商说的,是平台侧的:

① Hugging Face:过去一年,中国模型占平台总下载量约 41%

而且是月度下载和累计下载双双超过美国。

② Vercel AI Gateway:开放权重模型处理了平台 56% 的生产 token(2026 年 8 月)

这个比例在去年 12 月还不到 10%。

第二条尤其值得停一下。它说的是生产流量,不是下载量、不是 star 数。
八个月从不到 10% 到 56%—— 这意味着开放权重模型已经不是「研究者的替代品」,
而是真在跑业务。

这两组数据是后面所有对比的背景板:不是因为「西方终于也开源了」值得写,
而是因为开源这条赛道上,追赶的方向和几年前反过来了。

二、「美版 DeepSeek」这个外号,有一半是错的

先说名字的来源。Reflection 成立于2024 年,两位创始人都来自 Google DeepMind:

  • CEO Misha Laskin—— 曾负责 Gemini 的reward modeling
  • CTO Ioannis Antonoglou—— 参与AlphaGo / AlphaZero,后来领导 Gemini 的RLHF工作

但它最初并不是要做「美版 DeepSeek」。公司一开始聚焦自主编程,
想用强化学习做一个能独立完成复杂任务的系统;而且当时的判断是 ——
西方会持续出现足够强的开放模型,Reflection 可以直接在上面做。

真正改掉这条路线的,是 DeepSeek V3。

按创始人的说法:在中国开放模型快速推进、而西方长期没有对等替代品之后,
公司决定自己训练前沿开放模型,目标逐渐明确为
「把开放模型的前沿带回西方」。

所以「美版 DeepSeek」这个外号,指的是「位置」——西方阵营里对标 DeepSeek 的那一个 ——
而不是「路线」。

而路线恰恰相反。看 Beam 的强化学习规模:

项数字
同时占用的 GPU10,500 张 Nvidia GB300
连续训练时长4 周
生成的 rollouts超过 1 亿

最后一轮 RL 就同时占了一万多张最新的 GB300。加上公司融资数十亿美元、
拿到英伟达的大额投资、通过合作锁定大量算力 ——

它是「重量级版 DeepSeek」,不是低成本版。
这一点如果不说清,读者会把「美版 DeepSeek」自动理解成「便宜的那个」,而事实相反。

三、Beam 的定位:不比绝对能力,比「单位算力换多少智能」

Beam 的基本参数:

  • MoE 架构,总参 501B,每 token 激活 23B
  • 面向coding / reasoning / agent三类负载
  • 预训练23.8 万亿 token
  • 发布时还在最后的红队测试阶段;权重、技术报告、开发工具计划10 月内放出

它自己主打的是什么?不是绝对能力,是推理效率。

官方宣称:在某些高级推理任务上,Beam 能用GLM-5.2 约 1/4 到 1/3 的推理算力达到相当的性能。

这是一个「单位算力产出」的卖点。Misha 把 Beam 定位成
「mainstay model」(主力模型)——企业可以长期跑的那个,而不是只追排行榜的最大模型。

这个定位并不新鲜:DeepSeek 当初打动市场的逻辑里,也有一部分是
「不在于它是不是第一,而在于达到某个能力要花多少钱」。

但差别在成本结构上:DeepSeek 的叙事里有「低成本」这个前提,
而 Reflection 的前提是一万多张 GB300 和数十亿美元融资。
同一个道理,两种完全不同的实现路径。

四、差距有多大:Beam 追平的是上一代

官方承认Kimi K3 在绝对能力上仍然领先。把基准表摊开看,这个「差一代」是具体的:

基准BeamGLM-5.2GLM-5.3Kimi K3DeepSeek V4.1 Flash
DeepSWE v1.1(Agent 编程)44.444.061.068.074.2
Terminal Bench v2.180.1—88.288.390.6
Humanity’s Last Exam36.2—42.346.9—

怎么读这张表

  • Beam 44.4 对 GLM-5.2 44.0—— 几乎打平。这是它「追上了上一代」的证据
  • 但对 GLM-5.3 的 61.0、Kimi K3 的 68.0、DeepSeek V4.1 Flash 的 74.2—— 差距是一整个代际,不是小数点后的差距
  • Terminal Bench 和 HLE 上也是一致的模式:Beam 落在「最新一代中国模型」之下

所以准确的说法是:Beam 把美国的开放模型拉回到了中国顶级模型的附近,
但只追平了上一代的 GLM-5.2,和中国最新一轮开放模型还差大约一代。

五、Mistral Large 4:从零自训的万亿参数,和一份「自测」

Mistral 这边压力更大。两三年前它是开放模型领域最有代表性的公司,
但随着 DeepSeek / Qwen / Kimi / GLM 快速迭代,它在前沿能力榜上的存在感持续下滑。

今年 9 月,CEO Arthur Mensch 在采访里被直接问:Mistral 的模型已经掉出
Artificial Analysis 排名的前 20,是不是被美国和中国落下了?

他当时的回答是:新一代大模型即将发布,公司已规划了明年两代产品;
新融资的很大一部分将用于扩大训练算力,未来可调用的训练算力可能增加约 20 倍。

两周后,Mistral Large 4 发布。

项数字
激活参数52B
总参数1.05 万亿
视觉编码器16 亿参数
多模态原生支持
语言160+
上下文100 万 token
训练硬件约3,800 张 Nvidia Grace Blackwell
训练地点欧洲、Mistral 自己的数据中心,从零训练
发布状态API 预览已开;完整权重 10 月底放出

「从零自训 + 欧洲自有数据中心」是这一版最值得注意的定位选择——
它不只是技术参数,也是商业主张(见第七节)。

它给的三个成绩

  • Coding Agent Index:超过 DeepSeek V4 Pro 和 Qwen 3.8 Max,低于 Kimi K3
  • Surge AI 盲测(代码质量):3.74—— 低于 Claude Opus 5 的 4.22,
    但高于 Kimi K3 的 3.59、GLM-5.3 的 3.60、GLM-5.2 的 3.40
  • AutomationBench(657 个跨应用业务流程,含 Gmail / Sheets / Slack / Salesforce):
    超过 Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro,低于 GLM-5.3

⚠️ 这里必须写清一条边界:以上数据大部分来自 Mistral 自己的测试,
而且Large 4 还在公开预览阶段,真正的权重尚未放出。
其中 Surge AI 那个第三方盲测是少数非自测的数据点。

六、安全能力:一个不常被提的卖点

Mistral 这次专门介绍了网络安全能力,这在开源模型发布里不常见:

  • Artificial Analysis Cyber Index 全球前 5
  • 「复现并修复真实漏洞」任务上达到82%——该测试的最高分
  • Cybench完成93%的挑战

而它强调的重点不是分数,是机制:Mistral 特意指出,
部分闭源模型因为安全拒答机制,几乎无法完成某些漏洞复现任务;
而开放权重模型允许企业自定义安全策略,可以部署在私有云或本地环境。

这是一个把「开源」当作安全论据、而不是安全风险的论证结构。
它成立与否取决于场景 —— 但作为一种商业话术,它是对「开源更危险」这一常见说法的正面反驳。

七、两家的商业模式,其实在抄同一条路

模型之外,Reflection 和 Mistral 走的是国产厂商已经初步验证过的那条路。

Reflection:全栈 AI 基础设施

  • 向上:基础模型 → 推理 → Agent → 软件 → 企业部署
  • 向下:算力管理、集群调度,长期自建数据中心
  • Misha 给的公式:收入潜力 = 智能密度 × 算力规模 × 企业信任
  • 他的论证:开放模型本身不一定直接赚钱,但能创造巨大的推理需求——
    就像Kubernetes 本身开源,却推动了云市场
  • 它甚至把自己类比早期的 AWS 和 GCP:AWS 起初是亚马逊为了解决自己的服务器基础设施问题,
    Google Cloud 来自支撑搜索业务的大规模分布式能力。
    Reflection 的逻辑是:为了训练前沿模型,它本来就得解决万亿 token 服务、
    数十亿 Agent 沙箱、GPU 调度这些问题 ——这些内部技术最终可以像云计算一样对外输出

Mistral:欧洲版全栈 AI

  • 同时建自研模型 + 企业定制平台 + 欧洲算力基础设施
  • 主张小而高效、可定制、可部署的开放模型比只追最大规模的通用模型更符合企业需求
  • Arthur 的判断:欧洲企业不能把核心 AI 能力建立在「外国厂商是否愿意继续提供服务」之上,
    也不能把技术底座交给别国的模型 —— 所以不只是自训模型,还要在欧洲建数据中心

八、两家对「为什么必须开源」的判断,已经趋同

这是全文最值得记的一段。

一个在欧洲、一个在美国,但两位创始人对开放模型的判断越来越接近:

核心判断:AI 市场已经从**「谁能提供最好用的 API」,
走到
「谁拥有模型、谁控制基础设施」**。

Misha 把闭源 API 比作「租房」:过去三年,企业调用 OpenAI / Anthropic / Google 的模型,
本质上是租智能。这在市场早期足够简单、足够高效。
但当 AI 真正进入企业核心业务,事情就变了——
「几年前还很小的创业公司长成了大企业,大企业自己也开始真正用 AI,
于是所有权市场自然出现。」

如果要「拥有智能」,就必须能在自己的基础设施上部署模型、控制数据、修改模型、做定制——
而这就要求模型必须足够开放。

Ioannis 从技术角度补了一句:最前沿的开放模型和闭源模型的差距在缩小,
「没有技术原因决定开放模型必须永远落后」。只要人才和算力足够,
开放模型完全有能力达到闭源模型的水平。过去企业不用开放模型,核心原因只是「能力不够」;
现在一批中国开放模型已经能直接替代闭源模型完成大量任务,商业迁移的前提已经成立。

Arthur 的判断几乎一样:随着开放模型能力提升,大量企业不再需要为闭源模型继续支付 API 溢价。
他最近说,Mistral 接触到的约 99% 的企业场景,都可以用开放模型完成。

九、那为什么过去一年是中国模型跑在前面?

两家对这个问题的判断也高度一致,而且都不是「某一家公司运气好」。

Misha 的解释(历史视角):美国其实曾经拥有最强的开放模型,Llama 3 是一个明显节点。
但当时美国的 AI 商业市场由 API 主导,
Meta 或其他公司没有足够强的商业动机去持续开放最前沿的能力。

中国的情况不同。DeepSeek V3 是一个重要转折点——
中国的开放「智能」第一次在全球形成规模化影响,此后出现了更集中的开放模型推进。
Misha 认为,其中很大一部分动力来自「建设自己的开放权重生态本身就有产业和战略价值」。

他还补了一句很实在的:

「事实上,这些中国实验室直到最近都没怎么赚钱。
只有现在,它们的模型能力足够强、市场也成熟到愿意为开放智能付费,才开始产生真正的收入。」

Arthur 的解释(工程视角):中国顶尖实验室的算力低于美国几家最大的 AI 公司,但仍高于 Mistral;
同时它们会充分利用互联网上的数据,而且迭代方式已经工业化。
这些条件让它们能够快速迭代。

小结

  • 「美版 DeepSeek」指的是位置,不是路线。Reflection 的最后一轮 RL 就占了10,500 张 GB300、跑了 4 周—— 它是重量级版,不是低成本版
  • Beam 追平的是上一代:DeepSWE v1.1 上 44.4 对 GLM-5.2 的 44.0 几乎打平,但对 GLM-5.3(61.0)、Kimi K3(68.0)、DeepSeek V4.1 Flash(74.2)差一整代。官方也承认 Kimi K3 仍领先
  • 它的卖点是「单位算力产出」,定位主力模型而非排行榜模型
  • Mistral Large 4 = 52B 激活 / 1.05T 总参 / 100 万上下文 / 160+ 语言,在欧洲自有数据中心、约 3,800 张 GB300 上从零训练;权重 10 月底才放,且多数成绩来自自测
  • 两组第三方数据是最硬的背景:Hugging Face 过去一年中国模型占约41%下载;Vercel AI Gateway 上开放权重模型处理了56%的生产 token(去年 12 月不到 10%)
  • 商业模式趋同:两家都在往「全栈」走(模型 → 推理 → 部署 → 算力),区别是 Reflection 讲美国式全栈、Mistral 讲欧洲主权全栈
  • 判断趋同:市场从「租智能」转向「拥有智能」;开放与闭源的能力差距在缩小;没有技术原因决定开放模型必须永远落后

参考资料

内容来源页面日期核验时间
全部模型参数、基准表、Hugging Face 41% / Vercel 56% 两组数据、创始背景与引语、商业模式、对中国模型的判断Overseas open-source models are accelerating their development pace again: Mistral and the “US version of DeepSeek” show their hands simultaneously — 36Kr(InfoQ 稿)2026-10-082026-10-09
事件交叉确认(标题与同日发布)海外开源模型重新提速:"美版 DeepSeek"第一次交卷,Mistral同时亮牌 — InfoQ2026-10-08标题与日期已核;正文未读取(页面正文被截断)
Mistral Large 4 的独立报道(用于确认万亿参数与开放权重时间点)Mistral推出万亿参数开放权重模型 Mistral Large 42026-10-072026-10-09

⚠️ 核验边界(必须写明)

  • 基准数字(Beam 的 DeepSWE / Terminal Bench / HLE,Mistral 的 Coding Agent Index / Surge AI 盲测 / AutomationBench / Cyber Index)全部来自厂商自测或厂商转述的第三方测试,
    本文只做转述,不做独立复现。
  • Mistral Large 4 的完整权重 10 月底才发布—— 在此之前所有能力数字都应视为预览阶段的自测结果。
  • Beam 的权重、技术报告、开发工具在撰写时也尚未放出(官方计划 10 月内)。
  • Hugging Face 的 41% 与 Vercel 的 56%是本文引用的两组关键第三方数据,
    但均为二手转述(来自 36Kr / InfoQ 文章),未直接访问两个平台的原始数据源。
  • 「美版 DeepSeek」是媒体叫法,不是 Reflection 的官方定位。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 4:30:00

PS5局域网串流工具AnyPS5:架构拆解与延迟调优实战

上个月我把 PS5 从客厅挪到书房,接了一块旧显示器之后,突然冒出一个很实际的想法:在客厅玩游戏的时候,能不能顺手把画面切到书房的电脑屏幕上继续?不想买第二台主机,也不想在家里拉一条很长的 HDMI 线。于是…

作者头像 李华
网站建设 2026/10/11 4:29:19

BK7238(XH-WB3S)新手入门指南(AT指令篇:常用指令)!

三、常用指令篇 源码和BIN文件资料参考:https://github.com/Sparkleiot/bk7238-at-esp32c3-compat 3.1 AT 常用 1、读取 IO 状态 ATCIOREAD26 26 为 GPIO26,返回值 0:LOW(低电平) OK 2、设置 IO 口状态 ATCIOWRITE26,1 …

作者头像 李华
网站建设 2026/10/11 4:27:26

Visio2013安装全指南:从RAR校验到避坑部署

简介:这是一款Visio2013完整安装包资源,为需要在Windows平台绘制流程图、组织架构图、工程图表及机房拓扑图的用户提供离线安装方案。压缩包内共包含226个文件,以cab压缩组件、msi安装模块、dll运行库及xml配置文件为主,同时带有c…

作者头像 李华
网站建设 2026/10/11 4:27:15

Nginx安全加固实战:配置、限流与HTTPS防护

部署一台Nginx很容易,但把一台Nginx配置到"安全"状态,很多人其实没认真想过。我接触过不少项目,应用代码写得不错,结果Nginx层漏成了筛子——目录列表开着、管理后台裸奔、错误信息把内部IP打得到处都是、4核机器被一个…

作者头像 李华
网站建设 2026/10/11 4:26:31

启动Flink报错:[ERROR] Could not get JVM parameters properly.

报错:Starting cluster. Starting standalonesession daemon on host master.localdomain. [ERROR] Could not get JVM parameters properly. [ERROR] Could not get JVM parameters properly. [ERROR] Could not get JVM parameters properly.解决方法:…

作者头像 李华