AI前沿 | 2026年9月28日:Gemini 4 Pro 检查点曝光 + 1000 万 Token 上下文 + Terminal-bench 95.3% 实测
📖首屏导读 · 本教程配套付费专栏:《大模型工程师修炼手记》
19.9 元(AI 编程 · Agent 实战 · 本文同主题系统课程)· 《AI时代程序员的自我提升》49.9 元(AI 时代成长方法论)单篇不过瘾?订阅解锁全量源码、实战与答疑;文末附资料包领取方式 ↓
📊本期导读:9 月 27 日晚,一批 Gemini 4 Pro 的新检查点流入社区,一周之内前沿模型的竞争叙事被彻底改写。本文做四件事:① 把已确认 / 仅泄露的信息严格分层(上下文 1000 万 Token、输出 256K、定价 $2.25/$11.25全部未官宣);② 逐个复盘 7 个被多方验证的 Demo,指出它们真正证明了什么、以及没证明什么;③ 拆解 DeepMind 新掌门 Koray Kavukcuoglu 罕见的公开表态里最被忽略的一条——Gemini 4 的研发正在反向定义未来两到三代 TPU;④ 算一笔账:如果你现在的 Agent 流水线每月消耗 5000 万输入 Token,换到 $2.25 的价意味着什么。给创业者的核心判断是:旗舰模型的价格锚可能再次下移一档,但同时「模型自己定义芯片」意味着自研栈厂商的垂直整合护城河在变厚。
一、先把信息分层:哪些是官方的,哪些是泄露的
这是读这类「半成品模型曝光」新闻最容易出错的地方——把泄露当成官宣,然后按错误的价格重算成本。所以本文第一件事是把信息分层:
| 层级 | 项目 | 内容 | 可信度 |
|---|---|---|---|
| 官方确认 | 预训练节奏 | 7 月启动,约两个月基本结束早期预训练,已全面进入后训练 | 高(Koray 公开受访) |
| 官方确认 | 发布意愿 | 「尽可能快地发布一个早期后训练版本」「远早于年底」 | 高 |
| 官方确认 | 内部使用 | Gemini 4 正被谷歌内部工程师用于Antigravity AI | 高 |
| 官方确认 | 目标重定义 | 不再执着 AGI 概念——「真正的问题是,我们是否有能力构建出可以完全信任的智能体」 | 高 |
| 泄露 | 上下文窗口 | 1000 万 Token(原生) | 中(多源一致,无官宣) |
| 泄露 | 输出上限 | 256K Token | 中 |
| 泄露 | 定价 | 输入$2.25/ 输出$11.25每百万 Token | 中 |
| 泄露 | 发布时点 | 11 月 | 低(消息源推测) |
| 流传截图 | 基准 | DeepSWE v1.188%、Terminal-bench 2.195.3%,称编程/智能体/推理均超 GPT-6 Astra 与 Claude Fable 5.1 | 低(无独立复现) |
| 社区观察 | 检查点代号 | 内部代号barium-b,社区称 Checkpoint 2 | 中 |
⚠️本文的立场:泄露部分全部标注,不作为你做技术选型或成本测算的唯一依据。但它们值得认真读——因为泄露的规格组合本身,就在告诉你谷歌这一代要打什么牌。
二、7 个 Demo 到底证明了什么,以及没证明什么
这是本文信息密度最高的一段。我把社区流传的高质量实测逐个拆开,只回答两个问题:这个 Demo 在测什么?它通过了什么?没通过什么?
| # | 实测(社区/博主) | 任务本质在测什么 | 观察者结论 | 保留意见 |
|---|---|---|---|---|
| 1 | 3D 浮筒飞机水面滑行起飞(@AI_Screening,对标 Opus 5.5) | 物理引擎代码 + 流体力学反馈的一致性 | 「Opus 飞机在动但晃动剧烈、水面反馈生硬;Gemini 4 Pro 加速平稳、水面反射清晰、溅水逼真」 | 单次生成,无重复实验 |
| 2 | 16 分钟纯代码生成 3D 国际空间站绕地模拟(@thtbee_) | 零资产依赖下的建模 + 素材自取能力 | 自己用 Three.js 建模,并主动抓取正确地球贴图以保证经纬度和颜色准确 | UI 界面被吐槽「有点丑」;背面仍有透视 bug |
| 3 | Three.js「灯塔变火箭发射,不含任何 UI」(@HarshithLucky3) | 指令遵循+ 视觉审美 | 严格不含 UI;所有元素加了质感极佳的纹理 | 审美在不同部件上不稳定 |
| 4 | 3D 任天堂 Wii 遥控器建模(@LuminaBench) | 工业设计级细节还原 | 细节把握强、生成速度「快得难以置信」 | 存在过度雕琢:没要求的也拼命加细节;部分部件违和 |
| 5 | 机器蜂鸟(@TimJayas,「祖传」prompt,对标 GPT-6 Sol) | 复杂机械结构 + 动态行为理解 | 「质量与 Fable 旗鼓相当,但远好于 GPT-6 Sol」 | 同时承认有时被 GPT-6 Astra 碾压 |
| 6 | 14 分钟生成前后端完整产品展示站 | 全栈工程产出速度 | 「真的就是几分钟一个网站」 | 未见后端可运行性验证 |
| 7 | 单提示词直接吐出可交互网页游戏 | 一次性交付完整可玩物 | 多人反馈一致 | 玩法深度、bug 率未披露 |
把七个 Demo 合起来看,真正能得出的结论只有三条:
- 长文本代码构建的「一次性交付率」明显提升。16 分钟出一套 3D 空间站、14 分钟出一套全栈站、单提示词出可玩游戏——这三个数字指向同一件事:首版可用率(first-pass usable rate)在涨。这比任何基准分数都更贴近工程价值。
- 视觉/3D 感知与生成是这一代的主战场。七个 Demo 里有五个是 3D/视觉。而且第 2 条里「主动去网上抓正确地球贴图」——这是主动工具使用 + 事实核对的组合行为,属于 Agent 能力而非纯生成能力。
- 「过度雕琢」是一个需要管理的新缺陷类型。第 4 条明确指出:你没要求的它也拼命加。对工程交付这是负资产——需求边界控制,正在取代「幻觉」成为新的主要抱怨点。
💡一个容易被忽略的判断:这些 Demo 全部是「高新颖度、低验收标准」的任务(3D 场景、视觉玩具)。这类任务最容易产生 impressive 的观感,也最难证伪。真正决定生产力的任务形态是「低新颖度、高验收标准」——改一个两周的老系统、迁移一个真实的数据库、修一个有明确回归测试的 bug。这两类任务上,Checkpoint 2 的表现目前没有任何公开实测。这也是我认为这些 Demo 不能直接当采购依据的原因。
三、最被忽略的一条:Gemini 4 正在反向定义未来两到三代 TPU
在这波曝光里,几乎所有讨论都集中在「3D 生成的 Demo 好震撼」,但信息量最大的一句被埋掉了——Koray Kavukcuoglu 在访谈中提到:Gemini 4 的研发,正在帮助谷歌的硬件工程师设计「未来两到三代的 TPU」。
为什么这件事比跑分重要?把它翻译成一句工程师听得懂的话:
- 1000 万 Token 上下文这个规格,对硬件的要求不是「更多 HBM」,而是注意力路径的访存效率。当整个网络趋向 local/sparse(下面第三节的 Naive-N0.5-Flash 是极端版本),芯片要优化的瓶颈从「算力峰值」转到了「长程数据搬运与稀疏访问」。
- 因此,芯片的迭代方向开始由模型的训练与推理形态决定,而不是反过来。一旦模型方能自己改硬件,通用推理供应商(英伟达生态)面临的竞争就不再是「谁的卡更快」,而是「谁的模型与卡是一起长出来的」。
- 这也解释了本周另一条新闻为什么重要:Brookings 估算美国 AI 基建投资 2025–2032 年累计 10.3 万亿美元,年均约占 GDP 3.6%,将是美国史上单一行业占 GDP 比重最大的基建浪潮,超过铁路峰值(2.24%)——在如此规模上,芯片路线不能出错。垂直整合因此不是偏好,是必须。
💡对创业者的直接含义:如果你在做推理层(网关、路由、缓存、量化、推理优化),未来的护城河不会是「我接了更多家 API」,而会是「我理解这些模型在硬件上怎么跑」。本周另一个数据点可以印证这条:llama.cpp 的 prompt-lookup 投机解码经四项优化后,单 token 起草延迟从 165.48µs 降到 1.18µs(约 42 倍),叠加 Daniel Lemire 的阈值检查优化可达约 140 倍;静态缓存加载从 3.76 秒降到 0.23 秒(541MB)。这类「推理系统级」优化,才是长上下文时代的真实杠杆。
四、算一笔账:如果 $2.25 / $11.25 坐实,你的成本模型会怎么变
用一组常见的中等规模 Agent 负载做敏感性测算(仅为推演,请以你实际调用到正式版后的价格重算):
假设:日均 200 万输入 Token / 80 万输出 Token,月度 30 天。
| 场景 | 输入单价 | 输出单价 | 月度输入成本 | 月度输出成本 | 月度合计 |
|---|---|---|---|---|---|
| 泄露定价(Gemini 4 Pro) | $2.25/百万 | $11.25/百万 | 约 $135 | 约 $270 | 约 $405 |
| 上一档旗舰(量级参考,$5 / $25) | $5 | $25 | 约 $300 | 约 $600 | 约 $900 |
| 高档旗舰(量级参考,$10 / $50) | $10 | $50 | 约 $600 | 约 $1200 | 约 $1800 |
结论有三层:
- 同一负载下换成 $2.25/$11.25,账单直接砍掉 55%–78%。对一家每月在推理上花 $2 万的团队,这是每月省下的 $1.1 万–$1.5 万——足以覆盖一个小型推理优化团队的半年成本。
- 但输出价是真正的杠杆点,不是输入价。Agent 负载里输出(包括思维链与工具调用轨迹)通常占成本 60% 以上,而输出单价是输入的 5 倍。要降本,先降输出:更短的思维链、更少的无效重试、更短的工具返回体(截断而非全量塞回上下文)。
- 1000 万上下文不是让你「多用」的工具,而是让你「少用重复」的工具。一旦整个仓库能一次性放进上下文,你可以删掉大量 RAG 的检索-重排-重读链路——这省的不只是检索 API 的钱,更是检索错误导致的重试成本,那部分通常比 token 本身贵一个数量级。
💡可执行的三条:① 今天就把你的 Agent 负载按「输入 / 思维链 / 工具返回 / 最终答案」四类打点,跑一个月,看清楚哪一类占比最高;② 针对占比最高的那一类设计压缩策略,而不是笼统地说「换个便宜的模型」;③ 在正式版到来前,别急着迁移——用 A/B 把现有模型和候选模型在你自己的真实任务集上对比,至少 50 条,Checkpoint 的 Demo 帮不了你这个忙。
五、风险清单:这份曝光里可能让人踩坑的五个地方
- Checkpoint ≠ 正式版。社区自己的说法是「第二个检查点比第一个有了肉眼可见的巨大飞跃,谷歌这次是真的在烹饪一道大菜」——这恰恰说明第一个和第二个之间的波动幅度极大。用 Checkpoint 2 的能力推断正式版,是一次外推风险极高的操作。
- 没有任何独立基准复现。88% / 95.3% 全部来自流传截图,第三方机构尚未跑出可验证结果。没有独立复现的分数,在采购谈判里是不成立的。
- 11 月这个时点只有消息源推测。Koray 说的是「远早于年底」,两者不是一回事。把它当规划参考,不要当排期依赖。
- 审美不稳定被系统性低估了。多个测试者独立提到「不同部件上表现不太稳定,有些绝佳、有些违和」。对于面向客户交付的产品,「稳定的中等」远好于「不稳定的惊艳」。
- 2026 年 9 月初 Gemini 3.5 Pro 已经跳票过一次。社区此前记录:谷歌原计划发布的 Gemini 3.5 Pro 延期,内部候选模型因未能超越 Flash 系列被直接废弃。一个跳票过一代的团队,它的时间表本身就有更高的方差。
📚 本文信息来源汇总
- 新智元(经 AITNT 转载,2026-09-27 23:12):《刚刚,Gemini 4 Pro 全新曝光,实测碾压 Opus 5.5!》
- The Information:Google DeepMind 掌门人 Koray Kavukcuoglu 访谈(Gemini 4 预训练节奏、Antigravity AI、TPU 协同设计、发布态度)
- 社区一手实测:X @alannnfx(检查点流出)、@AI_Screening(浮筒飞机)、@thtbee_(16 分钟 3D 空间站)、@HarshithLucky3(灯塔→火箭)、@LuminaBench(Wii 遥控器)、@TimJayas(机械蜂鸟)
- Seeking Alpha / Brookings(哥伦比亚大学 Stijn van Nieuwerburgh):美国 AI 基建 10.3 万亿美元估算,2026-09-25
- jadidbourbaki.github.io(2026-09-26):llama.cpp prompt-lookup 投机解码优化,约 42×–140×
⚠️免责声明:本文中Gemini 4 Pro 的上下文窗口、输出上限、定价、基准分数与发布时点均来自社区泄露与截图流传,谷歌尚未官方确认,请以谷歌官方发布为准。文中成本测算是基于假设负载的推演,不构成采购建议。图表由本号基于上述公开数据绘制,仅供信息参考。
📖配套付费专栏:《大模型工程师修炼手记》19.9 元—— AI 编程 · Agent 工程实战 · 本文同主题系统课程《AI时代程序员的自我提升》49.9 元—— AI 时代成长方法论
单篇不过瘾?订阅解锁全量源码、实战与答疑;文末附资料包领取方式 ↓
📚 延伸阅读 · 我的付费专栏
觉得这篇文章对你有帮助?我把同类主题的系统化内容沉淀成了付费专栏,欢迎订阅支持持续输出:
| 专栏 | 定价 | 内容 |
|---|---|---|
| 大模型工程师修炼手记 | 19.9 元 | AI 编程 / Agent 深度实战 |
| AI时代程序员的自我提升 | 49.9 元 | AI 时代成长方法论 |
💡 一杯咖啡的价格,换来系统化的知识体系;你的订阅,是我持续创作的最大动力。
💬本文配套代码 / 资料包:欢迎在评论区留言「求代码」,我会私信发送完整资源!