news 2026/9/29 20:06:48

AI前沿 | 2026年9月28日:Gemini 4 Pro 检查点曝光 + 1000 万 Token 上下文 + Terminal-bench 95.3% 实测

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI前沿 | 2026年9月28日:Gemini 4 Pro 检查点曝光 + 1000 万 Token 上下文 + Terminal-bench 95.3% 实测

AI前沿 | 2026年9月28日:Gemini 4 Pro 检查点曝光 + 1000 万 Token 上下文 + Terminal-bench 95.3% 实测

📖首屏导读 · 本教程配套付费专栏:《大模型工程师修炼手记》19.9 元(AI 编程 · Agent 实战 · 本文同主题系统课程)· 《AI时代程序员的自我提升》49.9 元(AI 时代成长方法论)

单篇不过瘾?订阅解锁全量源码、实战与答疑;文末附资料包领取方式 ↓

📊本期导读:9 月 27 日晚,一批 Gemini 4 Pro 的新检查点流入社区,一周之内前沿模型的竞争叙事被彻底改写。本文做四件事:① 把已确认 / 仅泄露的信息严格分层(上下文 1000 万 Token、输出 256K、定价 $2.25/$11.25全部未官宣);② 逐个复盘 7 个被多方验证的 Demo,指出它们真正证明了什么、以及没证明什么;③ 拆解 DeepMind 新掌门 Koray Kavukcuoglu 罕见的公开表态里最被忽略的一条——Gemini 4 的研发正在反向定义未来两到三代 TPU;④ 算一笔账:如果你现在的 Agent 流水线每月消耗 5000 万输入 Token,换到 $2.25 的价意味着什么。给创业者的核心判断是:旗舰模型的价格锚可能再次下移一档,但同时「模型自己定义芯片」意味着自研栈厂商的垂直整合护城河在变厚。

一、先把信息分层:哪些是官方的,哪些是泄露的

这是读这类「半成品模型曝光」新闻最容易出错的地方——把泄露当成官宣,然后按错误的价格重算成本。所以本文第一件事是把信息分层:

层级项目内容可信度
官方确认预训练节奏7 月启动,约两个月基本结束早期预训练,已全面进入后训练高(Koray 公开受访)
官方确认发布意愿「尽可能快地发布一个早期后训练版本」「远早于年底」高
官方确认内部使用Gemini 4 正被谷歌内部工程师用于Antigravity AI高
官方确认目标重定义不再执着 AGI 概念——「真正的问题是,我们是否有能力构建出可以完全信任的智能体」高
泄露上下文窗口1000 万 Token(原生)中(多源一致,无官宣)
泄露输出上限256K Token中
泄露定价输入$2.25/ 输出$11.25每百万 Token中
泄露发布时点11 月低(消息源推测)
流传截图基准DeepSWE v1.188%、Terminal-bench 2.195.3%,称编程/智能体/推理均超 GPT-6 Astra 与 Claude Fable 5.1低(无独立复现)
社区观察检查点代号内部代号barium-b,社区称 Checkpoint 2中

⚠️本文的立场:泄露部分全部标注,不作为你做技术选型或成本测算的唯一依据。但它们值得认真读——因为泄露的规格组合本身,就在告诉你谷歌这一代要打什么牌。

二、7 个 Demo 到底证明了什么,以及没证明什么

这是本文信息密度最高的一段。我把社区流传的高质量实测逐个拆开,只回答两个问题:这个 Demo 在测什么?它通过了什么?没通过什么?

#实测(社区/博主)任务本质在测什么观察者结论保留意见
13D 浮筒飞机水面滑行起飞(@AI_Screening,对标 Opus 5.5)物理引擎代码 + 流体力学反馈的一致性「Opus 飞机在动但晃动剧烈、水面反馈生硬;Gemini 4 Pro 加速平稳、水面反射清晰、溅水逼真」单次生成,无重复实验
216 分钟纯代码生成 3D 国际空间站绕地模拟(@thtbee_)零资产依赖下的建模 + 素材自取能力自己用 Three.js 建模,并主动抓取正确地球贴图以保证经纬度和颜色准确UI 界面被吐槽「有点丑」;背面仍有透视 bug
3Three.js「灯塔变火箭发射,不含任何 UI」(@HarshithLucky3)指令遵循+ 视觉审美严格不含 UI;所有元素加了质感极佳的纹理审美在不同部件上不稳定
43D 任天堂 Wii 遥控器建模(@LuminaBench)工业设计级细节还原细节把握强、生成速度「快得难以置信」存在过度雕琢:没要求的也拼命加细节;部分部件违和
5机器蜂鸟(@TimJayas,「祖传」prompt,对标 GPT-6 Sol)复杂机械结构 + 动态行为理解「质量与 Fable 旗鼓相当,但远好于 GPT-6 Sol」同时承认有时被 GPT-6 Astra 碾压
614 分钟生成前后端完整产品展示站全栈工程产出速度「真的就是几分钟一个网站」未见后端可运行性验证
7单提示词直接吐出可交互网页游戏一次性交付完整可玩物多人反馈一致玩法深度、bug 率未披露

把七个 Demo 合起来看,真正能得出的结论只有三条:

  1. 长文本代码构建的「一次性交付率」明显提升。16 分钟出一套 3D 空间站、14 分钟出一套全栈站、单提示词出可玩游戏——这三个数字指向同一件事:首版可用率(first-pass usable rate)在涨。这比任何基准分数都更贴近工程价值。
  2. 视觉/3D 感知与生成是这一代的主战场。七个 Demo 里有五个是 3D/视觉。而且第 2 条里「主动去网上抓正确地球贴图」——这是主动工具使用 + 事实核对的组合行为,属于 Agent 能力而非纯生成能力。
  3. 「过度雕琢」是一个需要管理的新缺陷类型。第 4 条明确指出:你没要求的它也拼命加。对工程交付这是负资产——需求边界控制,正在取代「幻觉」成为新的主要抱怨点。

💡一个容易被忽略的判断:这些 Demo 全部是「高新颖度、低验收标准」的任务(3D 场景、视觉玩具)。这类任务最容易产生 impressive 的观感,也最难证伪。真正决定生产力的任务形态是「低新颖度、高验收标准」——改一个两周的老系统、迁移一个真实的数据库、修一个有明确回归测试的 bug。这两类任务上,Checkpoint 2 的表现目前没有任何公开实测。这也是我认为这些 Demo 不能直接当采购依据的原因。

三、最被忽略的一条:Gemini 4 正在反向定义未来两到三代 TPU

在这波曝光里,几乎所有讨论都集中在「3D 生成的 Demo 好震撼」,但信息量最大的一句被埋掉了——Koray Kavukcuoglu 在访谈中提到:Gemini 4 的研发,正在帮助谷歌的硬件工程师设计「未来两到三代的 TPU」。

为什么这件事比跑分重要?把它翻译成一句工程师听得懂的话:

  • 1000 万 Token 上下文这个规格,对硬件的要求不是「更多 HBM」,而是注意力路径的访存效率。当整个网络趋向 local/sparse(下面第三节的 Naive-N0.5-Flash 是极端版本),芯片要优化的瓶颈从「算力峰值」转到了「长程数据搬运与稀疏访问」。
  • 因此,芯片的迭代方向开始由模型的训练与推理形态决定,而不是反过来。一旦模型方能自己改硬件,通用推理供应商(英伟达生态)面临的竞争就不再是「谁的卡更快」,而是「谁的模型与卡是一起长出来的」。
  • 这也解释了本周另一条新闻为什么重要:Brookings 估算美国 AI 基建投资 2025–2032 年累计 10.3 万亿美元,年均约占 GDP 3.6%,将是美国史上单一行业占 GDP 比重最大的基建浪潮,超过铁路峰值(2.24%)——在如此规模上,芯片路线不能出错。垂直整合因此不是偏好,是必须。

💡对创业者的直接含义:如果你在做推理层(网关、路由、缓存、量化、推理优化),未来的护城河不会是「我接了更多家 API」,而会是「我理解这些模型在硬件上怎么跑」。本周另一个数据点可以印证这条:llama.cpp 的 prompt-lookup 投机解码经四项优化后,单 token 起草延迟从 165.48µs 降到 1.18µs(约 42 倍),叠加 Daniel Lemire 的阈值检查优化可达约 140 倍;静态缓存加载从 3.76 秒降到 0.23 秒(541MB)。这类「推理系统级」优化,才是长上下文时代的真实杠杆。

四、算一笔账:如果 $2.25 / $11.25 坐实,你的成本模型会怎么变

用一组常见的中等规模 Agent 负载做敏感性测算(仅为推演,请以你实际调用到正式版后的价格重算):

假设:日均 200 万输入 Token / 80 万输出 Token,月度 30 天。

场景输入单价输出单价月度输入成本月度输出成本月度合计
泄露定价(Gemini 4 Pro)$2.25/百万$11.25/百万约 $135约 $270约 $405
上一档旗舰(量级参考,$5 / $25)$5$25约 $300约 $600约 $900
高档旗舰(量级参考,$10 / $50)$10$50约 $600约 $1200约 $1800

结论有三层:

  1. 同一负载下换成 $2.25/$11.25,账单直接砍掉 55%–78%。对一家每月在推理上花 $2 万的团队,这是每月省下的 $1.1 万–$1.5 万——足以覆盖一个小型推理优化团队的半年成本。
  2. 但输出价是真正的杠杆点,不是输入价。Agent 负载里输出(包括思维链与工具调用轨迹)通常占成本 60% 以上,而输出单价是输入的 5 倍。要降本,先降输出:更短的思维链、更少的无效重试、更短的工具返回体(截断而非全量塞回上下文)。
  3. 1000 万上下文不是让你「多用」的工具,而是让你「少用重复」的工具。一旦整个仓库能一次性放进上下文,你可以删掉大量 RAG 的检索-重排-重读链路——这省的不只是检索 API 的钱,更是检索错误导致的重试成本,那部分通常比 token 本身贵一个数量级。

💡可执行的三条:① 今天就把你的 Agent 负载按「输入 / 思维链 / 工具返回 / 最终答案」四类打点,跑一个月,看清楚哪一类占比最高;② 针对占比最高的那一类设计压缩策略,而不是笼统地说「换个便宜的模型」;③ 在正式版到来前,别急着迁移——用 A/B 把现有模型和候选模型在你自己的真实任务集上对比,至少 50 条,Checkpoint 的 Demo 帮不了你这个忙。

五、风险清单:这份曝光里可能让人踩坑的五个地方

  1. Checkpoint ≠ 正式版。社区自己的说法是「第二个检查点比第一个有了肉眼可见的巨大飞跃,谷歌这次是真的在烹饪一道大菜」——这恰恰说明第一个和第二个之间的波动幅度极大。用 Checkpoint 2 的能力推断正式版,是一次外推风险极高的操作。
  2. 没有任何独立基准复现。88% / 95.3% 全部来自流传截图,第三方机构尚未跑出可验证结果。没有独立复现的分数,在采购谈判里是不成立的。
  3. 11 月这个时点只有消息源推测。Koray 说的是「远早于年底」,两者不是一回事。把它当规划参考,不要当排期依赖。
  4. 审美不稳定被系统性低估了。多个测试者独立提到「不同部件上表现不太稳定,有些绝佳、有些违和」。对于面向客户交付的产品,「稳定的中等」远好于「不稳定的惊艳」。
  5. 2026 年 9 月初 Gemini 3.5 Pro 已经跳票过一次。社区此前记录:谷歌原计划发布的 Gemini 3.5 Pro 延期,内部候选模型因未能超越 Flash 系列被直接废弃。一个跳票过一代的团队,它的时间表本身就有更高的方差。

📚 本文信息来源汇总

  • 新智元(经 AITNT 转载,2026-09-27 23:12):《刚刚,Gemini 4 Pro 全新曝光,实测碾压 Opus 5.5!》
  • The Information:Google DeepMind 掌门人 Koray Kavukcuoglu 访谈(Gemini 4 预训练节奏、Antigravity AI、TPU 协同设计、发布态度)
  • 社区一手实测:X @alannnfx(检查点流出)、@AI_Screening(浮筒飞机)、@thtbee_(16 分钟 3D 空间站)、@HarshithLucky3(灯塔→火箭)、@LuminaBench(Wii 遥控器)、@TimJayas(机械蜂鸟)
  • Seeking Alpha / Brookings(哥伦比亚大学 Stijn van Nieuwerburgh):美国 AI 基建 10.3 万亿美元估算,2026-09-25
  • jadidbourbaki.github.io(2026-09-26):llama.cpp prompt-lookup 投机解码优化,约 42×–140×

⚠️免责声明:本文中Gemini 4 Pro 的上下文窗口、输出上限、定价、基准分数与发布时点均来自社区泄露与截图流传,谷歌尚未官方确认,请以谷歌官方发布为准。文中成本测算是基于假设负载的推演,不构成采购建议。图表由本号基于上述公开数据绘制,仅供信息参考。


📖配套付费专栏:《大模型工程师修炼手记》19.9 元—— AI 编程 · Agent 工程实战 · 本文同主题系统课程《AI时代程序员的自我提升》49.9 元—— AI 时代成长方法论

单篇不过瘾?订阅解锁全量源码、实战与答疑;文末附资料包领取方式 ↓


📚 延伸阅读 · 我的付费专栏

觉得这篇文章对你有帮助?我把同类主题的系统化内容沉淀成了付费专栏,欢迎订阅支持持续输出:

专栏定价内容
大模型工程师修炼手记19.9 元AI 编程 / Agent 深度实战
AI时代程序员的自我提升49.9 元AI 时代成长方法论

💡 一杯咖啡的价格,换来系统化的知识体系;你的订阅,是我持续创作的最大动力。

💬本文配套代码 / 资料包:欢迎在评论区留言「求代码」,我会私信发送完整资源!

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 20:05:23

Claude Code示范案例-高级功能速览

**Skills(技能)**: bash /refactor src/legacy/code.js --modernasync-await /test src/service/userService.js /output-style # 要求 Claude 解释为什么这样做 **MCP(模型上下文协议)**: bash # 添加 Ch…

作者头像 李华
网站建设 2026/9/29 20:04:49

2026年,洪梅镇这座水乡小镇,正在悄悄发生哪些新变化?

最近和几位在东莞洪梅镇办厂的老朋友喝茶,大家不约而同地聊到一个话题:洪梅镇这两年的变化,确实有点“快得让人反应不过来”。作为东莞水乡功能区的核心镇之一,洪梅过去给人的印象是“偏、小、慢”。但2026年刚开年,我…

作者头像 李华
网站建设 2026/9/29 20:03:54

开源Chrome取证工具hindsight:一键提取浏览器痕迹

入行做取证分析那几年,我几乎每次遇到“这台电脑到底看了什么、下过什么、跟谁联系过”这类问题时,第一反应都是同一个行动:先把浏览器的痕迹盘出来。而在所有浏览器里,Chrome 的痕迹最集中、最结构化,也最适合用一套可…

作者头像 李华
网站建设 2026/9/29 20:03:45

内蒙古清障车生产厂家筛选名录,口碑公司汇总

清障车行业基础认知什么是清障车,核心属性与应用范围是什么?清障车也叫道路救援车、拖车,是专门用于道路故障车辆、事故车辆拖拽转运的专用工程机械设备,核心作用是快速清理路面障碍,协助道路恢复正常通行,是道路应急…

作者头像 李华