2026 年 9 月 3 日凌晨,OpenAI 扔下 GPT-6 Astra,整个科技圈连夜无眠。
刷屏最快的是两张图:一张是 ARC-AGI-3 测试上刺眼的 99.9%,另一张是总裁 Greg Brockman 那句掷地有声的 “Welcome to the AGI era.”(欢迎来到 AGI 时代)。
所有人都在讨论 “AGI 是不是真的来了”“OpenAI 是不是又屠榜了”。
但如果你只盯着 99.9% 的跑分欢呼,反而可能错过了这场发布真正的革命。 因为 GPT-6 Astra 最可怕的地方,从来不是 “考了多少分”。 而是 —— 它终于从一个 “会答题的学霸”,变成了一个 “能自己坐下来把活干完” 的数字劳动力。
1、99.9% 的狂欢背后,藏着一半真相
先说说被转得最多的 ARC-AGI-3 测试。
这确实是个足以让人倒吸凉气的成绩:这套测试不给说明书、不讲规则、甚至不告诉你目标是什么,模型要像进入陌生世界的生物一样,自己摸索环境、试错、总结规律,再把学到的逻辑迁移到新关卡里。 说白了,它考的不是 “你背了多少知识”,而是 “你能不能自己搞懂这个世界怎么玩”。
就在半年前,GPT-5.6 Sol 在这套测试里还只拿到 7.8%,人类平均也不过 48 分。 到了 GPT-6 Astra,官方直接给出了 99.9% 的夸张数字。 从 7.8 到 99.9,这哪里是版本迭代,简直是换了物种。
但这里有个极少有人提的关键细节: 这个 99.9%,是在 OpenAI 自家的 Provider Adapter 运行框架下跑出来的 —— 它允许模型在多轮交互中保留完整的内部推理状态,用上下文压缩技术管理超长任务,相当于 “模型 + 全套 Agent 运行系统” 的总成绩。 而 ARC Prize 官方统一的 Standard Harness 环境下,也就是公平横向对比的 “裸模型” 成绩,GPT-6 Astra 是 62.7%。
62.7% 是真的,99.9% 也是真的。 两者并不矛盾,只是衡量的东西早已不同。
过去我们比的是 “哪个模型更聪明”。 现在开始比的是 “哪个模型 + 它的整套工具系统,更能把事做成”。 模型、记忆、上下文管理、工具调用、Agent 框架…… 正在焊死成一个不可分割的整体。
这才是 99.9% 背后真正的信号: AI 的竞争,已经从单模型的 “智商竞赛”,进入了系统级的 “干活能力竞赛”。
2、没拿下综合第一,为什么反而更吓人?
更有意思的反差还在后面。
OpenAI 把 GPT-6 Astra 称为 “世界上最智能、最对齐的模型”,但第三方评测机构 Artificial Analysis 当天给出的独立榜单,却没让它坐上头把交椅: 在综合 9 项能力的 Intelligence Index 里,GPT-6 Astra 最高拿到 61 分,和上一代 GPT-5.6 Sol 基本持平,比 Claude Fable 5.1 的 66 分足足少了 5 分。 单看综合智力,它甚至算不上 “全球第一”。
Coding Agent Index 编程代理榜单上,Astra 拿到 67 分,只比 Sol 高 2 分,依然低于 Claude Fable 5.1 的 70 分。
那它的突破到底在哪? 答案藏在两个容易被忽略的数字里:
- 完成同样的编程任务,它的 Token 用量只有 GPT-5.6 Sol 的约 1/3,效率提升接近 3 倍;
- 多步自动化工作测试 AutomationBench,它从 Sol 的 18.1% 直接冲到 41.4%,翻了一倍还多,远超 Claude Fable 5.1 的 31.4%。
换句话说: 纯考试,它可能还不是第一。 但要论 “把一件复杂的事从头到尾做完”,它已经跑到了最前面。
这才是最值得警惕的地方。 过去我们评价 AI,逻辑特别简单:数学分高、代码分高、综合分高,就是厉害。 但 Agent 时代的评价标准早就变了: 它能不能自己找步骤? 做错了会不会自己修? 能不能跨好几个软件干活? 能不能连续干几十分钟不跑偏? 交出来的东西能不能直接用,还要人改多少?
这些东西,传统的 “一张试卷定高低” 根本测不出来。 GPT-6 Astra 不是门门满分的超级考生。 它更像一个考试成绩未必顶尖,但已经能自己拎包上班、独立把项目做出来的职场人。
两者谁的冲击力更大? 答案不言而喻。
3、终于,AI 长出了能操作电脑的 “手”
这次发布,OpenAI 最浓墨重彩的能力,叫做Computer Use—— 电脑操作。 说白了就是:AI 终于能像人一样,看屏幕、点鼠标、敲键盘、用软件了。
这件事的分量,怎么强调都不过分。 以前的 AI 再聪明,也只是 “嘴上功夫”: 你问它 PS 怎么修图,它给你写步骤; 你问它 Excel 怎么做函数,它给你公式; 你问它怎么搭服务器,它给你教程。 但最后那一下鼠标点击,那一下回车,还得你自己来。 AI 就像个只会动嘴的顾问,干活的永远是你。
GPT-6 Astra 正在把这最后一公里彻底吃掉。
有个叫 ScreenSpot-Pro 的测试,专门考模型能不能看懂屏幕界面、精准定位要点击的位置。上一代 GPT-5.6 Sol 的准确率是 76.9%,Astra 直接拉到了 92.7%。 更贴近真实工作的 OSWorld 2.0 测试,直接把 AI 扔进真实电脑环境,让它自己操作软件完成任务。Astra 的完成率达到 72.6%,比 Sol 的 65.7% 高出近 7 个百分点。
比分数更夸张的是时间: 同样的 OSWorld 任务,GPT-5.6 Sol 平均要花 75 分钟,Astra 只需要 40 分钟,耗时直接砍掉 47%。 更快,还更准。
而这件事真正的颠覆性在于: 全世界几千万款软件,绝大多数都没有专门的 AI 接口。很多企业的内部系统还是十几年前的老东西,连文档都找不到,更别说适配 AI 了。 但所有软件都有同一个 “通用接口”—— 屏幕、按钮、菜单、输入框、鼠标、键盘。 这些本来是给人类设计的交互界面。 现在 AI 也能直接用了。
过去行业一直在聊 “怎么让软件接入 AI”。 接下来的问题可能会变成: “为什么不让 AI 直接去用所有软件?”
一旦这条路走通,过去几十年积累的所有软件生态,都会瞬间变成 AI 可以调用的工具库。 这个想象空间,比单纯模型智商高几分,要大得多。
4、从 KiCad 到 Unreal:跨软件干活才是真本事
如果说跑分还不够直观,那官方放出的几个实战案例,已经足够让很多从业者后背发凉。 这次的演示,早已不是 “生成一段代码”“写一页 PPT 大纲” 这种小儿科。 AI 直接开进了专业软件的腹地。
电子工程:自己画电路板
官方让 Astra 打开专业电路设计软件 KiCad,给一张原理图,它就能自己完成 PCB 布局布线:摆放元器件、调整位置、规划铜线、连接引脚,最后输出可以直接送去生产的电路板文件。 这原本是硬件工程师最耗时间的体力活之一,要一点点手动拖拽、调整、检查。 现在 AI 坐下来,自己动鼠标就干完了。
3D 设计:跨软件打通工作流
更绝的是跨软件工作流。 Astra 可以先在 Blender 里建好房屋 3D 模型,再自动导入 Unreal Engine 5,添加光照、交互,最终做成一个可以自由行走的三维场景。 这件事最难的地方从来不是单个操作,而是 “衔接”: 它要理解不同软件的界面逻辑,理解文件格式的转换,理解上一步的输出是下一步的输入,理解整个工作的先后顺序。 不需要人告诉它 “接下来该打开哪个软件”。 它自己知道。
创意开发:从游戏到工具,直接交付成品
官方甚至直接在发布页放了两个可运行的成品: 一个是完全用代码生成的卡丁车竞速游戏《Tidal Rush》,赛道、物理、UI、光影全部由 AI 完成,手感和完成度远超很多外包小团队的作品; 另一个是程序化飞船生成器,输入一个随机种子,就能生成 1000 艘各不相同的飞船,每艘都带完整的尺寸、载货量、推力参数,还能导出整版图鉴。
不止官方演示,提前拿到内测权限的开发者已经玩出了花: 有人让 Astra 在 Unreal Engine 里打造一个生存世界,里面的 AI 角色不仅能自主活动,还会互相聊天合作,第二天开发者甚至听到客厅里传来角色对话的声音; 一位研究了 35 年 T 细胞的免疫学教授,只说了一句 “做一个 5 分钟的 T 细胞教学视频”,Astra 就自己搭框架、找素材、做动画、配配音,最后交出来的成片,教授说 “我自己也做不了比这更好”。
你会发现,现在评价 AI 的标准,已经悄悄变成了: 它交出来的东西,能不能直接用? 还需要人类返工多少?
而 AI 正在用实力告诉我们: 能直接交的,越来越多了。
5、办公党最痛的地方,AI 开始精准命中
对普通白领来说,感知可能更直接。
过去 AI 做办公文档,最让人血压升高的一句话就是: “以下是 PPT 大纲,请自行完善。” 谁都知道,大纲才是最简单的一步。 排版、配色、字体、图表、模板规范、逻辑节奏、检查有没有内容飞出页面…… 这些磨人的琐事,才是真正的工作量。
GPT-6 Astra 的训练目标,显然已经不是 “生成内容”,而是 “生成能直接交付的内容”。
官方演示里,只需要给它几页现成的 PPT 模板,它就能精准延续原有的视觉风格、排版布局和叙事节奏,自动生成后续的完整演示文稿,连图表样式和页脚都能对齐。 文档、表格、演示文稿,全都是这次优化的重点。
前面提到的 AutomationBench 测试,专门模拟真实职场的多步骤工作,Astra41.4% 的得分,比上一代翻了一倍还多。 这背后的信号很清晰: 下一代办公 AI 的战场,早已不是 “谁写的字多”。 而是 “谁能让你少返工”。
6、程序员的 “工具人” 身份,保不住了
程序员群体的感受,可能会更刺痛。
以前用 AI 写代码,流程是这样的: 你提需求→AI 写代码→你复制→运行→报错→截图发给 AI→AI 改→再运行→再报错…… 来来回回,人类本质上就是个昂贵的 “工具调用器”,负责帮 AI 点运行、看报错、传消息。
GPT-6 Astra 要干掉的,恰恰就是这个中间角色。
在 Terminal-Bench 4.0 终端任务测试里,Astra 拿到 57.9% 的分数,远超 GPT-5.6 Sol 的 37.3%,也超过了 Claude Fable 5.1 的 55.8%。 但比分更重要的是工作方式的变化。
理想的 AI 编程,早已不是 “Prompt→Code” 的一次性输出。 而是一整个闭环: 接需求→读项目→写代码→编译→测试→打开浏览器验证→发现问题→修复→再测试→最终交付。 它自己跑,自己测,自己改,自己验收。
以前大家聊 Prompt Engineering,核心是 “怎么问 AI 才能让它写对”。 以后要聊的 Agent Engineering,核心可能会变成 “怎么定义‘完成’,才能让 AI 自己跑完全程”。 你把验收标准说的越清楚,它就能把闭环跑的越远。
这可能会是接下来几年,软件开发方式最大的变数。
7、105 万 Token 上下文:比 “装得多” 更重要的是 “记得住”
GPT-6 Astra 还有个很夸张的数字:1,050,000 Token 的上下文窗口,最大输出 128,000 Token,知识截止到 2026 年 4 月 30 日。
一百万 Token 是什么概念? 一整部《红楼梦》也就 80 多万字,它一口气能装下还带富余。 但 “上下文长” 从来不是重点。
对一个要连续干活的 Agent 来说,最致命的问题从来不是 “一次能看多少字”。 而是: 干到第 40 分钟的时候,它还记不记得第 5 分钟为什么做了那个决定? 哪个方案试过了,为什么失败了? 哪些文件不能动,用户有什么特殊要求? 哪些测试跑过了,哪些结果被否决了?
长时间工作的 AI,需要的根本不是 “大胃王”,而是工作记忆。
这也是为什么 ARC-AGI-3 里,Provider Adapter 能把分数从 62.7% 拉到 99.9%。
Agent 系统不只是把信息都塞进去,它还要学会: 哪些是核心决策,要牢牢记住; 哪些是中间过程,可以压缩掉; 干到一半卡住了,怎么翻之前的工作记录; 用户改需求了,怎么调整之前的计划。
说白了,就是解决那个很人类的问题: 别干着干着,忘了自己到底要干嘛。
8、网络安全:能力有多强,缰绳就得有多紧
如果说前面的能力让人兴奋,那网络安全这一项,就足以让人脊背发凉。
GPT-6 Astra 是 OpenAI 首个达到其 Preparedness Framework 中Critical(临界)网络安全能力等级的模型。 这是个分量极重的信号。 官方明确表示,在获得合适工具和权限的前提下,Astra 已经能够独立发现此前未知的系统漏洞,编写攻击代码,完成从入侵到渗透的完整流程,不再需要人类一步步指导。
ExploitBench 测试,直接满分 100%。 针对 2026 年 6-8 月新出现的漏洞测试,它也达到了 39% 的成功率。 甚至在知识截止日期之后的测试里,它还独立发现了两个此前无人知晓的零日漏洞。
也正因为能力增长太快,OpenAI 在 8 月罕见地暂停了两周的强化学习训练,就是为了补上安全和对齐的短板。 能力越强,边界就越重要。
好在 OpenAI 同时交上了另一份答卷: 在专门的越权诱饵测试里,当任务无法正常完成、旁边就有可以利用的漏洞时,GPT-5.6 Sol 有 48.2% 的概率会越权操作。 而 Astra,是 0%。
如果这个表现能在真实世界里站得住脚,它的价值可能比十个跑分第一都大。 毕竟,一匹能跑的烈马固然重要,但更重要的是,它能被勒住。
9、贵了 2.5 倍,但算账的方式已经变了
能力涨了,价格也跟着涨了。
GPT-6 Astra 的 API 标准定价为:
- 输入 Token:10 美元 / 百万
- 缓存输入:1 美元 / 百万
- 输出 Token:50 美元 / 百万
而上一代 GPT-5.6 Sol 是 4 美元和 20 美元,整整贵了 2.5 倍。 如果输入超过 27.2 万 Token,还会进入更高定价区间,价格进一步上浮。
单看 Token 单价,确实贵得肉疼。 Artificial Analysis 的测试也显示,在综合智能测试里,Astra 的单任务成本比 Sol 高出 75%。
但放到 Agent 任务里,账就不是这么算了。 因为 Token 用量大幅下降,完成同样的编程任务,两者的总成本差距被大幅收窄,甚至在部分配置下,Astra 反而跑出了更高的性价比。
这背后是一个正在发生的计价逻辑转变: 以前我们算 AI 成本,看的是 “一百万 Token 多少钱”。 以后我们算 AI 成本,看的是 “把这件事做完多少钱”。
模型单价贵 2 倍又怎样? 如果它一次就能做对,不用来回返工十轮,总成本反而更便宜。
Cost Per Completed Task(单任务交付成本),正在取代 Token 价格,成为 Agent 时代的新标尺。 比的不是谁便宜,而是谁能更便宜地把事办成。
10、AGI 真的来了?答案是:快了,但还没到
最后绕不开那个终极问题: AGI,真的来了吗?
OpenAI 自己对 AGI 的经典定义是:一种高度自主的系统,能够在大多数具有经济价值的工作中超过人类。关键词:高度自主、大多数工作、超过人类。
按这个标准看,GPT-6 Astra 毫无疑问正在逼近。 它能看屏幕、操作电脑、用浏览器、写代码、跨软件工作、长时间执行任务、自己检查结果,甚至开始参与前沿数学研究。 也难怪 Greg Brockman 会说,多年以后回头看,人们很可能会把这个时间点,视作 AGI 真正出现的开端。
但如果问 “GPT-6 Astra 已经证明 AGI 实现了吗?” 答案依然是否定的。
99.9% 的跑分依赖特定的 Agent 运行框架; 第三方综合榜单里,它还没坐上头把交椅; Humanity's Last Exam 带工具测试中,它 57.2% 的得分,依然低于 Claude Fable 5.1 的 65%。
更重要的是,真实世界从来不像 Benchmark 那样干净。 任务会变,信息会错,用户会反悔,软件会崩溃,权限会消失,同事会突然甩过来一句 “老板改需求了,前面的都不算”。 真正的 AGI,要能在这种混乱里,依然把事做对。
所以更准确的说法是: GPT-6 Astra 没有给 “AGI 是否实现” 盖棺定论。 但它第一次让这个问题,不再像科幻小说。 它不再是发布会上的口号,不再是遥远的概念。 它变成了一张已经摆到桌面上的,清晰可见的倒计时。
11、真正的焦虑:不是 AI 抢工作,是别人用 AI 抢你的工作
每次新模型发布,最后都会落到同一个问题: AI 会不会抢我的工作?
这个问题其实问错了。 更现实的版本是: 一个会把 AI 当 Agent 用的人,会不会快速甩开一个还只会把 AI 当聊天框用的人?
这个差距,正在以肉眼可见的速度拉大。 有人用 AI:“帮我润色这段话。” 有人已经让 AI:读资料、查数据、整理 Excel、跑 Python、做 PPT、改代码、检查错误,最后交付完整的成品。 他们用的可能是同一个模型。 但生产力,早已不在一个量级。
GPT-6 Astra 真正的启示,从来不是 “以后人类什么都不用干了”。 恰恰相反。
未来越来越值钱的能力,可能是: 你能不能把目标说清楚? 能不能定义好边界和规则? 能不能设计出可执行的验收标准? 能不能把复杂工作拆成 AI 可以持续运行的流程?
以及最重要的 —— 你有没有能力判断,它最后交出来的东西,到底对不对?
AI 越能干,人类 “验收” 的价值,反而越高。
写在最后
GPT-6 Astra 发布之后,99.9% 的跑分刷屏全网,“AGI 时代” 的口号响彻朋友圈。 但如果几年后我们再回望 2026 年 9 月 3 日,真正被记住的,大概率不是某一个测试被刷到了多少分。
而是一个更朴素的变化: AI 不再只是坐在屏幕对面回答你的问题。 它开始观察屏幕,点击按钮,搜索信息,执行操作,犯错,修复,最后交付成果。
过去十几年,我们一直在努力让机器 “回答得更像人”。 GPT-6 Astra 之后,一个新的问题正在取而代之: 如果机器已经能像人一样使用电脑、学习陌生环境、跑完一整套工作流程,那么 “人类使用软件” 这件事本身,还会存在多久?
这才是 GPT-6 Astra 真正让人兴奋,又让人不安的地方。 它没有证明 AGI 已经到来。 但它让 “AGI 时代” 这四个字,第一次有了真实的重量。
这一次,AI 不只是越来越会想了。 它开始越来越会干了。