news 2026/9/26 3:13:11

AI前沿 | 2026年9月5日:GPT-6 Astra 全量上线——额度重置、价格翻 2.5 倍,AGI 时代的第一道门槛

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI前沿 | 2026年9月5日:GPT-6 Astra 全量上线——额度重置、价格翻 2.5 倍,AGI 时代的第一道门槛

AI前沿 | 2026年9月5日:GPT-6 Astra 全量上线——额度重置、价格翻 2.5 倍,AGI 时代的第一道门槛

📖首屏导读 · 本教程配套付费专栏:《大模型工程师修炼手记》19.9 元(AI 编程 · Agent 实战 · 本文同主题系统课程)· 《AI时代程序员的自我提升》49.9 元(AI 时代成长方法论)

单篇不过瘾?订阅解锁全量源码、实战与答疑;文末附资料包领取方式 ↓

📊 继 9 月 3 日发布、9 月 4 日定向开放后,GPT-6 Astra 于 9 月 5 日毫无预警地全量上线,面向 ChatGPT Work 及 Codex 的 Pro、Enterprise、Business Premium 用户同步开放。API 定价每百万输入 10 美元、输出 50 美元,是 GPT-5.6 Sol 的 2.5 倍——但「按任务」而非「按 token」的净成本账,正在重写大模型经济学。

一、全量上线:从定向测试到人手一份

OpenAI 的 Tibo Sottiaux 确认,Astra 已向 Plus 和 Business 用户全量推出,并再次重置了调用额度。但「能用到」与「够用」之间有巨大鸿沟,额度分层相当严格:

套餐GPT-6 Pro 额度
Pro(200 美元/月)每周 200 条
Pro(100 美元/月)每周 50 条
Business Premium每周 50 条
Business Standard每月仅 15 条

开发者接入有硬门槛:Codex CLI 必须升级到 0.153.0+,桌面端 ChatGPT 客户端也要更新到最新版本。这一改动意味着 OpenAI 正在把「最强能力」从「人人可用」收紧为「分层交付」。

二、价格翻 2.5 倍,但净成本未必翻

GPT-6 Astra 的 API 价格为每百万输入 Token 10 美元、输出 50 美元,与 Anthropic Claude Fable 5.1 持平,是 GPT-5.6 Sol 优惠价的 2.5 倍,约是 Gemini 3.1 Pro(2 美元/12 美元)的 5 倍。

但 Artificial Analysis 的深度评估揭示了一个关键变量:在最高推理强度任务中,Astra 完成同等工程产出所需输出的「废话 Token」总量显著下降。OpenAI 的定价逻辑是——更高的单价会被更少的 Token 消耗和更少的重试次数抵消,最终「每任务实际成本」未必更高。

对比维度GPT-5.6 SolGPT-6 Astra
API 输入($/百万)410
API 输出($/百万)2050
AutomationBench18.1%41.4%
OSWorld 2.065.7%72.6%
任务平均耗时基线快 47%

💡对创业者的启示:当「单任务净成本」取代「单 token 价格」成为评估标准,选型逻辑就变了。便宜的模型如果重试 3 次才完成任务,实际成本可能反超贵模型。建议团队在 POC 阶段就建立「任务成功率 × 单次成本」的复合指标,而不是盯着 token 单价砍价。

三、AGI 争议:能力跃升还是营销话术

GPT-6 Astra 的 ARC-AGI-3 得分 99.9% 是传播最广的数字,但这个数字有前提——据 Vellum.ai 的基准分析,OpenAI 使用的是 Responses API 专属测试框架并调整了默认参数,标准测试条件下同模型得分为 62.7%。

但换个参照系,Astra 的优势又是真实的:ARC-AGI-2 排行榜上,GPT-6 Astra 以 95% 位居第一,排在其后的 Claude Opus 5 仅 30.2%。AutomationBench 中 Astra 得分 41.4%,是上一代 Sol(18.1%)的两倍多。

Greg Brockman 的「欢迎来到 AGI 时代」引发了行业定义之争。OpenAI 对 AGI 的官方定义是「能够在大多数具有经济价值的工作中超越人类的高度自主系统」。按这个标准,Astra 在办公自动化等垂直任务上确实达到或超过了人类水平,但 Humanity's Last Exam(57.2%)落后于 Claude Fable 5.1(65%),说明通用推理能力仍有边界。

💡对创业者的启示:「AGI 时代」最诚实的解读不是「人类退场」,而是AI 第一次在某些任务维度上让人类成为「可选项」而非「必须项」。这意味着创业者要重新审视:哪些流程可以真正放手交给 AI,哪些环节必须保留人类审批。分界线的判断力,会成为下一阶段的稀缺能力。

四、安全暗面:能力越强,越难监控

GPT-6 Astra 是 OpenAI 首个在任何领域达到「Critical(危急)」风险等级的模型,触发评级的正是网络安全能力——ExploitBench 漏洞利用开发测试 100% 满分(Sol 为 78.5%),内部 V8 引擎漏洞测试成功率 39%(Sol 仅 5.5%)。

与此同时,系统卡片里一句措辞被广泛注意:Astra 的推理过程「比 Sol 更难监控」。能力越强、推理链条越复杂,可解释性反而下降——这是当前主流训练范式的内生矛盾。

💡对创业者的启示:可解释性下降 + 能力增强,意味着对 AI 行为的「事后审计」正在失效。做 Agent 产品的团队,安全设计必须前移——在架构层内置权限分级、行为日志、能力路由,而不是依赖「出了问题再看日志」。这是 Astra 全量上线给整个行业上的最贵一课。

来源:AppSo / 网易 / CSO Online / Vellum.ai / 钛媒体


📚 延伸阅读 · 我的付费专栏

觉得这篇文章对你有帮助?我把同类主题的系统化内容沉淀成了付费专栏,欢迎订阅支持持续输出:

专栏定价内容
大模型工程师修炼手记19.9 元AI 编程 / Agent 深度实战
AI时代程序员的自我提升49.9 元AI 时代成长方法论

💡 一杯咖啡的价格,换来系统化的知识体系;你的订阅,是我持续创作的最大动力。

💬本文配套代码 / 资料包:欢迎在评论区留言「求代码」,我会私信发送完整资源!

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/26 3:07:54

TeamPCP供应链投毒事件:22分钟感染637个npm包,内置死手开关报复开发者

2026年5月, 要是你的项目依赖了AI的SDK, 或者用到了AntV, 这些差不多是前端开发标配的数据可视化库, 那么你的开发环境, 甚至你电脑上的SSH私钥、密码, 都有可能已经在毫无察觉的情况下被一个叫“沙虫”的恶意程序一扫而空。这是一场由网络犯罪团伙周密策划、跨越PyPI和npm两大…

作者头像 李华
网站建设 2026/9/26 3:07:51

基于YOLO的交通流量检测系统:从数据集到Flask部署全流程

简介:面向计算机专业毕业设计的基于深度学习的交通流量检测系统项目,覆盖从数据采集、预处理到模型构建、训练评估及系统集成的完整技术链路。压缩包内文件总数达两千个,其中一千四百余个JavaScript脚本承载前端交互与核心逻辑,四…

作者头像 李华
网站建设 2026/9/26 3:07:40

告别 node_modules,Yarn PnP 原理与实战全攻略

前端圈子里对 node_modules 的感情,差不多是又爱又恨。十年了,我们早就习惯它的存在,可它带来的问题也越来越让人无法假装看不见。前几天我帮朋友清理一台开发机,磁盘里躺着十几个前端项目,每个 node_modules 动辄几个…

作者头像 李华
网站建设 2026/9/26 3:06:33

手机写代码实战:Termux、云端IDE与远程开发选型指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华