AI前沿 | 2026年9月5日:GPT-6 Astra 全量上线——额度重置、价格翻 2.5 倍,AGI 时代的第一道门槛
📖首屏导读 · 本教程配套付费专栏:《大模型工程师修炼手记》
19.9 元(AI 编程 · Agent 实战 · 本文同主题系统课程)· 《AI时代程序员的自我提升》49.9 元(AI 时代成长方法论)单篇不过瘾?订阅解锁全量源码、实战与答疑;文末附资料包领取方式 ↓
📊 继 9 月 3 日发布、9 月 4 日定向开放后,GPT-6 Astra 于 9 月 5 日毫无预警地全量上线,面向 ChatGPT Work 及 Codex 的 Pro、Enterprise、Business Premium 用户同步开放。API 定价每百万输入 10 美元、输出 50 美元,是 GPT-5.6 Sol 的 2.5 倍——但「按任务」而非「按 token」的净成本账,正在重写大模型经济学。
一、全量上线:从定向测试到人手一份
OpenAI 的 Tibo Sottiaux 确认,Astra 已向 Plus 和 Business 用户全量推出,并再次重置了调用额度。但「能用到」与「够用」之间有巨大鸿沟,额度分层相当严格:
| 套餐 | GPT-6 Pro 额度 |
|---|---|
| Pro(200 美元/月) | 每周 200 条 |
| Pro(100 美元/月) | 每周 50 条 |
| Business Premium | 每周 50 条 |
| Business Standard | 每月仅 15 条 |
开发者接入有硬门槛:Codex CLI 必须升级到 0.153.0+,桌面端 ChatGPT 客户端也要更新到最新版本。这一改动意味着 OpenAI 正在把「最强能力」从「人人可用」收紧为「分层交付」。
二、价格翻 2.5 倍,但净成本未必翻
GPT-6 Astra 的 API 价格为每百万输入 Token 10 美元、输出 50 美元,与 Anthropic Claude Fable 5.1 持平,是 GPT-5.6 Sol 优惠价的 2.5 倍,约是 Gemini 3.1 Pro(2 美元/12 美元)的 5 倍。
但 Artificial Analysis 的深度评估揭示了一个关键变量:在最高推理强度任务中,Astra 完成同等工程产出所需输出的「废话 Token」总量显著下降。OpenAI 的定价逻辑是——更高的单价会被更少的 Token 消耗和更少的重试次数抵消,最终「每任务实际成本」未必更高。
| 对比维度 | GPT-5.6 Sol | GPT-6 Astra |
|---|---|---|
| API 输入($/百万) | 4 | 10 |
| API 输出($/百万) | 20 | 50 |
| AutomationBench | 18.1% | 41.4% |
| OSWorld 2.0 | 65.7% | 72.6% |
| 任务平均耗时 | 基线 | 快 47% |
💡对创业者的启示:当「单任务净成本」取代「单 token 价格」成为评估标准,选型逻辑就变了。便宜的模型如果重试 3 次才完成任务,实际成本可能反超贵模型。建议团队在 POC 阶段就建立「任务成功率 × 单次成本」的复合指标,而不是盯着 token 单价砍价。
三、AGI 争议:能力跃升还是营销话术
GPT-6 Astra 的 ARC-AGI-3 得分 99.9% 是传播最广的数字,但这个数字有前提——据 Vellum.ai 的基准分析,OpenAI 使用的是 Responses API 专属测试框架并调整了默认参数,标准测试条件下同模型得分为 62.7%。
但换个参照系,Astra 的优势又是真实的:ARC-AGI-2 排行榜上,GPT-6 Astra 以 95% 位居第一,排在其后的 Claude Opus 5 仅 30.2%。AutomationBench 中 Astra 得分 41.4%,是上一代 Sol(18.1%)的两倍多。
Greg Brockman 的「欢迎来到 AGI 时代」引发了行业定义之争。OpenAI 对 AGI 的官方定义是「能够在大多数具有经济价值的工作中超越人类的高度自主系统」。按这个标准,Astra 在办公自动化等垂直任务上确实达到或超过了人类水平,但 Humanity's Last Exam(57.2%)落后于 Claude Fable 5.1(65%),说明通用推理能力仍有边界。
💡对创业者的启示:「AGI 时代」最诚实的解读不是「人类退场」,而是AI 第一次在某些任务维度上让人类成为「可选项」而非「必须项」。这意味着创业者要重新审视:哪些流程可以真正放手交给 AI,哪些环节必须保留人类审批。分界线的判断力,会成为下一阶段的稀缺能力。
四、安全暗面:能力越强,越难监控
GPT-6 Astra 是 OpenAI 首个在任何领域达到「Critical(危急)」风险等级的模型,触发评级的正是网络安全能力——ExploitBench 漏洞利用开发测试 100% 满分(Sol 为 78.5%),内部 V8 引擎漏洞测试成功率 39%(Sol 仅 5.5%)。
与此同时,系统卡片里一句措辞被广泛注意:Astra 的推理过程「比 Sol 更难监控」。能力越强、推理链条越复杂,可解释性反而下降——这是当前主流训练范式的内生矛盾。
💡对创业者的启示:可解释性下降 + 能力增强,意味着对 AI 行为的「事后审计」正在失效。做 Agent 产品的团队,安全设计必须前移——在架构层内置权限分级、行为日志、能力路由,而不是依赖「出了问题再看日志」。这是 Astra 全量上线给整个行业上的最贵一课。
来源:AppSo / 网易 / CSO Online / Vellum.ai / 钛媒体
📚 延伸阅读 · 我的付费专栏
觉得这篇文章对你有帮助?我把同类主题的系统化内容沉淀成了付费专栏,欢迎订阅支持持续输出:
| 专栏 | 定价 | 内容 |
|---|---|---|
| 大模型工程师修炼手记 | 19.9 元 | AI 编程 / Agent 深度实战 |
| AI时代程序员的自我提升 | 49.9 元 | AI 时代成长方法论 |
💡 一杯咖啡的价格,换来系统化的知识体系;你的订阅,是我持续创作的最大动力。
💬本文配套代码 / 资料包:欢迎在评论区留言「求代码」,我会私信发送完整资源!