🎬视频版直达:https://www.bilibili.com/video/av117210160828820/
💡今日趋势速览:OpenAI发布GPT-6 Astra,刷新多项基准并支持代替用户操作电脑。阿里推出Qoder眼镜版,AI眼镜成为Agent交互入口。Muse Spark 1.3上线AI Gateway,回馈数据可省90%费用,Agent落地与成本大战同步升温。
🎯 今日要点
- OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA
- 阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜
- Muse Spark 1.3 上线 AI Gateway,回馈数据省 90%
📋 今日内容汇总
🤖 AI动态
- OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA
- 阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜
- Muse Spark 1.3 上线 AI Gateway,回馈数据省 90%
- MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码
- Runway 发布通用世界模型 GWM Worlds 2
- OpenEvidence 发布医疗模型家族,即日起向认证临床医生开放
- Qwen 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B
- Anthropic 探索用函数钩子扩展 Claude Code,未正式发布
- Zite MCP 上线:把 Claude 订阅变成 AI 应用构建工具
- 微软发布 MAI-Transcribe-2:411 倍实时速度转录
- Cursor 为 Cloud Agents 接入 macOS 运行环境
- Anthropic 开源 AI 电商 Agent 参考实现
- DeepMind 发布 WeatherNext 3 天气预报模型
- AntLingAGI 开源金融模型 Ling-3.0-flash-Fin
- Hugging Face 宣布与 NVIDIA 携手,将保持独立中立平台定位
🧪 芯片半导体
- Intel 称 14A 工艺关键指标 D0 提前一年达标,进度超台积电
🦾 机器人具身智能
- 智元机器人开源 AGIBOT WORLD 2026 强化学习数据集
📌 模型排行榜
- Artificial Analysis AI 模型能力排行榜
🤖 AI动态
1. OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA
来源:原文 | OpenAI
OpenAI发布GPT-6 Astra,称其能代替用户在电脑上完成各类任务,而且速度飞快。新模型多项基准刷新最优水平,Terminal-Bench Science达64.6%,FrontierMath Tier 4达97.6%在第三方智能指数与编码智能体指数中同样名列前茅,即日起向部分组织推出,未来几天扩展至Plus、Pro、Business与Enterprise用户及API。
🔗 https://x.com/OpenAI/status/2095595741528125780
2. 阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜
阿里为Qoder推出眼镜版,首批接入千问AI眼镜和乐奇AI眼镜。眼镜成为Qoder的语音与视觉入口,用户开口即可派任务,Agent在云端或电脑上执行,眼镜负责汇报进度、确认关键操作。此外,看到报错弹窗或设计稿,可让眼镜拍摄,Qoder复述确认无误后再继续排查修改。
🔗 https://x.com/0xLogicrw/status/2095401820722192485
3. Muse Spark 1.3 上线 AI Gateway,回馈数据省 90%
来源:原文 | vercel_dev
Muse Spark 1.3 已上线 Vercel AI Gateway:可按标准价格运行,若选择将训练数据回馈给 Meta,价格可便宜 90%。平台提供两个模型标识:meta/muse-spark-1.3 标准版与 meta/muse-spark-1.3-contributor 贡献者版。
🔗 https://x.com/vercel_dev/status/2095277962144931895
4. MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码
来源:原文 | TestingCatalog (Twitter) | TestingCatalog (Twitter)
阿联酋 MBZUAI 发布开放权重 MoE 模型 K2 Horizon 375B A23B(总参 375B、激活 23B),随模型公开训练代码、数据配方、中间检查点与评估结果,并放出 MoVA 专家路由与 Uno 扩散适配器两个组件。Artificial Analysis 智能指数得 47,智能体表现较前代提升 30 分。
🔗 https://x.com/ArtificialAnlys/status/2095504796468056503
5. Runway 发布通用世界模型 GWM Worlds 2
来源:原文 | runwayml
Runway 发布通用世界模型 GWM Worlds 2,可生成交互式实时模拟,输出连续 720p 视频、24 fps 与 48000 Hz 音频。模型构建于其基础视听生成模型之上,用户可定义世界的环境、主体、视觉风格、物理规则与氛围,并以文本指令操控主体或场景,世界随每次新输入延续。以下是官方给出的 demo
🔗 https://x.com/runwayml/status/2095540014645920040
6. OpenEvidence 发布医疗模型家族,即日起向认证临床医生开放
来源:原文 | Max For AI (Twitter)
OpenEvidence发布医疗AI模型家族,称其为迄今最强大,截至2026年各主流基准得分最高的医疗模型。Osler用于走廊快速问诊,Sackett用于正式会诊,Snow用于肿瘤病例讨论第四款Darwin在MedQA取得满分100%,对比Claude、GPT、Gemini等前沿模型四项医疗基准全面领先,目前处于研究预览阶段,仅限申请使用。
🔗 https://x.com/OpenEvidence/status/2095531565699027266
7. Qwen 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B
来源:原文 | Hugging Papers (Twitter)
Qwen 在 Hugging Face 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B,在单一框架内同时处理 3D 感知、视觉问答与运动规划三类任务。该模型保持基础 VLM 架构不变,并在 NAVSIM、Waymo 和 LingoQA 等基准测试上取得有竞争力的结果。
🔗 https://x.com/HuggingPapers/status/2095357416950915380
8. Anthropic 探索用函数钩子扩展 Claude Code,未正式发布
Anthropic 正在探索一种扩展和自定义 Claude Code 的新方式:函数钩子(Function Hooks),并发布多个视频展示可实现的功能。该功能尚未正式发布,开发者可在其 GitHub issue 上提交反馈。
🔗 https://x.com/ClaudeDevs/status/2095572891941351550
9. Zite MCP 上线:把 Claude 订阅变成 AI 应用构建工具
Zite 宣布推出 MCP 服务,将用户的 Claude 订阅变成完整的 AI 应用构建工具:把 Claude、ChatGPT 或 Cursor 连接到 Zite MCP 后,直接描述想要的应用即可。应用上线后自带数据库、供全团队使用的登录系统以及区分权限的角色设置,且构建过程不消耗 Zite 积分。以下是官方给出的 demo
🔗 https://x.com/domwhyte42/status/2095512675996639300
10. 微软发布 MAI-Transcribe-2:411 倍实时速度转录
微软AI发布语音转录模型MAI-Transcribe-2,以2.0%的词错误率排名第2,约411倍实时速度同为第2,跻身准确性-速度帕累托前沿在基准榜单上,它仅次于阿里巴巴的1.7%,领先ElevenLabs Scribe v2的2.2%;定价每千分钟1.67美元不到同类一半,语言支持扩至60种。
🔗 https://x.com/ArtificialAnlys/status/2095521214777442546
11. Cursor 为 Cloud Agents 接入 macOS 运行环境
Cursor 为 Cloud Agents 接入 Namespace Devboxes,运行 Agent 时可直接选择 macOS 环境。Namespace 会为每个会话临时启动一台 Apple M5 Mac,让 Agent 在真正的 macOS 上改代码、编译和跑测试,任务结束后该 DevBox 就被销毁。在此之前,Cursor 默认云端开发环境一直是 Ubuntu,无法完成 iOS 和 macOS 原生开发的完整构建,此番合作正好补齐这一短板。
🔗 https://x.com/0xLogicrw/status/2095459538384330813
12. Anthropic 开源 AI 电商 Agent 参考实现
Anthropic开源了可运行的AI电商Agent参考实现官方称,使用Claude购物Agent的零售商购物车价值最高提升35%,消费者完成购买的可能性提高60%。该仓库包含购物Agent与商家Agent两类,共十项技能,并附三个Claude Code插件命令用于构建和评估Agent。以下是官方给出的 demo
🔗 https://x.com/xiaohu/status/2095443122729984494
13. DeepMind 发布 WeatherNext 3 天气预报模型
Google DeepMind 称 WeatherNext 3 是全球天气预报方式的重大突破:该模型与 Google Research 联合开发,直接从真实世界的实时观测数据中学习,以更快速度提供更本地化、更精准的预测。
🔗 https://x.com/GoogleDeepMind/status/2095528012791902536
14. AntLingAGI 开源金融模型 Ling-3.0-flash-Fin
AntLingAGI 宣布开源 Ling-3.0-flash-Fin 金融增强模型,面向真实工作流场景,同时开源 FinFIRST——一个由专家构建的金融搜索智能体基准测试;两项发布共同目标是让金融 AI 更易获取、更可验证。
🔗 https://x.com/AntLingAGI/status/2095533696808051001
15. Hugging Face 宣布与 NVIDIA 携手,将保持独立中立平台定位
Hugging Face 联合创始人 Julien Chaumond 宣布与 NVIDIA 携手。他表示 AI 正处关键拐点,开源 AI 可能被大型闭源实验室甩开,也可能成为下一阶段人类文明的基础设施;鉴于黄仁勋对开源 AI 的立场,NVIDIA 是其唯一真正考虑的合作伙伴,Hugging Face 将继续作为独立运营的中立平台。
🔗 https://x.com/julien_c/status/2095487938909876366
🧪 芯片半导体
16. Intel 称 14A 工艺关键指标 D0 提前一年达标,进度超台积电
快科技9月3日消息,Intel CFO透露1.4nm节点14A工艺D0缺陷密度提前一年达标今年6月14A缺陷密度已达D0 0.5,目标2027年一季度做到D0 0.1-0.2这意味着Intel有望比台积电提前半年甚至3个季度进入1.4nm时代,此前18A仅算追平,此番有望实现赶超。
🔗 https://news.mydrivers.com/1/1148/1148562.htm
🦾 机器人具身智能
17. 智元机器人开源 AGIBOT WORLD 2026 强化学习数据集
智元机器人开源 AGIBOT WORLD 2026 主题 3:强化学习,面向真实世界机器人学习的具身智能数据集。数据集含 14 项真实世界任务、11430 条轨迹,捕捉从示范到部署全过程的成功、失败与人工纠正,并提供针对进度、错误与干扰的细粒度标注与人在回路纠正轨迹。以下是官方给出的 demo
🔗 https://x.com/AGIBOTofficial/status/2095402214324072731
📌 模型排行榜
18. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜Claude Fable 5.1以66分登顶,Claude Opus 5以63分居次,Muse Spark 1.3以62分第三。智能体榜Fable 5.1以61分领跑,Muse Spark 1.3与Claude Opus 5同以59分并列第二。开源GLM-5.3亮眼,居智能体榜第4名(59分)。
🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs
以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。