🎬视频版直达:https://www.bilibili.com/video/av117346039502634/
💡今日趋势速览:DeepSeek V4.1 Pro 被曝进入早期测试,官方尚未证实,Gemini 4 Pro 泄露跑分并将上下文扩至 200 万 token,MiniMax M3.1 Flash 预览版登陆 Token Plan 主打高并发场景,同日多家巨头密集曝光新品信息,模型竞争进入白热化阶段
🎯 今日要点
- DeepSeek V4.1 Pro 被曝进入早期测试
- MiniMax M3.1 Flash 预览版上线 Token Plan
- Gemini 4 Pro 泄露跑分:上下文扩至 200 万 token
📋 今日内容汇总
🤖 AI动态
- DeepSeek V4.1 Pro 被曝进入早期测试
- MiniMax M3.1 Flash 预览版上线 Token Plan
- Gemini 4 Pro 泄露跑分:上下文扩至 200 万 token
- Gemini 3.5 Pro(gemdelta)发布前最后一刻被砍
- Claude Sonnet 5.5 客户端配置曝光,发布临近
- Nano Banana 2.5 Flash 在 Flow 中被改标为 2.1
- Gemini 网页版被曝支持技能,Gems 将转型
- 科研智能体 OpenScience 结束测试版并登陆 Product Hunt
- Claude Code 推出 plugin eval 插件评测命令
- Supersonic Labs 发布 1.443 亿参数决策模型 Julia-1
- ChatGPT dots 功能内部代号曝光:orbit、aeon 与 o
- 微软开源可自我改进的 AI 技能框架 SkillOpt
📦 开源项目
- GitHub 热榜 8 项目盘点,Paperclip 星标破 8.5 万
- 开源项目 Rome 为 AI 智能体打造可积累技能的共享工作区
📌 模型排行榜
- Artificial Analysis AI 模型能力排行榜
🤖 AI动态
1. DeepSeek V4.1 Pro 被曝进入早期测试
据泄露消息,模型标识符 deepseek-v4.1-pro 已按账户进入早期测试阶段,并被刻意从公开模型选择器中隐藏,外界据此推测其正式发布已为时不远。DeepSeek 官方尚未证实该消息,最终规格与上线时间仍以官方公告为准。
🔗 https://x.com/LuminaBench/status/2104256356283011360
2. MiniMax M3.1 Flash 预览版上线 Token Plan
来源:原文 | Lumina (AI Leaks) (Twitter)
MiniMax M3.1 Flash 预览版现已在 Token Plan 上线,模型更快更轻,专为高并发、延迟敏感工作负载的团队打造,现有订阅用户无需额外设置即可调用。与此同时,该模型也已正式登陆 MiniMax Code,为日常开发设计,快速可靠,无论是修复 Bug 还是开发完整功能都能胜任。
🔗 https://x.com/MiniMax_AI/status/2104256406786547800
3. Gemini 4 Pro 泄露跑分:上下文扩至 200 万 token
泄露数据显示,Gemini 4 Pro 在 DeepSWE v1.1 拿到 88.7%、Terminal-Bench 2.1 拿到 95.3%、OSWorld-2.0 拿到 86.8%,GDPval-AA v2 跑出 2064 Elo;上下文扩至 200 万 token,定价为每百万 token 输入 2.25 美元、输出 11.25 美元。所有数据均未经官方证实。
🔗 https://x.com/EbiThinks/status/2104168520556724361
4. Gemini 3.5 Pro(gemdelta)发布前最后一刻被砍
有开发者透露,谷歌在一切均已为最终发布准备就绪的情况下,于最后一刻取消了 Gemini 3.5 Pro,其内部标识符为 gemdelta。取消原因至今未获官方说明,这款临阵被撤的模型也引发外界对谷歌产品线规划的诸多猜测。
🔗 https://x.com/lyraxana/status/2104201102384119874
5. Claude Sonnet 5.5 客户端配置曝光,发布临近
据爆料,一份公开的生产客户端构建产物中出现 claude-sonnet-5-5 专属模型配置,同一产物还引用了 claude-opus-5-5。该标识此前已现身 Droid 0.228.0 模型注册表并藏于功能开关之后,Sonnet 5.5 目前疑似处于灰度测试阶段,距离正式发布或已不远。
🔗 https://x.com/Mr_Salio/status/2104178854633849145
6. Nano Banana 2.5 Flash 在 Flow 中被改标为 2.1
谷歌已在 Flow 中将 Nano Banana 2.5 Flash 的模型标注悄然改为 Nano Banana 2.1,外界推测这只是一次小版本更新。目前官方尚未说明改动原因,新标注也尚未正式上线,后续是否伴随模型能力变化仍待观察。
🔗 https://x.com/testingcatalog/status/2104218540567924747
7. Gemini 网页版被曝支持技能,Gems 将转型
据泄露消息,Gemini 网页版现已支持技能功能,并计划自 2026 年 11 月 17 日起把所有 Gems 转变为技能,被视为一次实用升级。谷歌官方尚未公告该变化,具体迁移方式与存量 Gems 的兼容细节仍待确认。
🔗 https://x.com/LuminaBench/status/2104189064782176358
8. 科研智能体 OpenScience 结束测试版并登陆 Product Hunt
OpenScience 宣布正式走出测试版并登陆 Product Hunt,新版带来更快的研究工作区 IDE,模型聚合服务收录 30 多款模型,含 GPT-6 Astra、Kimi K3、GLM-5.3 等,共用按量付费钱包。Autoresearch 可在给定指标后自主迭代实验,平台已被 30 多所高校采用,免费且开源。
🔗 https://x.com/SynScience/status/2104231436052271495
9. Claude Code 推出 plugin eval 插件评测命令
claude plugin eval 是 Claude Code 的新增命令:它会将插件针对一组测试用例运行并评分,再在不启用插件的情况下逐条重跑用例,直观呈现有无插件的差异。开发者可借此检验插件实际价值,例如在 Opus 5.5 发布后核查付费插件是否仍物有所值。
🔗 https://x.com/adocomplete/status/2104019331025883493
10. Supersonic Labs 发布 1.443 亿参数决策模型 Julia-1
AI实验室Supersonic Labs发布轻量决策模型Julia-1,参数仅1.443亿,接收上下文与2到20个候选答案,完成分类、打分和是非判断,可为Agent选工具或路由。该模型基于mmBERT-small开发,权重550MB,M4上单次决策中位延迟约33毫秒,训练成本约104美元,已按Apache 2.0开源。
🔗 https://x.com/0xLogicrw/status/2104013751632683250
11. ChatGPT dots 功能内部代号曝光:orbit、aeon 与 o
9月26日ChatGPT网页版代码显示,dots功能内部关联orbit、aeon与可能的o三个代号,配置项为orbit_enabled。在此基础上,该博主推测o是OpenAI下一款产品,面向Pro档位,可能于周二开发者大会正式揭晓。另有消息称,其将于本周四正式发布,Codex Plus用户将无法使用。
🔗 https://x.com/0x0SojalSec/status/2104275605428785512
12. 微软开源可自我改进的 AI 技能框架 SkillOpt
微软把能自我改进的技能优化框架 SkillOpt 开源,它会评估智能体的任务表现,据此重写自身指令,未通过基准测试的改动会被否决,优化后的技能还可跨模型迁移复用。目前代码仓库已公开,开发者可直接查看源码上手试用。以下是官方给出的 demo
🔗 https://x.com/RoundtableSpace/status/2104235868298924252
📦 开源项目
13. GitHub 热榜 8 项目盘点,Paperclip 星标破 8.5 万
Paperclip 登上 GitHub 今日热榜第一,单日新增 2000 多个 Star,总量突破 8.5 万。它把 Claude Code、Codex、Cursor 等编码 Agent 接入统一管理,分配岗位目标与任务,还提供审批、预算和审计记录。该项目适合已在协调多个 Agent 的团队,若只用一个 Agent 处理零散任务,治理流程反增负担。
🔗 https://mp.weixin.qq.com/s?__biz=MzUxNjg4NDEzNA==&mid=2247537385&idx=1&sn=6f57abbd0554d6288c4aa1b3566ef704
14. 开源项目 Rome 为 AI 智能体打造可积累技能的共享工作区
开源项目Rome为AI智能体打造可积累技能的共享工作区,智能体可在其中构建自己的工具,验证有效的技能长期保留供后续复用。项目定位为人类与智能体协作的智能体操作系统,可作为Grok Bot和Meta的Muse的开源替代方案,代码已公开,目前获597颗Star和52次Fork。
🔗 https://github.com/rome-os/rome
📌 模型排行榜
15. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜头部由Claude Opus 5.5(max with fallback)以58分领跑,Claude Fable 5.1与GPT-6 Astra同以53分并列第二。开源与国产模型表现亮眼:MiMo-V2.6-Pro以46分位列第9,Qwen3.8 Max以45分排名第10,双双在榜。
🔗 https://artificialanalysis.ai/
以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。