news 2026/9/29 23:17:28

DeepSeek V4.1 Pro开测!Gemini 4 Pro 跑分泄露!MiniMax M3.1 Flash 抢先上线! | 9月28日 AI日报

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepSeek V4.1 Pro开测!Gemini 4 Pro 跑分泄露!MiniMax M3.1 Flash 抢先上线! | 9月28日 AI日报

🎬视频版直达:https://www.bilibili.com/video/av117346039502634/

💡今日趋势速览:DeepSeek V4.1 Pro 被曝进入早期测试,官方尚未证实,Gemini 4 Pro 泄露跑分并将上下文扩至 200 万 token,MiniMax M3.1 Flash 预览版登陆 Token Plan 主打高并发场景,同日多家巨头密集曝光新品信息,模型竞争进入白热化阶段

🎯 今日要点

  1. DeepSeek V4.1 Pro 被曝进入早期测试
  2. MiniMax M3.1 Flash 预览版上线 Token Plan
  3. Gemini 4 Pro 泄露跑分:上下文扩至 200 万 token

📋 今日内容汇总

🤖 AI动态

  1. DeepSeek V4.1 Pro 被曝进入早期测试
  2. MiniMax M3.1 Flash 预览版上线 Token Plan
  3. Gemini 4 Pro 泄露跑分:上下文扩至 200 万 token
  4. Gemini 3.5 Pro(gemdelta)发布前最后一刻被砍
  5. Claude Sonnet 5.5 客户端配置曝光,发布临近
  6. Nano Banana 2.5 Flash 在 Flow 中被改标为 2.1
  7. Gemini 网页版被曝支持技能,Gems 将转型
  8. 科研智能体 OpenScience 结束测试版并登陆 Product Hunt
  9. Claude Code 推出 plugin eval 插件评测命令
  10. Supersonic Labs 发布 1.443 亿参数决策模型 Julia-1
  11. ChatGPT dots 功能内部代号曝光:orbit、aeon 与 o
  12. 微软开源可自我改进的 AI 技能框架 SkillOpt

📦 开源项目

  1. GitHub 热榜 8 项目盘点,Paperclip 星标破 8.5 万
  2. 开源项目 Rome 为 AI 智能体打造可积累技能的共享工作区

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. DeepSeek V4.1 Pro 被曝进入早期测试

据泄露消息,模型标识符 deepseek-v4.1-pro 已按账户进入早期测试阶段,并被刻意从公开模型选择器中隐藏,外界据此推测其正式发布已为时不远。DeepSeek 官方尚未证实该消息,最终规格与上线时间仍以官方公告为准。

🔗 https://x.com/LuminaBench/status/2104256356283011360


2. MiniMax M3.1 Flash 预览版上线 Token Plan

来源:原文 | Lumina (AI Leaks) (Twitter)

MiniMax M3.1 Flash 预览版现已在 Token Plan 上线,模型更快更轻,专为高并发、延迟敏感工作负载的团队打造,现有订阅用户无需额外设置即可调用。与此同时,该模型也已正式登陆 MiniMax Code,为日常开发设计,快速可靠,无论是修复 Bug 还是开发完整功能都能胜任。

🔗 https://x.com/MiniMax_AI/status/2104256406786547800


3. Gemini 4 Pro 泄露跑分:上下文扩至 200 万 token

泄露数据显示,Gemini 4 Pro 在 DeepSWE v1.1 拿到 88.7%、Terminal-Bench 2.1 拿到 95.3%、OSWorld-2.0 拿到 86.8%,GDPval-AA v2 跑出 2064 Elo;上下文扩至 200 万 token,定价为每百万 token 输入 2.25 美元、输出 11.25 美元。所有数据均未经官方证实。

🔗 https://x.com/EbiThinks/status/2104168520556724361


4. Gemini 3.5 Pro(gemdelta)发布前最后一刻被砍

有开发者透露,谷歌在一切均已为最终发布准备就绪的情况下,于最后一刻取消了 Gemini 3.5 Pro,其内部标识符为 gemdelta。取消原因至今未获官方说明,这款临阵被撤的模型也引发外界对谷歌产品线规划的诸多猜测。

🔗 https://x.com/lyraxana/status/2104201102384119874


5. Claude Sonnet 5.5 客户端配置曝光,发布临近

据爆料,一份公开的生产客户端构建产物中出现 claude-sonnet-5-5 专属模型配置,同一产物还引用了 claude-opus-5-5。该标识此前已现身 Droid 0.228.0 模型注册表并藏于功能开关之后,Sonnet 5.5 目前疑似处于灰度测试阶段,距离正式发布或已不远。

🔗 https://x.com/Mr_Salio/status/2104178854633849145


6. Nano Banana 2.5 Flash 在 Flow 中被改标为 2.1

谷歌已在 Flow 中将 Nano Banana 2.5 Flash 的模型标注悄然改为 Nano Banana 2.1,外界推测这只是一次小版本更新。目前官方尚未说明改动原因,新标注也尚未正式上线,后续是否伴随模型能力变化仍待观察。

🔗 https://x.com/testingcatalog/status/2104218540567924747


7. Gemini 网页版被曝支持技能,Gems 将转型

据泄露消息,Gemini 网页版现已支持技能功能,并计划自 2026 年 11 月 17 日起把所有 Gems 转变为技能,被视为一次实用升级。谷歌官方尚未公告该变化,具体迁移方式与存量 Gems 的兼容细节仍待确认。

🔗 https://x.com/LuminaBench/status/2104189064782176358


8. 科研智能体 OpenScience 结束测试版并登陆 Product Hunt

OpenScience 宣布正式走出测试版并登陆 Product Hunt,新版带来更快的研究工作区 IDE,模型聚合服务收录 30 多款模型,含 GPT-6 Astra、Kimi K3、GLM-5.3 等,共用按量付费钱包。Autoresearch 可在给定指标后自主迭代实验,平台已被 30 多所高校采用,免费且开源。

🔗 https://x.com/SynScience/status/2104231436052271495


9. Claude Code 推出 plugin eval 插件评测命令

claude plugin eval 是 Claude Code 的新增命令:它会将插件针对一组测试用例运行并评分,再在不启用插件的情况下逐条重跑用例,直观呈现有无插件的差异。开发者可借此检验插件实际价值,例如在 Opus 5.5 发布后核查付费插件是否仍物有所值。

🔗 https://x.com/adocomplete/status/2104019331025883493


10. Supersonic Labs 发布 1.443 亿参数决策模型 Julia-1

AI实验室Supersonic Labs发布轻量决策模型Julia-1,参数仅1.443亿,接收上下文与2到20个候选答案,完成分类、打分和是非判断,可为Agent选工具或路由。该模型基于mmBERT-small开发,权重550MB,M4上单次决策中位延迟约33毫秒,训练成本约104美元,已按Apache 2.0开源。

🔗 https://x.com/0xLogicrw/status/2104013751632683250


11. ChatGPT dots 功能内部代号曝光:orbit、aeon 与 o

9月26日ChatGPT网页版代码显示,dots功能内部关联orbit、aeon与可能的o三个代号,配置项为orbit_enabled。在此基础上,该博主推测o是OpenAI下一款产品,面向Pro档位,可能于周二开发者大会正式揭晓。另有消息称,其将于本周四正式发布,Codex Plus用户将无法使用。

🔗 https://x.com/0x0SojalSec/status/2104275605428785512


12. 微软开源可自我改进的 AI 技能框架 SkillOpt

微软把能自我改进的技能优化框架 SkillOpt 开源,它会评估智能体的任务表现,据此重写自身指令,未通过基准测试的改动会被否决,优化后的技能还可跨模型迁移复用。目前代码仓库已公开,开发者可直接查看源码上手试用。以下是官方给出的 demo

🔗 https://x.com/RoundtableSpace/status/2104235868298924252


📦 开源项目

13. GitHub 热榜 8 项目盘点,Paperclip 星标破 8.5 万

Paperclip 登上 GitHub 今日热榜第一,单日新增 2000 多个 Star,总量突破 8.5 万。它把 Claude Code、Codex、Cursor 等编码 Agent 接入统一管理,分配岗位目标与任务,还提供审批、预算和审计记录。该项目适合已在协调多个 Agent 的团队,若只用一个 Agent 处理零散任务,治理流程反增负担。

🔗 https://mp.weixin.qq.com/s?__biz=MzUxNjg4NDEzNA==&mid=2247537385&idx=1&sn=6f57abbd0554d6288c4aa1b3566ef704


14. 开源项目 Rome 为 AI 智能体打造可积累技能的共享工作区

开源项目Rome为AI智能体打造可积累技能的共享工作区,智能体可在其中构建自己的工具,验证有效的技能长期保留供后续复用。项目定位为人类与智能体协作的智能体操作系统,可作为Grok Bot和Meta的Muse的开源替代方案,代码已公开,目前获597颗Star和52次Fork。

🔗 https://github.com/rome-os/rome


📌 模型排行榜

15. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜头部由Claude Opus 5.5(max with fallback)以58分领跑,Claude Fable 5.1与GPT-6 Astra同以53分并列第二。开源与国产模型表现亮眼:MiMo-V2.6-Pro以46分位列第9,Qwen3.8 Max以45分排名第10,双双在榜。

🔗 https://artificialanalysis.ai/

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 23:17:20

OpenClaw + Hermes + Vibe Coding:从零搭建你的“终极AI科研工作台”——模型部署、Agent编程、论文写作与知识管理全链路实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/29 23:13:22

Modbus RTU通信不稳?从RS485波形、时序到CRC校验的实战排查指南

1. 为什么我要把Modbus RTU的波形、时序和CRC单独拎出来讲搞工业自动化和嵌入式开发的人,对Modbus RTU这三个字肯定不陌生。它简单、开放、生态成熟,几乎每一台PLC、每一块仪表、每一个传感器都愿意支持它。但就是这么一个看起来“没什么技术含量”的协议…

作者头像 李华
网站建设 2026/9/29 23:12:44

Vscode+Continue+Cline 配 TaoToken:打造属于自己的 cursor 工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华