news 2026/10/11 10:46:12

【AI 杂谈】只判断、不生成的模型,两周进了七家厂

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【AI 杂谈】只判断、不生成的模型,两周进了七家厂

只判断、不生成的模型,两周进了七家厂

10 月 1 日,三家在同一天进场

2026 年 10 月 1 日,Perplexity 发布pplx-decider-v1-27b,Cloudflare 发布Clef和Clef-flash,AWS 旗下 Strands Labs 发布Strands Decider 2B(来源:各家官方博客及 Hugging Face 模型卡)。三家做的是同一种东西:不生成文字、只输出判断的决策模型。

往前数 16 天,9 月 15 日,TypeSafe 才发布 Jev,第一次把「System One 决策模型」这个词摆上台面(来源:TypeSafe 官方博客)。一个品类从被命名到被头部厂商集体跟进,只用了两周。粗略数一遍,这期间先后下场的厂商超过七家。

一个「不写字、只判断」的模型,两周内被至少七家厂商跟进。

这是 AI 架构的一次分水岭,还是一次精明的重新贴牌?两边都不缺论据。

先看清这些东西到底是什么

Jev 由前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 推出。输入一段程序状态加一组预定义问题,它一次性返回结构化判定,三种原语:Choice(从你给的选项里选一个)、Score(按你划定的尺度打分)、Noul(一句是非判断,返回为真的概率),每个答案都带校准置信度(来源:TypeSafe 官方博客)。官方声称比前沿大模型快 40-200 倍、便宜 40-400 倍,定价 $0.042/百万输入 token,输出免费,因为它根本不写文字(来源:TypeSafe 官方博客)。

跟进者的路线各不相同。Perplexity 的 Decider 用 Qwen3.8-27B 微调,Apache 2.0 开源,自报 11 个基准、7210 样本上 85.71%,压过 Jev 的 84.51%,但 Jev 在 11 个里赢了 6 个(来源:Hugging Face 模型卡)。OpenAI 在 9 月 29 日 DevDay 预览 Decisions API,10 月 6 日转公开 beta,由 GPT-6 Luna 驱动,$0.10/百万输入 token(来源:OpenAI API changelog)。更早的 9 月 19 日,国内 APUS 已经用 Qwen3.5-9B 在本地复现了 Jev 的机制,封进fast-browser-use这个浏览器自动化 Skill(来源:央广网)。

密集到什么程度:OpenRouter 的 decisions 目录,9 月 28 日还是 7 条路由、4 家厂商,几天之内又涌进一批(来源:OpenRouter 模型目录)。

正方:这是必然的分层

Agent 一旦规模化,判断的量级会暴增。一次 agent 运行里有成百上千次工具调用、路由、门禁、校验,每一次都是判断点。自回归生成是逐 token 串行解码,延迟 O(n)、逐 token 计费;判断只需要单次前向,在封闭输出空间里打分,延迟 O(1)、成本固定。把判断留在生成模型里,等于每次「要不要重试」「该不该放行」都付一遍生成的钱、等一遍生成的延迟。

拆出来,能拿到延迟、成本,还有一样更值钱的东西:可校准的置信度。生成模型的「有把握」是软性的,你没法拿它做阈值判断;Jev 这类模型每个答案都带一个校准过的概率,低于阈值就拒绝执行。这让「判断」从黑箱变成可编程、可测试、可审计的组件。

分歧不在「判断该不该从生成里拆出来」,而在「谁来拆、怎么拆」。

反方:这是贴牌

分类头、router、guardrail,这些组件在生产环境里跑了很多年。所谓「决策模型」,多大比例是真创新,多大比例是旧组件被重新命名、定价、塞进一个新赛道?

命名乱象是个信号:System One、Decider、Clef、Strands Decider、d1、Span-01,每个名字都不一样,说明品类远未定型。更微妙的是 OpenAI。它的 Decisions API 不是独立训练的决策模型,而是在现有的 reasoning 模型 GPT-6 Luna 上套了一个/v1/decisions端点(来源:OpenAI API changelog)。这几乎是在说,决策能力是接口层的事,不是一个新模型的事。

Cloudflare 自己在发布 Clef 的同时,说这个市场「越来越饱和」,一周之内 Fastino 的 GLiDE、自家的 Clef、Perplexity 的 Decider 先后上线(来源:Cloudflare 官方博客,经第三方引述)。一边下场一边说饱和,这句话就是怀疑派藏在新闻里的注脚。

交锋:那个被借用的隐喻是错的

Jev 把名字借给卡尼曼的「系统 1」。但人类的系统 1 是并行的、模糊的、不可解释的直觉,比如开车时的条件反射;Jev 是确定性的、带校准置信度的、封闭输出空间的打分器。两者本质不同。

用「快思考」去命名一个确定性打分器,恰恰掩盖了它真正的价值。它的卖点不是「快」,是「可校准、可编程、可审计」。一个错误的隐喻正在反过来塑造工程师的设计心智:把它当成「快直觉」,你会高估它的智能、低估它的边界;把它当成「打分器」,你才会去核对它的校准曲线、设对阈值。

命名不是修辞问题,它决定了你怎么用这个东西。

回到账本:哪些判断值得拆

争论到最后,落点其实很窄:不是「决策模型是不是新东西」,而是「你的系统里,哪些判断值得拆出来」。

一条可用的标准:高频、低延迟敏感、封闭输出空间、需要审计的判断,拆出来。路由、筛选、评分、门禁属于这一类。低频、开放、创造性、一次性的判断,留在大模型里。按这条线切,正反两派其实不冲突。正方说的是「该拆的判断应该被产品化」,反方说的是「别把不该拆的也拆了」。

结尾

回到 10 月 1 日那三家公司。他们是看到了同一个未来,还是闻到了同一种 FOMO 的味道?


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 10:45:59

工控机总死机?从供电、散热到维护的故障根因与排查思路

我在这行干了十多年,听得最多的一句话就是:“你们那工控机怎么又挂了?”紧接着就是一通电话,把设备厂家从上到下骂一遍,甚至当场决定“下次全部换进口”。这种情绪我特别理解,产线一停,损失按分…

作者头像 李华
网站建设 2026/10/11 10:45:56

工业场景设备维修维护实战技巧 全流程标准化落地与常见问题排查指南

# 工业场景设备维修维护实战技巧 全流程标准化落地与常见问题排查指南工业场景的设备维修维护是保障生产连续性、降低运营成本、延长设备使用寿命的核心环节,传统依赖人工经验的运维模式普遍存在故障响应慢、处置不规范、经验无法沉淀、备件管理混乱等问题&#xff…

作者头像 李华
网站建设 2026/10/11 10:43:17

水果识别系统实战:轻量CNN+抗干扰数据增强+边缘部署

简介:本资源是一套面向人工智能初学者与深度学习实践者的水果识别分类系统完整项目包,聚焦卷积神经网络(CNN)在图像分类中的落地应用,解决农产品智能识别与科学贮藏辅助决策问题。资源包含2000个文件,主体为…

作者头像 李华
网站建设 2026/10/11 10:42:47

船只检测数据集VOC与YOLO双格式转换与训练实战指南

简介:这份船只检测数据集面向计算机视觉研究者、目标检测开发者及航海安全相关项目团队,用于训练和优化船只识别与定位模型。资源同时提供VOC与YOLO两种主流标注格式:VOC以XML文件记录每艘船的边界框与类别信息,YOLO则以TXT文件给…

作者头像 李华
网站建设 2026/10/11 10:42:22

Windows Server下UHD630驱动装不上?绕过限制手工安装与QSV硬解指南

简介:面向Windows Server 2016/2019下Intel UHD630核显驱动安装难题,这份驱动包提供了经过实测验证的可靠方案,目标用户是服务器管理员与IT运维人员。整套资源共347个文件,压缩包约268.35MB,文件类型以动态链接库、文本…

作者头像 李华
网站建设 2026/10/11 10:40:54

基于Python的微博情感分析系统:从文本分类到Flask部署全流程

简介:面向计算机相关专业毕业设计及NLP初学者,这份基于Python的微博情感分析与文本分类系统实现,覆盖了从数据采集、文本预处理、特征工程、机器学习模型训练到评估的完整流程,涵盖朴素贝叶斯、SVM、AdaBoost等经典算法&#xff0…

作者头像 李华