重磅:多家巨头密集发布决策模型,自动化开发成本将大幅降低
你可能很难想象,过去大半年里,全世界最聪明的工程师在搭建自动化程序时,都在干一件既滑稽又极度浪费算力的事。
比如系统刚收到一封客服邮件,程序需要判断:这到底是不是垃圾邮件?该转交给退款组还是维修组?为了做这个连小学生一秒钟就能决定的单选题,程序不得不把整段文字打包,发给拥有上千亿甚至上万亿参数的通用大模型。更要命的是,通用大模型天生是个停不下来的小作文写手,它得逐字吐出一长串分析,你的程序再写几行代码去这堆文字里费劲扒出那个选项。
这一套折腾下来,不仅要等上一两秒,还得按输出字数给模型厂商交钱。更有可能碰上大模型胡思乱想,硬生生造出一个预设选项之外的答案,直接让后面的自动化链路当场卡死。
就在刚刚过去的短短十七天里,海外科技圈突然掀起了一场针对这种笨拙方式的围剿。从一家前研究员创立的新公司,到科技巨头亚马逊、Cloudflare,甚至还有 OpenAI,四家公司像约好了一样,排着队在三周内密集发布了一类全新的东西:决策模型。
一、为什么杀鸡偏要用牛刀?
其实只要你近距离看过现在最流行的自动化智能体,就会发现一个让人哭笑不得的真相:在整个运行流程里,绝大多数调用根本不需要大模型去展示深邃的思考,也不需要它写出漂亮的文字。
智能体在绝大多数时间里,只是走到了一个个极其细碎的十字路口。比如抓取到一个网页,判断它是不是电商网站;比如收到一个工单,判断它紧不紧急;或者审查某个拟定的动作,决定要不要继续往下执行。
这就像一个分拣流水线。传送带上一秒钟飞过来几十件包裹,你需要的只是一根机械拨杆,迅速把箱子拨向左边或右边的滑道。但过去大家的做法,是给每个滑道前都派驻一位拿着高薪、博览群书的哲学家,让他把包裹端详半天,写下一整篇论证报告,最后才说一句「放左边」。
通用大模型的生成机制决定了它的慢和贵。它必须以词元为单位,一个词一个词地往外挤,每一个词的产生都要把全身数千亿的神经元重新调动一遍。即便你严令禁止它废话,强行让它只输出固定格式,底层的计算过程也无法省略。
更让开发者头疼的是稳定性。只要是写文章的生成模型,骨子里就带着天马行空的概率随机性。你给了它「是」和「否」两个选项,它偶尔会偏偏回复一句「这取决于具体情况」,直接让死板的代码流程彻底崩溃。
二、把模型的嘴封上,直接给选项打分
这个死结最早被一家叫 TypeSafe 的初创公司打破了。它的创始人 Diogo Almeida 曾是顶级研究员,亲历过主流大模型的诞生。他在 2026 年 9 月 15 日拿出了一个名为 Jev 的产品。
Jev 借用了经济学里的杰文斯悖论来命名:当某种资源(比如决策智能)的成本大幅下降时,人们对它的需求反而会迎来爆炸式的增长。Jev 提出了一个与大模型截然相反的逻辑:既然智能体在绝大多数节点上只需要做选择,为什么不做一个根本不会写小作文、只会做选择题的模型?
它把输入的状态(比如一张工单)和一组预先写死的固定选项一起吃进去,不再逐词往外蹦字,而是直接给每个选项打出一个精确的概率分数。
既然不写字,模型的嘴巴就被彻底缝上了。它从物理机制上斩断了胡言乱语的可能,绝不可能输出预设列表之外的内容。更重要的是,省去了漫长且昂贵的逐词吐字环节,整个判断过程被压缩到了极致。Jev 给出的成绩是在 70 到 500 毫秒内交出答案,每次调用的费用只有每百万输入基本单位 0.042 美元。
这个思路像一道闪电,瞬间劈开了大模型行业长期以来「参数越大越好、思考越深越好」的思维定势。市场对这种轻巧工具的渴求彻底爆发,TypeSafe 刚带着四千万美元种子轮融资出山不到三周,市场上就已经传出百亿美元估值的接洽意向。
三、三周内的扎堆围剿与拆解狂潮
但大厂们的鼻子比谁都灵敏,没人打算让这家创业公司独享蛋糕。
仅仅两周后的 9 月 29 日,OpenAI 在开发者活动上近乎顺带一提地公布了基于小模型 Luna 的决策接口,同样主打极速返回带置信度的预定义答案。
紧接着在 10 月 1 日,云基础设施大厂 Cloudflare 甩出了自研的开源决策模型 Clef 系列。这个基于二十七亿和九十亿参数骨干训练出的模型,把注意力全部放在了给分类打分上。在实际网络分类测试中,Clef 只用 2.2 秒就完成了抓取、渲染和分类,而最快的通用大模型花了 4.7 秒,速度拉开两倍以上。而在延迟对比上,九十亿参数的 Clef-flash 延迟中位数仅有 38.8 毫秒,足足比 Jev 快了大约十三倍。
几乎在同一时刻,亚马逊云科技也加入了战局。亚马逊杰出工程师 Marc Brooker 在看到 Jev 后,利用业余项目捣鼓出了 Strands Decider 2B,随后被官方正式收编开源。
亚马逊的改造手法极其具有代表性:它直接找来开源底座,干脆利落地把负责语言生成的头部结构彻底切掉扔掉,换上了一个只有区区一百万参数的自制指针头。底座躯干冻结不动,只微调极小比例的额外权重。
这个只有二十亿参数的小家伙,小到可以直接塞进普通开发者的笔记本电脑或者单张显卡里,在纯本地环境断网运行。在基准评测的简单题部分,它直接拿到了满分,并且在主流显卡上的决策延迟中位数仅在 106 毫秒上下。
面对一个判断题,传统通用大模型调动上千亿参数转一圈需要几秒钟,而这些经过手术式改造的轻型决策模型,在几十毫秒的眨眼之间就已经把精确的概率拍在了桌面上。
四、巨头免费掀桌,小而专的时代来了
如果说四家公司在短短十七天里扎堆发布是技术路线的共识,那么接下来巨头们的商业出招,则展现了商业世界最残酷的一面。
TypeSafe 原本设计的美妙商业蓝图,是靠着毫秒级的高速响应,向全网所有智能体开发者收取每次调用的服务费。但亚马逊和 Cloudflare 几乎在一夜之间,把这种能力彻底变成了开源代码。
两家巨头直接把模型的全部权重以极其宽松的开源协议免费挂在了开源社区上,甚至亚马逊连全部训练数据、训练脚本和评测配方都一并公开。开发者根本不需要去向任何外部接口按次付费,自己随便找台旧电脑或闲置显卡,就能直接跑起来。
这是一场在三周内完成的技术商品化。当大厂用免费和开源把底层基础设施的门槛铲平,智能体背后的架构分工也终于变得前所未有的清晰。
未来的复杂智能系统,绝不会是一个巨无霸模型包打天下。那些需要深刻推理、需要构思长篇大作的复杂规划,依然会交给昂贵、深邃的大模型去完成;但在漫长工作流里成千上万个需要分拣、路由、选工具、卡门槛的小岔路口上,驻守的将全都是这些几十毫秒内交卷、甚至在本地就能零成本运转的小特种兵。
当人们不再逼着大模型去做加减乘除和选择题,庞大的自动化软件体系,才算真正找到了走向高效率运作的钥匙。