从 GLiNER 到 Jev:轻量决策模型开源生态正在爆发,2026 下半年的新风口浮现
【免费下载链接】GLiNER2.5-Decide项目地址: https://ai.gitcode.com/hf_mirrors/fastino/GLiNER2.5-Decide
如果说 2025 年的主线是 Agent 学会"动手",那么 2026 年下半年的暗线已经浮出水面:模型开始学会"判断"——而且不是靠生成一段理由,而是直接输出一个能驱动程序分支的概率值。
这条线索在 9 月突然加速。9 月 15 日,TypeSafe AI 发布决策模型 Jev,两周之内社区就长出了 28 个衍生项目;几乎同一时间,fastino 团队的 GLiNER2.5-Decide 以 340M 参数在 17 领域基准上把 4B 级大模型甩在身后。两条看似独立的生态线,正在收敛到同一个接口形态:封闭选项 + 概率输出,一次前向,零 token 生成。本文结合社区舆情与 GLiNER2.5-Decide 仓库源码,拆解这个正在爆发的"轻量决策模型"赛道。
一条新赛道:从"会写字"到"会做判断"
先厘清 Jev 是什么。它是 TypeSafe AI 于 2026 年 9 月 15 日发布的首款 System One 模型,训练方法为 RLCD(Reinforcement Learning for Calibrated Decisions),目标是让模型报出的概率尽量贴近真实正确率。它与聊天模型截然相反:不写句子,只回答三类结构化答案——choice(从给定选项里选)、score(按有序量表打分)、noul(给出是/否的概率)。所有问题对着同一份 state(工单、日志、邮件、JSON、文档片段)并行评估,一次往返返回程序能直接分支的值,单问题延迟约 70–500 毫秒,且几乎不随问题数线性爆炸。
社区在抄的从来不是"又一个聊天机器人",而是一种新接口:软件把判断权交给模型,模型只在封闭选项里给概率,程序自己决定怎么分支。这正是 GLiNER2.5-Decide 从 GLiNER 家族里长出来的原因——它把信息抽取时代积累的 span 匹配技术,改造成了面向运营决策的专用分类器。
Jev 生态 28 个项目:复刻 8 个、应用 20 个,接口形态是第一资产
对 28 个 Jev 生态项目去重梳理后,结构非常清晰:8 个"Open Jev"复刻决策模型本身,20 个应用项目把 Jev 塞进浏览器操作、Agent 基建、实时控制与数据流水线。
复刻派的技术路线分化本身就是一份难得的行业标本:
- 读现成大模型分数:SemIf 冻结 Qwen3.5-4B,不解码任何 token,只取固定选项位置的 logits 做 softmax,RTX 3090 上 21 个二元判断约 1.02 秒,102 行可对齐子集一致率约 84.5%(Jev 为 88.3%);Simple Jev 更进一步,把公共说明与 state 做成共享前缀缓存 KV,每个问题只跑自己的后缀。这条路线证明"接口形态可以当天复刻",但概率没有按 RLCD 校准。
- 专用编码器 + 决策头:Laya 用 ModernBERT/mmBERT 编码 state 与选项,T4 上单问题 p50 约 32.8ms,比 Jev 公布的延迟快 7–8 倍,但 Banking77(77 个意图)只有 42.5%;Von 约 395M 参数,以 Option-Marker 并行选项注意力一次前向同时处理 Choice/Noul/Score,本地十几毫秒。
- 改造大模型:Kev 给 Qwen3.5 加决策结构,Kev-9B 在新来源测试集约 83.7%;Nimble 用"近乎相同的两段材料、只翻转一个事实"的对比训练配方,把 Qwen3.5-9B 练到 90.12%,逼近 Jev 的 93.21%。
- 换一种生成物理:OpenJev 用 NVIDIA 量化的 DiffusionGemma 26B-A4B 对一整块"画布"去噪,一次填多个答案槽位,格式上不可能写出 schema 以外的东西。
应用派的 20 个项目则揭示了一个更重要的规律:写和想归大模型,判和选归决策模型,执行权留在确定性代码里。从浏览器自动化(jev-ultrafast 把网页编成控件表,7 秒搜完 Google Flights)、上下文治理(fast-jev-compaction 把 18.8 万 token 会话压到 3.3 万)、MCP 判断工具箱(typesafe-mcp、jev-mcp),到代码审查门禁(Canny 的原则是"事实归代码,判断归 Jev,只有事实能否决")、模拟器闭环控制(typesafe-mario 读内存打马里奥)——这些项目全部共享同一个设计:Agent 仍负责改文件、跑命令,决策模型只提供廉价的类型化判决。
GLiNER 家族的位置:不为复刻接口,而为重建决策本身
GLiNER 家族走的是另一条更"重"的路。它从命名实体识别起家,2025 年 7 月的 arXiv 论文(2507.18546)提出 GLiNER2:以 schema 驱动接口在一个高效模型内统一 NER、文本分类与层级结构化抽取,保持 CPU 可跑与紧凑体积。GLiNER2.5-Decide 正是这条技术线在"决策"场景的定向延伸。
仓库源码把设计动机暴露得很彻底。打开 config.json:模型类型为gliner2,架构注册为Gliner2ForSchemaExtraction,编码器是 24 层、hidden size 1024 的 DeBERTa-v3-large(340M 参数),头部采用 span 架构(span_mode: "markerV0"、max_width: 8),并配有 counting LSTM 层。而 special_tokens_map.json 中的一组结构标记——[SEP_STRUCT]、[SEP_TEXT]、[P]、[C]、[E]、[R]、[L]、[EXAMPLE]、[OUTPUT]、[DESCRIPTION]——揭示了它的工作机制:标签集不是训练时固化的输出层,而是作为输入的一部分被 token 化、与文本一起编码,分类被建模为 span 与选项的匹配问题。这解释了它为什么能"调用时传入任意标签集,无需重训练"。
README.md 给出了完整的接口面。一次classify_text调用可以同时打分多个决策头,比如邮件分诊一次拿回意图、紧急度与路由三项结论:
model.classify_text( "From: compliance@group.example\nSubject: Protocol update — action required today\n\nPlease confirm the new retention rule is applied before Friday's audit.", { "intent": ["fyi", "request", "approval", "complaint", "newsletter", "security_alert"], "urgency": ["low", "normal", "high", "critical"], "route": ["support", "billing", "legal", "security", "finance", "archive"], }, ) # 输出示例:{"intent": "request", "urgency": "high", "route": "legal"}三个进阶能力则直接对齐了 Jev 生态复刻派正在攻克的两个难点:
- 多标签与阈值调控:
multi_label: True配合cls_threshold控制精度/召回,一次抓全产品方面(电池、键盘、屏幕同时命中); - 带自然语言描述的标签:
labels可以携带描述(如card_pin_change: "The customer wants a new PIN..."),描述参与决策,让私有分类体系在小模型上保持精确——这正是 Verdict 类项目"描述参与语义"思路的工程化版本; - 序数评分:把
"0"到"10"作为普通字符串标签,一次前向得到可排序的细粒度输出,对应 Jev 的 score 能力。
微调侧的差异同样关键。仓库内置了标准 JSONL 训练格式(README.md 的 Fine-tuning 章节):一行一个样本,classifications数组里每个对象对应一个决策任务,字段与classify_text完全对齐——task、labels、true_label、multi_label、prompt、label_descriptions。训练一个决策头只需:
from gliner2 import AutoExtractor from gliner2.training.trainer import ExtractorTrainer, TrainingConfig model = AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide") config = TrainingConfig(output_dir="out", num_epochs=3, batch_size=8) ExtractorTrainer(model, config).train(train_data="train.jsonl") tuned = AutoExtractor.from_pretrained("out/final")两条生态线的活跃度与位置差异
把两条生态线放在一起看,差异一目了然。Jev 生态是"接口爆发型":两周 28 个项目,热度全部集中在"封闭选项 + 概率输出"这个接口形态上,复刻门槛被压到极低(读 logits 当天就能跑通),应用端则迅速向 Agent 基建渗透——MCP 工具、代码审查 hook、上下文治理、浏览器控制。GLiNER 家族是"基准沉淀型":它以统一的 fast-decisions 基准(17 领域、每领域 300 条留出样本、同一文本与候选标签)锚定横评坐标,通过 340M / 1B / multi-Decide 的版本矩阵覆盖英文、多语言与算力差异场景,靠基准数字和工程工具链说话。
横评数据本身就是最有说服力的生态信号(来源:README.md 的 Benchmark 表,fast-decisions 精确匹配准确率):
| 模型 | 平均准确率 |
|---|---|
| GLiNER2.5-Decide (340M) | 60.2% |
| GLiNER2.5-Decide-1B | 59.6% |
| JevK5 | 57.6% |
| GLiNER2.5-multi-Decide (287M) | 56.7% |
| SemIf (Qwen3.5-4B) | 56.4% |
| GLiFormer large-v1 | 49.0% |
| Laya Router | 46.6% |
注意两个耐人寻味的点:340M 版本超过了自家的 1B 版本,说明这个任务栈上参数并非越多越好;它同时压过了 Jev 生态里两条代表性复刻路线——读 logits 的 SemIf(基座还是 4B)与专用编码器的 Laya Router。考虑到 GLiNER2.5-Decide 完全本地可部署、Apache 2.0 许可、CPU 即可推理(README 明确标注 Runs on: CPU or GPU),这个数字的工程含义是:运营决策这一细分栈,专用小模型已经越过了"够用"门槛。
社区侧的印证同样密集。CSDN 上围绕 GLiNER2.5-Decide 已出现成体系的实战内容:340M 击败 4B 的基准解读、三款型号的选型指南(340M 英文版在英文任务上精度/成本最优、multi-Decide 是官方推荐的多语言方案、1B 面向可微调且有算力预算的场景)、客服工单路由与邮件分诊落地清单、多标签与阈值调参、CPU/GPU 本地部署与长文档分块策略;9 月底的一篇行业周报更把"轻量决策(GLiNER2.5-Decide)"与推理效率提升、运行时治理并列为 2026 年 9 月 AI 的主线之一。
风口判断:决策模型不是下一个 Agent,而是 Agent 的"决策器官"
回到标题的问题:决策模型会是下一个 Agent 吗?答案是——它不会取代 Agent,但会成为 Agent 基础设施里最稀缺的那块拼图。
支撑风口的三重证据:
其一,接口形态已经收敛。Jev 的 choice/score/noul、GLiNER2.5-Decide 的 schema 驱动分类、复刻派的 logits 读取,本质上都是"封闭选项 + 概率输出"。接口一旦收敛,工具链(MCP、hook、路由)就会快速补齐——Jev 生态 20 个应用项目已经演示了这一点。
其二,成本曲线被重构。决策模型不生成 token,输出免费;一次前向毫秒级完成;340M 参数可 CPU 部署。对比之下,让 4B 模型为"这句话是 refund_request 还是 shipping_delay"写 200 个 token,是纯粹的浪费。在 Agent 调用成本被逐轮审计的 2026 年,这是实打实的财务逻辑。
其三,评测体系开始成型。fast-decisions 基准让不同技术路线第一次在"同一文本、同一候选标签"下同台竞技,Jev 生态的复刻派也在各自搭建校准验证。有基准才有迭代,有迭代才有生态。
但也必须冷静:复刻派的概率校准普遍未达标(多篇源文明确提示生产前需自行分桶验证);选项数量有硬上限(OpenJev 的 choice 最多 128 个);GLiNER2.5-Decide 自己也承认"不是通用模型,不推理、不解释、不回答开放问题"(README.md 的 Details 章节)。它的边界恰好划在结构化运营决策:意图、路由、紧急度、审核、完成度判定、转人工门槛——这些任务的特点是答案空间封闭、错误代价可度量、需要毫秒级反馈,正是生成式大模型最不经济、而确定性规则又写不出来的中间地带。
所以更准确的判断是:2026 下半年爆发的不是"决策模型应用"的风口,而是"决策模型基础设施"的风口。Agent 负责生成与执行,决策模型负责在每一个需要分支的节点给出廉价、可校验的判断——Canny 的"事实归代码,判断归模型"、jev-review 的"模型打分、人改代码"、Prism 的"判断状态但不碰下单键",以及 GLiNER2.5-Decide 在工单路由、邮件分诊、Agent 完成度判定上的全部设计,指向同一个分工图景。
开发者现在值得做的事,与 Jev 生态总结里的建议一致:先在自己的系统里接一个最小决策场景——把意图识别、路由或审核分级从提示词里拆出来,交给一个能直接返回概率的分类器。模型会持续迭代,但"封闭选项 + 概率输出"这个接口形态,大概率是接下来两年 Agent 架构里最稳定的地基之一。
【免费下载链接】GLiNER2.5-Decide项目地址: https://ai.gitcode.com/hf_mirrors/fastino/GLiNER2.5-Decide
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考