news 2026/10/7 10:07:21

llama.cpp 新特性:决策模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
llama.cpp 新特性:决策模型

原文:New in llama.cpp: Decision Models
发布日期:2026 年 10 月 2 日
作者:Xuan-Son Nguyen (ngxson)、Victor Mustar、ggml-org

llama.cpp 服务器现在通过/v1/systemone端点支持决策模型。你发送一个状态(文本、JSON、截图)和类型化问题,模型在单次前向传播中返回每个选项的概率。

API 遵循 TypeSafe 的 Jev 模型引入的 System One 格式,因此现有客户端只需更换 base URL 即可。实现细节见 PR #29818。

什么是决策模型?决策模型通过为你给定的选项打分来回答问题,而不是生成文本。聊天模型每个输出 token 需要一次前向传播,且输出仍需解析。决策模型只读取一次输入,其答案始终是你给出的选项之一,并附带概率。典型用途包括:路由请求、内容审核、检查 Agent 步骤是否成功、或选择下一步动作。

支持的模型

模型大小基于语言图片许可证速度*
Julia-1144MmmBERT-small50+否Apache 2.03 ms
Laya421MModernBERT-large英语否Apache 2.05 ms
Kev-4B4BQwen3.5-4B-Base英语否Apache 2.012 ms
lev4BQwen3.5-4B英语否Apache 2.036 ms
OpenJev27BQwen3.8-27Ben, de, fr, hi, zh, ja是CC BY-NC 4.043 ms
Clef27BQwen3.8-27B英语是Apache 2.0—

* 在单块 NVIDIA RTX PRO 6000 上回答一个问题的中位时间。

在 Decision models 合集 中查找这些模型,更多模型即将推出。社区 Decision Index 展示了它们的对比。

快速开始

从 llama.app 获取最新版 llama.cpp(或运行llama update),然后启动模型:

llama serve-hfggml-org/Kev-4B-GGUF

一个请求包含一个状态和一个或多个问题。问题有三种类型:

类型你发送你得到
choice选项(含可选描述)最佳选项 + 每个选项的概率
score2 到 10 个等级(从低到高)期望等级(可以落在两个等级之间)
noul是/否问题是(yes)的概率

发送包含状态和问题的请求:

curlhttp://localhost:8080/v1/systemone\-H"Content-Type: application/json"\-d'{ "state": "Customer message: I was charged twice for my order last week and nobody has replied.", "questions": { "route": { "type": "choice", "instructions": "Which team should handle this?", "criteria": { "billing": "payments, charges, refunds, invoices", "shipping": "delivery, tracking, lost or late parcels", "technical": "bugs, errors, login problems" } }, "angry": { "type": "noul", "instructions": "Is the customer angry?" }, "urgency": { "type": "score", "instructions": "How urgent is this?", "criteria": ["can wait", "this week", "today", "right now"] } } }'

响应(数值已四舍五入):

{"model":"ggml-org/Kev-4B-GGUF","answers":{"route":{"type":"choice","choice":"billing","probabilities":{"billing":0.9049,"shipping":0.0275,"technical":0.0676},"confidence":0.8574},"angry":{"type":"noul","noul":0.8208},"urgency":{"type":"score","score":2.2821,"legend":{"0":"can wait","1":"this week","2":"today","3":"right now"},"probabilities":{"0":0.036,"1":0.1937,"2":0.2225,"3":0.5478},"confidence":0.2821}},"usage":{"input_tokens":130,"output_tokens":0}}

完整参考见 服务器文档。

图片

某些模型(目前为 OpenJev)还可以读取图片,如文档或截图。视觉投影器会自动下载:

llama serve-hfggml-org/OpenJev-GGUF

例如,对上传的文档进行分类:

importbase64importrequestswithopen("document.png","rb")asf:image="data:image/png;base64,"+base64.b64encode(f.read()).decode()response=requests.post("http://localhost:8080/v1/systemone",json={"state":"A file uploaded by a customer.","images":[image],"questions":{"kind":{"type":"choice","instructions":"What kind of document is this?","criteria":{"invoice":None,"receipt":None,"contract":None,"other":None},},},})print(response.json()["answers"]["kind"]["choice"])# invoice

state也可以是聊天消息列表。任何image_url部分(data URL)都会被当作图片读取,与聊天补全相同。

多模型,单服务器

在路由模式下,模型按需加载,你可以在每个请求中选择一个:

llama servecurlhttp://localhost:8080/v1/systemone\-H"Content-Type: application/json"\-d'{"model": "ggml-org/Julia-1-GGUF:Q8_0", "state": "...", "questions": {...}}'

/v1/models列出所有 id。当只加载了一个模型时,model字段会被忽略。

使用技巧

  • 尝试不同大小的模型。小模型更快,大模型知识更丰富。Decision Index 对它们进行了比较。
  • 描述你的选项。Julia-1 在仅有标签时将"我被扣了两次钱"路由到shipping,而在每个选项都有描述时路由到billing(0.99)。
  • 为每个模型选择置信度阈值。常见的模式是对有信心的答案采取行动,其余的发送给人工。正确的阈值取决于模型:一个模糊的工单(“Hi, quick question about my account”)在 Julia-1 上得分 0.25,而在 Kev-4B 上得分 0.80。在选择阈值之前,请在你自己的示例上进行测试。
  • 批量处理问题。问题是独立回答的,Kev-4B、lev 和 OpenJev 只处理一次状态。
  • 尝试不同的量化。与任何 GGUF 一样,这些模型有多种精度可选,例如llama serve -hf ggml-org/Kev-4B-GGUF:Q8_0。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 10:07:18

PHP封装 GET 和 POST 请求函数详解:使用 cURL 调用 HTTP API

在 PHP 开发过程中,经常需要调用外部服务,例如: 支付接口短信接口数据接口AI API文件处理服务在线工具 API 这些服务大多数通过 HTTP 协议进行通信,因此 PHP 发送 GET 和 POST 请求是非常常见的开发需求。 PHP 中发送 HTTP 请求有…

作者头像 李华
网站建设 2026/10/7 10:07:03

酒店家具防潮秘籍:全流程防护解析

酒店客房家具防潮处理工艺解析在酒店运营中,客房家具的耐用性与舒适度直接影响宾客体验与品牌形象。潮湿环境易导致木材变形、开裂、发霉,进而影响家具外观与使用寿命。因此,科学有效的防潮处理工艺成为保障客房家具品质的关键环节。以下是常…

作者头像 李华
网站建设 2026/10/7 10:06:50

如何在 Linux 中检查网卡速度(NIC Speed):全面技术指南

网络接口卡(NIC,Network Interface Card),通常简称“网卡”,是计算机与网络通信的核心硬件组件。网卡速度(即链路速度,Link Speed)指的是网卡与交换机或路由器之间协商的最大数据传输…

作者头像 李华
网站建设 2026/10/7 10:04:48

PX4 日志分析与飞行异常诊断实战指南

一句话掌握:ULog 是二进制自描述日志格式,靠 F 段自带 schema(结构定义),解析器无需硬编码字段顺序,这是它优于 CSV 的根本原因;飞行异常诊断的入口是「用 EKF 测试比定位哪一路观测被拒绝或异常…

作者头像 李华
网站建设 2026/10/7 10:04:41

一句话生成爆款视频:WorkBuddy+Hypit本地工作流实战

1. 项目概述:用一句话生成爆款视频,不是玄学,是工具链的精准缝合“一句话复刻爆款视频”——这句话乍看像短视频平台的流量话术,但落到实操层面,它背后是一套可拆解、可复现、可批量化的视频生成工作流。我从去年开始系…

作者头像 李华