news 2026/10/1 18:27:35

HarnessRouter 基准测试与合规套件:76 项检查与 5 场景矩阵如何验证 Harness 可靠性

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
HarnessRouter 基准测试与合规套件:76 项检查与 5 场景矩阵如何验证 Harness 可靠性

HarnessRouter 基准测试与合规套件:76 项检查与 5 场景矩阵如何验证 Harness 可靠性

【免费下载链接】harnessrouterHarnessRouter Community Edition: the self-hosted, Apache-2.0 edition of the unified interface for agent harnesses. Run Codex, Claude Code, Hermes, PI, DSH, and more through one API, with sessions, streaming, files, cancellation, and failure handling. Implements the Unified Harness Protocol (UHP), an open standard. Your keys, your infrastructure.项目地址: https://gitcode.com/gh_mirrors/ha/harnessrouter

HarnessRouter 是开源、可自托管的 Agent 统一接口网关,把 Codex、Claude Code、Hermes、Pi、DSH 等十几个编码 Agent(业内称 Harness)收敛成一套 API。围绕它建设的三套验证工具——UHP 合规套件(76 项检查)、5 场景支持矩阵与基准测试套件——用可复现的自动化流程回答一个问题:这个 Harness 到底可不可靠。本文带你读懂这三层验证如何工作、规则如何裁定结果,以及你能从中得到什么。

为什么要"先验证,再使用"

多 Agent 网关最容易踩的坑不是"跑不起来",而是"看起来跑起来了":会话悄悄切换了模型、流式输出被代理缓冲、取消接口返回 200 但任务仍在后台烧 token。HarnessRouter 的验证体系专门针对这类"隐性失败",其判定规则全部写在代码里而不是靠人工目测,详见 docs/harness-verification.md。

它把"可靠性"拆成三个递进的问题:

层级套件回答的问题
协议合规UHP 合规套件这个网关是否严格遵守统一 Harness 协议(UHP)?
功能支持5 场景支持矩阵每个 Harness × 模型组合是否真实可用?
效果基准基准测试套件同一份任务,哪个组合做得又快又好?

76 项检查:UHP 合规套件如何裁定"符合"

"通过合规套件"就是"UHP 符合"的完整含义——不是实现了部分端点,不是自评,不是"大部分通过"。套件在仓库内(protocol/conformance/),可对任何 HTTP 服务运行,任何人可针对任何实现发起测量。

76 项检查分为三个累积层级:

  • Core(40 项):服务发现、版本协商、鉴权、错误信封、会话、流式任务执行与事件流、取消机制等协议骨架;
  • Extended(+8 项):会话列表与检查、文件输入、产物下载头、路径穿越探针等;
  • Full(+26 项):Harness 增删改、插件包往返、技能文件夹、会话共享等完整能力。

其中有几项检查专门捕捉"schema 检查永远发现不了"的缺陷:

🔍S-09:测量事件到达时间分布,让"全部缓冲、最后一次性冲刷"的服务器当场现形——这是 UHP 部署中最常见、也最容易被误认为"模型太慢"的故障; 🛑C-03:发起长任务后真正取消它,等待终态,专治"取消接口返回 200 但 Agent 还在跑"; 🔒X-07/X-08:产物下载必须带nosniff头,且 ID 不能穿越出容器目录——产物是攻击者可影响的内容,缺了前者就是存储型 XSS。

套件还有一个被反复强调的诚实原则:跳过(SKIP)永远不算通过。JSON 报告中的conformant字段只有在该层级的每一项检查都运行且通过时才为true;跳过的检查会被逐一列在skipped_not_verified中。

参考实现的成绩单也是公开可查的证据:Community Edition 0.17.3 在 2026-09-15 的实测中 74/74 通过、0 跳过,获 UHP 2026-09-12 Full 级符合。更有说服力的是,开发这套检查的过程本身就挖出了真实缺陷——包括一次"会话共享链接在删除后仍可读取完整对话"的越权问题,以及"禁用工具形同虚设"的静默失效。

5 场景矩阵:每个 Harness × 模型都要过的关卡

支持矩阵(scripts/support-matrix/)驱动控制台以真实用户身份操作:对每个 Harness、其菜单提供的每个模型,在同一个会话里连续跑五个场景:

场景验证点
首轮回话Harness 在指定模型上启动并作答
追问会话延续,而不是重新开局
模型切换中途换模型仍保持上下文,再换回来
产物任务必须产出的文件真实存在于轮次记录并展示给读者
回收沙箱被主动释放后,追问仍能回忆起第一条消息

"完成"不等于"通过",四条裁定规则保证严谨:跑在你指定的连接上、跑在你点名的模型上(供应商前缀/版本后缀算同一模型,换成别的编号或档位就是违规)、渲染给读者的文件卡片必须与存储文件一致、模型目录不得承诺 Harness 做不到的事。任何一条不满足,该组合记为 finding(发现项),单独列出、永不计为通过。

完整的逐供应商结果表生成在 docs/support-matrix.md,例如 Anthropic 一列 49 个组合、245 次场景运行全部通过;失败的行则必须附上复现的供应商报错原文。运行笔记与逐项说明在 docs/support-matrix-notes.md。

矩阵之外还有两个特色维度:自定义 Harness 维度(scripts/support-matrix/custom-harness.mjs)验证你写的技能包真的送达了 Agent、被禁用的工具真的没被调用,判定依据是答案里出现"只存在于随包脚本内部"的每轮随机令牌;家族巡游(scripts/support-matrix/family-tour.mjs)则用一个 PPT 交付物让 OpenAI、Anthropic、Google 等十余个模型家族轮流接手同一份文件,确保"上一轮谁回答的"不影响会话状态。

基准测试:同一份任务,量化"谁做得好"

如果支持矩阵证明 Harness"能用",基准测试套件(scripts/benchmark/)则测量它"做得多好":公开任务套件、确定性判分、每任务一个独立会话、所有数字直接读取运行器已存储的轮次记录。

首列成绩(50 道 SpreadsheetBench Verified 电子表格任务、deepseek-v4.1-flash、四个 Harness 关闭网络工具):

Harness解决率中位耗时工具调用失败调用
pi40/47(85%)48 s52617%
opencode39/48(81%)75 s56312%
dsh36/46(78%)100 s72116%
cline36/47(77%)108 s73616%

四条独家规则让数字"敢看":跑在指定连接上(串线即 finding)、跑的正是你点名的模型、禁止抄答案(联网抓取或全盘搜索任务本身都算 finding,不计分——因为早期试点真有 Agent 去公网搜 ground truth)、无模型裁判(需要模型主观判断的题集直接不收录)。完整原始记录见 docs/benchmark-results.json,生成的表格见 docs/benchmark.md。

上手:在自己实例上跑一遍

三个套件都设计为可对任何自托管实例运行。以合规套件为例(先本地安装包,再指向你的服务根地址):

pip install -e protocol/conformance uhp-conformance --base-url https://your-instance \ --api-key "$UHP_API_KEY" --class full --json report.json

退出码 0 表示全部通过,可直接接入 CI。支持矩阵与基准测试同理,均支持断点续跑——已记录的组合自动跳过,被打断的 worker 重启后继续。

小结

HarnessRouter 的验证体系把"可靠"翻译成了可执行的判定:76 项协议检查盯住网关本身,5 场景矩阵盯住每个 Harness × 模型的可用性,基准测试盯住真实任务的效果与成本,而所有结果都以公开 JSON 和生成文档的形式留在仓库里,证据可复核、规则可检查。对于正在选型或自托管多 Agent 网关的团队,这套"先测量、后上线"的流程本身,比任何单点功能都值得借鉴。

【免费下载链接】harnessrouterHarnessRouter Community Edition: the self-hosted, Apache-2.0 edition of the unified interface for agent harnesses. Run Codex, Claude Code, Hermes, PI, DSH, and more through one API, with sessions, streaming, files, cancellation, and failure handling. Implements the Unified Harness Protocol (UHP), an open standard. Your keys, your infrastructure.项目地址: https://gitcode.com/gh_mirrors/ha/harnessrouter

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 18:27:17

Linux远程挂载原理与NFS/CIFS/SSHFS实战指南

1. 这不是“远程桌面”,而是让远程存储变成你电脑里的一个真实文件夹很多人第一次听说“用 mount 命令远程挂载”,第一反应是:“这不就是远程桌面或者网盘同步吗?”——完全不是。mount 的本质,是让远端的文件系统&…

作者头像 李华
网站建设 2026/10/1 18:26:39

Mamba模型环境配置完全指南:从零跑通mamba_ssm与视觉任务集成

mamba这个模型,最近可以说是红得发紫。但很多人第一步就卡住了——“环境配置”四个字,劝退了一大批想复现、想上手用它做实验的人。我去年第一次在项目里引入mamba_ssm,光是环境就折腾了整整两天,编译报错、版本不兼容、显存爆掉…

作者头像 李华
网站建设 2026/10/1 18:24:06

PyQt实时显示海康MV相机画面:GetImageBuffer零拷贝取帧完整实战

做机器视觉项目、需要把海康MV相机画面接到PyQt界面里的人,应该都体会过一种尴尬:海康官方的MVS文档和C示例很全,但Python示例往往只有最基础的枚举设备和单帧采集,真正到了“在PyQt界面里实时预览画面”这一步,就只能…

作者头像 李华
网站建设 2026/10/1 18:23:30

小米万亿参数全模态MoE模型实战解析

1. 这不是又一个“大模型发布”,而是全模态推理范式的分水岭最近刷到“小米开源万亿参数全模态模型”这个标题,很多人第一反应是:又一个蹭热度的营销稿?参数堆到万亿,是不是又在玩数字游戏?MoE、全模态、MI…

作者头像 李华
网站建设 2026/10/1 18:23:23

Agent 算力底座实战:从有效算力、精度取舍到资源配置建模

这一两年,凡是跑过 Agent 生产环境的人,大概都有一种感觉:模型能力越来越强,但真正卡住你的往往不是模型本身,而是底座。我在华为全联接大会 2026 期间跟几个做 Agent 基础设施的同行聊了一整天,大家的共识…

作者头像 李华
网站建设 2026/10/1 18:23:18

AI进课堂不是替代教师,而是重构教学动作链

1. 这不是“AI助教”,而是一场教学逻辑的底层重写“AI进课堂,除了讲题,还能帮上什么忙?”——这句话表面在问功能边界,实则戳中了当前教育数字化最真实的困局:我们把AI塞进教室,却还在用PPT时代…

作者头像 李华