❝
先说结论:Jev Harness 不是一个具体产品,而是一组围绕 TypeSafe 的专用决策模型 Jev 展开的「决策 / 生成 / 执行三权分立」思路,外加多个开源实现把它落地成编码代理(coding agent)的 token 优化门控层。GitHub 上挂着至少三个同名或近名的仓库,目的彼此并不相同,把它当成单一工具去评,会看走眼。
本文分四块往下走:1)先把 Jev 与 Jev Harness 的边界画清——Jev 是模型,Harness 是外壳与门控;2)拆解三权分立与 System One / System Two 的底层机制;3)看 token 经济学的具体数字与四类决策门;4)思考——命名通胀、作者自报基准、它到底不做什么,以及你该不该接。【把拍板、动手、兜底分开,系统才不容易在循环里把自己烧干】
一、先定义:Jev 是模型,Jev Harness 是外壳与门控层
先说一个误区:很多人把「Jev」和「Jev Harness」当成一个东西。核心点在于,二者处在不同的层。
Jev 是一个模型,准确说是 TypeSafe AI 的「System One」非自回归(non-autoregressive)决策模型。它不生成文本,只回答结构化问题,三种答案类型:
choice:从给定选项里挑一个;score:给某个对象打一个分;noul:一个「无 / 空」判定(no + null 合并,用来表达「这事我不做判断」)。
一次请求可以塞进多个问题,独立的图节点还能并发跑。延迟在 70–300ms,输出成本约$0.042 / 1M tokens——几乎不花 token。这个成本量级,是后面所有 token 优化的前提。
Jev Harness 是外壳与门控层,分两层含义:
- 概念层(TypeSafe 创始人 Diogo Almeida 的白皮书):把编码智能体的「决策、生成、执行」三种角色彻底切开。大模型只负责写代码和深度推理(System Two);Harness 负责工具调用等确定性动作;Jev 专管路由、评分与拦截(System One)。
- 工具层(开源实现,如
ismaelsoilet/jev-harness的 Rust/Python/TS 三端、tianyucodings/JevHarness的研究型 harness):把 Jev 包成决策门,插在编码代理和测试 / 编译反馈之间,做失败分流、循环中断、完成否决、模型路由。
最值得记的,是tianyucodings/JevHarness的 README 把这条边界讲得最清楚:task adapter 拥有观察、合法动作、副作用、打分;harness 拥有特征构造、Jev 判断、决策逻辑。这个边界让 harness 不能改写自己的 reward,也不能读隐藏任务状态。它是「可审计、可冻结」的真正前提,而不是一句口号。有趣的点又来了:正因为边界清楚,才能做到「author once, then execute」——作者 LLM 把策略写进显式代码后冻结,运行时每个决策不再拉作者 LLM。
二、三权分立与 System One / System Two 的底层机制
关键点在于,Jev Harness 把 Kahneman 的 System 1(快、直觉、校准过)/ System 2(慢、深思、生成式)范式,直接挪到了 agentic engineering 上。
- System 1 = Jev:非自回归、并行、类型化决策,70–300ms,$0.042/1M tokens 输出。它干的是「下一步走哪条路」这类选择题,根本不需要文本生成能力。
- System 2 = 前沿大模型(GPT-6 Astra、Claude Fable 5.1):写代码、解深层算法逻辑,贵且慢。
机制串起来是这样的:agent 跑命令 / 测试 → 拿到输出 → 失败则进 jev-harness gate(Jev 决策,约 70–300ms)→ 若skip_llm = True(缺依赖 / 抖动 / 琐事),就走确定性 shell 动作(pip/npm install、重试一次),0 前沿 token;若skip_llm = False(深层逻辑 bug),才把针对性 trace 送给前沿 LLM。实测口径下,成本降约 80%。
tianyucodings/JevHarness给了一个很能说明问题的样例:宝可梦对战(Pokémon battle)。作者 LLM 先写一个针对该任务的 harness(Python 代码 + Jev 问题),用回合 12 的真实请求举例——harness 算出 Slowbro 在伤害竞速中落后,给出四个合法动作,Jev 返回switch:2(换上 Scizor),概率 0.72,harness 接受这个选择。注意,这些概率只是「动作选择概率」,不是「胜率」。(这个最小幻觉原则,值得在别处也借鉴。)经过 5 轮 reflection(可选反思),选定 harness 在 Eval 上的胜率从 25%(3/12)升到 75%(9/12)。
但这个确实很重,很有误差传播:README 自己写明,这是 selection Eval set 上的样例结果,不是对 unseen game 的独立性能估计。把它当成年化收益,会高估。
三、token 经济学:数字与四类决策门
先看数字,再下结论。白皮书给出两组实测数据,都不来自二手自媒体,来自原作者的工程追踪。
其一,大小模型交替反而更贵。Opus 走到一半切到 Sonnet,再切回 Opus,一轮任务总账单$6.19;从头到尾只用 Opus,反而只要$4.15。切换比不切贵近 50%。原因实在:跨模型移交任务时,下游模型必须把完整上下文重新处理一遍,KV 缓存全部作废,前一次的 token 计算成本相当于被扔掉。
其二,token 大头不在写代码。读文件 + 搜索检索占据了56.2%的工具调用轮次,吃掉了46.5%的 token;而真正的写代码动作,token 占比不到 **10%**(见图3)。所以优化效率的核心战场是「检索过滤」——决定哪些文件值得读、哪些代码块值得保留、哪些搜索结果直接扔掉——不是生成速度。
围绕这点,白皮书给了一串工程技巧,每一条都直指「把 token 花在相关处」:
- 先提问后压缩:等用户提出具体问题,再由 Jev 对代码块动态打分,归入隐藏 / 短摘要 / 长摘要 / 完整保留四档粒度。
- 工具三层渐进式暴露:第一层常驻索引(系统提示词里只放几百个工具的单行极简描述);第二层按需解析(Jev 判断某工具可能用到,才动态拉完整 JSON Schema 注入);第三层单次文档(只在执行复杂调用时临时拉详细文档,用完就走)。工具库可以又大又全,上下文代价不再线性增长。
- 规则条件触发式注入:规则不再常驻系统提示词,而是按状态动态挂载——打开 tsx 文件自动挂前端组件规范,进入 billing 目录自动挂支付风险规则。这样绕过了智能体自身的上下文压缩机制,只要触发条件成立,规则就一直挂在上下文里,不会被误删。
落到工具层,ismaelsoilet/jev-harness把这套思路做成了四类决策门(可经 CLI / MCP / Git-CI 钩子 / 类型化 SDK 调用):
triage_test_failure:分类测试 / 编译错误(缺依赖 / 抖动 / 逻辑缺陷),判断能否跳过前沿 LLM 确定性修复;本地判定 <500µs,远程走 Jev 70–300ms。abort_check:比对拟执行下一步与历史失败记录,检测 doom loop(循环重构)或死路,建议停止。route_task:给出最小够用的模型档(确定性脚本 / 快速 flash / 重型前沿)。verify_completion:用证据核对验收标准,判断步骤是否真完成,避免无谓的复审循环。
此外还有modulate_reasoning_effort(推理强度调节)与should_nudge_continuation(判断是否该继续推一把)。命令安全拦截则从黑白名单升级为语义级:Jev 逐行读脚本内容,判断是否碰生产数据库、删关键目录、外发数据,再决定放行 / 追问 / 拒绝,整个过程零生成 token、毫秒级。这个是实话:它堵住了「命令名黑白名单只拦名字、拦不住名字无害脚本里藏rm -rf /」的语义漏洞。
四、思考:命名通胀、作者自报基准,以及它到底不做什么
先说结论式的提醒:Jev Harness 这个词,已经被用得有点通胀了。
命名通胀,至少三个 repo。GitHub 上同名 / 近名的至少有:tianyucodings/JevHarness(研究型,写任务专属 harness + 反思进化 + GEPA 选父)、ismaelsoilet/jev-harness(实用 token 优化门控,Rust/Python/TS + CLI/MCP/SDK)、AppitStudio/awesome-jev下的jev-harness(TypeScript 决策 harness,policy + 置信门 + shadow mode +jev-eval离线 CLI,且不隶属 TypeSafe)。把它们混为一谈,会看走眼——有的负责「让 LLM 写 harness 并进化」,有的只是「失败分流的门」。
基准多为作者自报。「提速 200 倍、降本 400 倍」「切换比不切贵近 50%」多来自原作者的实测 / 自报。社区尚未广泛独立复现;开源榜的评测也明确写「指标来自 GitHub API 推断,以官方 README / docs / Release 为准」。看数字时,把「自报」和「独立复现」分两栏,是基本素养。
它到底不做什么,边界要画清——它自己声明:不是编码代理本身;不是运行时监管(那是 Foreman);不是工具调用护栏(jev-guard);不是上下文筛子(Winnow)。它的定位是「编码代理与测试 / 编译反馈之间的 System 1.5 决策层」。
真实接入门槛也有两点。其一,实时模式会传输类型化问题和失败日志,得按数据合规要求评估网络访问与日志内容;离线 mock 模式不联网,适合先试。其二,Jev 模型本身依赖 TypeSafe API(或 Vercel AI Gateway),provider 行为不随模型别名锁定——stored responses 和 fresh calls 的可复现性保证不同,真要上线得把这点算进 SLA。
ROI 判断给一句话:如果你的代理已经频繁把 token 烧在「缺依赖 / 抖动 / 循环」这类可确定性处理的事上,加一层 System One 门控,ROI 成立;如果你的任务主要是深层算法推理,这层帮不上多少,反而多一层延迟与依赖。
总结
本文主要介绍了 Jev Harness 的两条线——概念层的「决策 / 生成 / 执行三权分立」,与工具层的「System One token 优化门控」,重点看了 Jev 的 choice/score/noul 机制、System One/System Two 的分工、token 经济学的实测数字(46.5% 检索 token、4.15),以及四类决策门的落地形态。
可迁移的判断标准:先分清楚「这是模型、是外壳、还是门控层」,再谈选型;任何把决策、生成、执行搅在一起的智能体,优化第一刀都应该切在「哪些决策根本不需要昂贵生成」上。
把决策的归决策、生成的归生成、执行的归执行,系统要稳,先得把权分清楚;人也是,懂得把「拍板」和「动手」分开的人,才不容易在循环里把自己烧干。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~