news 2026/9/21 2:31:25

Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵

Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵

【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs

Harvey LAB 是面向法律场景的大模型智能体基准测试项目,其核心配置项SWEEP_MATRIX定义了"模型扫描矩阵"——一组模型与推理强度(reasoning effort)的组合清单。本指南带你快速读懂这份矩阵的每个字段,并学会用它批量评测不同大模型完成法律任务的能力。

什么是 SWEEP_MATRIX?

SWEEP_MATRIX是扫描(sweep)工具的核心数据源,定义在 utils/sweep.py。它本质上是一个**"模型 × 推理强度"的组合表**,每一项都是一个字典,常见字段如下:

字段含义示例
model模型标识,可省略厂商前缀自动路由claude-sonnet-5gpt-5.6-sol
reasoning推理深度档位;None表示不支持思考模式low/medium/high/max
temperature可选,采样温度,仅个别条目显式指定0.7

扫描工具运行时会把「矩阵条目 × 任务」做笛卡尔积,生成所有待执行的组合,这就是"矩阵扫描"名字的由来。

矩阵里都有哪些模型?

当前矩阵覆盖 5 家厂商、20 多个模型,按厂商分组一目了然:

Anthropic 系列

  • claude-opus-4-8claude-sonnet-5:各跑 5 档推理强度(low/medium/high/xhigh/max),用于对比"思考越多是否表现越好"
  • claude-haiku-4-5-20251001:非推理模型,reasoningNone(见 utils/sweep.py)

OpenAI 系列

  • gpt-5.6-sol:4 档(low~max),gpt-5.6-terragpt-5.6-luna各 3 档,对应不同能力/成本层级

Google 系列

  • gemini-3.1-pro-preview(3 档)、gemini-3.5-flash(含minimal档)、gemini-3.1-flash-lite(无推理档位)

Mistral 与 Fireworks 托管模型

  • mistral-medium-3.5:默认配置 + 一个high推理档(显式设置temperature: 0.7,见 utils/sweep.py)
  • Fireworks 网关托管的kimi-k2p6glm-5p1glm-5p2nemotron-3-ultra-nvfp4,各含 4 档配置

💡 这种"同一模型多档位"的设计,正是基准测试的关键:固定任务、扫描推理强度,才能看清模型的成本—质量曲线。

如何筛选自己想测的模型?

命令行通过--models传关键词即可过滤矩阵,匹配逻辑在 matches_filter:既支持直接子串匹配(如sonnetgpt),也内置厂商别名——

过滤词实际匹配
anthropic所有claude模型
openai所有gpt模型
google所有gemini模型
fireworkskimiglmnemotron开头模型

还可以叠加--reasoning high只保留某一档推理强度,实现"厂商 × 档位"两级过滤。

配置 ID 与结果目录是怎么生成的?

每次运行都会生成确定性的配置标识,方便断点续跑与结果归档:

  • make_config_id:生成任务路径/模型短名-推理档位(无推理档时记为disabled
  • make_run_id:再追加时间戳,形成完整运行 ID
  • find_latest_run:查找该配置最近一次已完成运行——已完成的组合会自动SKIP中断重跑不会浪费已有结果

三步跑完一次完整扫描 🚀

扫描流程分为三个阶段:智能体执行 → 评审打分 → 报告生成(详见 utils/sweep.py 的main函数)。官方入口是utils/sweep.py,也可用兼容包装脚本 scripts/run_model_sweep.py。

第一步:先 dry-run 预览组合数

uv run python -m utils.sweep --task real-estate --models sonnet --dry-run

第二步:正式扫描(支持并行)

uv run python -m utils.sweep --task all --models opus gpt --parallel 8

第三步:只重跑评审或只重出报告

uv run python -m utils.sweep --task real-estate --eval-only uv run python -m utils.sweep --task real-estate --report-only

⚠️ 扫描前会自动执行预检(run_preflight):校验配置 ID 无冲突、任务可加载、task.json中存在评分标准(rubric),任一失败即中止,避免白烧 API 费用。

新手避坑清单

  • 评审模型独立于被测模型--judge-model默认claude-sonnet-4-6,不在矩阵内(见 evaluation/run_eval.py)
  • 超时保护:单个智能体运行超时 7200 秒、评审超时 1800 秒,超时即终止并计入失败
  • 评审并发受限:评审阶段并发自动压到 4(全量模式 8),防止触发 API 限流
  • --task支持四级粒度all/ 整个业务领域 / 嵌套工作流 / 单个任务
  • 完整流程可对照官方教程 docs/tutorial.md 的"Run A Sweep"章节,架构细节见 docs/architecture.md

小结

SWEEP_MATRIX用一份简洁的矩阵清单,就把"测哪些模型、开到多深、怎么命名结果、如何断点续跑"全部约定好。理解它的三个字段(model / reasoning / temperature)与两级过滤(--models+--reasoning),你就能像配置实验矩阵一样,系统化地比较各家大模型在真实法律任务上的表现。📊

【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/21 2:28:22

用户画像7大维度实战:从数据清洗到标签落地

用户画像这几年已经被说烂了,但真正能把画像做扎实、能直接支撑业务决策的大数据分析师,其实并不多。尤其是旅游网站这类垂直领域,用户的决策链路长、场景碎片化,画像要是只停留在“性别年龄城市”的粗粒度标签,那基本…

作者头像 李华
网站建设 2026/9/21 2:18:58

Nix 源码调试指南:从带调试符号的构建到 gdb/lldb 断点实战

开发工具CLI 【免费下载链接】nix Nix, the purely functional package manager 项目地址: https://gitcode.com/gh_mirrors/ni/nix 点击查看 免费下载 本篇指南面向需要深入 Nix(purely functional package manager)源码内部进行排障、内存…

作者头像 李华
网站建设 2026/9/21 2:16:57

基于STM32的DDS信号发生器设计:从原理到波形输出

简介:一份基于STM32的信号发生器系统设计与实现文档,定位为电子工程/嵌入式方向课程设计或毕业设计参考,面向需要掌握嵌入式信号发生器开发流程的本科生、研究生及工程技术人员。文档完整覆盖从需求分析、方案对比到软硬件实现全过程&#xf…

作者头像 李华