Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
Harvey LAB 是面向法律场景的大模型智能体基准测试项目,其核心配置项SWEEP_MATRIX定义了"模型扫描矩阵"——一组模型与推理强度(reasoning effort)的组合清单。本指南带你快速读懂这份矩阵的每个字段,并学会用它批量评测不同大模型完成法律任务的能力。
什么是 SWEEP_MATRIX?
SWEEP_MATRIX是扫描(sweep)工具的核心数据源,定义在 utils/sweep.py。它本质上是一个**"模型 × 推理强度"的组合表**,每一项都是一个字典,常见字段如下:
| 字段 | 含义 | 示例 |
|---|---|---|
model | 模型标识,可省略厂商前缀自动路由 | claude-sonnet-5、gpt-5.6-sol |
reasoning | 推理深度档位;None表示不支持思考模式 | low/medium/high/max |
temperature | 可选,采样温度,仅个别条目显式指定 | 0.7 |
扫描工具运行时会把「矩阵条目 × 任务」做笛卡尔积,生成所有待执行的组合,这就是"矩阵扫描"名字的由来。
矩阵里都有哪些模型?
当前矩阵覆盖 5 家厂商、20 多个模型,按厂商分组一目了然:
Anthropic 系列
- claude-opus-4-8与claude-sonnet-5:各跑 5 档推理强度(
low/medium/high/xhigh/max),用于对比"思考越多是否表现越好" - claude-haiku-4-5-20251001:非推理模型,
reasoning为None(见 utils/sweep.py)
OpenAI 系列
- gpt-5.6-sol:4 档(
low~max),gpt-5.6-terra与gpt-5.6-luna各 3 档,对应不同能力/成本层级
Google 系列
- gemini-3.1-pro-preview(3 档)、gemini-3.5-flash(含
minimal档)、gemini-3.1-flash-lite(无推理档位)
Mistral 与 Fireworks 托管模型
- mistral-medium-3.5:默认配置 + 一个
high推理档(显式设置temperature: 0.7,见 utils/sweep.py) - Fireworks 网关托管的kimi-k2p6、glm-5p1、glm-5p2、nemotron-3-ultra-nvfp4,各含 4 档配置
💡 这种"同一模型多档位"的设计,正是基准测试的关键:固定任务、扫描推理强度,才能看清模型的成本—质量曲线。
如何筛选自己想测的模型?
命令行通过--models传关键词即可过滤矩阵,匹配逻辑在 matches_filter:既支持直接子串匹配(如sonnet、gpt),也内置厂商别名——
| 过滤词 | 实际匹配 |
|---|---|
anthropic | 所有claude模型 |
openai | 所有gpt模型 |
google | 所有gemini模型 |
fireworks | kimi、glm、nemotron开头模型 |
还可以叠加--reasoning high只保留某一档推理强度,实现"厂商 × 档位"两级过滤。
配置 ID 与结果目录是怎么生成的?
每次运行都会生成确定性的配置标识,方便断点续跑与结果归档:
- make_config_id:生成
任务路径/模型短名-推理档位(无推理档时记为disabled) - make_run_id:再追加时间戳,形成完整运行 ID
- find_latest_run:查找该配置最近一次已完成运行——已完成的组合会自动
SKIP,中断重跑不会浪费已有结果
三步跑完一次完整扫描 🚀
扫描流程分为三个阶段:智能体执行 → 评审打分 → 报告生成(详见 utils/sweep.py 的main函数)。官方入口是utils/sweep.py,也可用兼容包装脚本 scripts/run_model_sweep.py。
第一步:先 dry-run 预览组合数
uv run python -m utils.sweep --task real-estate --models sonnet --dry-run第二步:正式扫描(支持并行)
uv run python -m utils.sweep --task all --models opus gpt --parallel 8第三步:只重跑评审或只重出报告
uv run python -m utils.sweep --task real-estate --eval-only uv run python -m utils.sweep --task real-estate --report-only⚠️ 扫描前会自动执行预检(run_preflight):校验配置 ID 无冲突、任务可加载、task.json中存在评分标准(rubric),任一失败即中止,避免白烧 API 费用。
新手避坑清单
- 评审模型独立于被测模型:
--judge-model默认claude-sonnet-4-6,不在矩阵内(见 evaluation/run_eval.py) - 超时保护:单个智能体运行超时 7200 秒、评审超时 1800 秒,超时即终止并计入失败
- 评审并发受限:评审阶段并发自动压到 4(全量模式 8),防止触发 API 限流
--task支持四级粒度:all/ 整个业务领域 / 嵌套工作流 / 单个任务- 完整流程可对照官方教程 docs/tutorial.md 的"Run A Sweep"章节,架构细节见 docs/architecture.md
小结
SWEEP_MATRIX用一份简洁的矩阵清单,就把"测哪些模型、开到多深、怎么命名结果、如何断点续跑"全部约定好。理解它的三个字段(model / reasoning / temperature)与两级过滤(--models+--reasoning),你就能像配置实验矩阵一样,系统化地比较各家大模型在真实法律任务上的表现。📊
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考