news 2026/9/12 9:08:48

lm-evaluation-harness 安装教程:三步装好并跑通你的第一次模型评测

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
lm-evaluation-harness 安装教程:三步装好并跑通你的第一次模型评测

lm-evaluation-harness 安装教程:三步装好并跑通你的第一次模型评测

【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness

lm-evaluation-harness是 EleutherAI 开源的语言模型评测框架,解决"同一套任务、同一套提示词下横向比较不同模型"的问题。本文带你完成环境检查、安装验证,并用一条命令真正跑出第一个评测结果。

认识一下:它能干什么

这个框架给生成式语言模型提供统一的评测接口:内置 60 多个标准学术基准(hellaswag、ARC、MMLU、GSM8K 等)以及成百上千个子任务,所有提示词公开可复现,跑出的分数可以在不同论文之间直接对比——Hugging Face 的 Open LLM Leaderboard 就是拿它当后端。项目由 EleutherAI 开发,主体是 Python 编写。底层它对接了 Hugging Facetransformers(本地模型)、vLLM(高吞吐推理)和 OpenAI 等商用 API,也支持 LoRA 这类 PEFT 适配器的评测。

它评测时给模型喂的是 few-shot 提示,结构如下:任务描述 + 若干示例 + 待完成的 prompt,模型补全后由框架统一打分。

动手前:环境自检清单

🔍 三条检查,一分钟搞定:

项目要求怎么确认
Python≥ 3.10终端运行python --version
Git任意可用版本终端运行git --version
GPU / CUDA想用 GPU 跑模型才需要运行nvidia-smi,能看到显卡列表即可

没有 GPU 也没关系,后续命令把--device cuda:0换成--device cpu就行,只是会慢不少。

装好它:从克隆到验证

✅ 三个动作,从克隆到可运行:

  1. 克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness cd lm-evaluation-harness
  1. 以可编辑模式安装核心框架:
pip install -e .

注意:基础安装是"瘦身版",不再捆绑transformerstorch。你想用哪种模型后端,就装哪个 extra,比如 Hugging Face 后端:

pip install "lm_eval[hf]"
  1. 验证安装。运行lm-eval -h,看到帮助文本并列出runlsvalidate等子命令,就算装好了。

跑通第一次:你的第一条命令

一条最小可运行的命令,在 CUDA GPU 上评测 Hugging Face Hub 上的 GPT-J-6B:

lm_eval --model hf --model_args pretrained=EleutherAI/gpt-j-6B --tasks hellaswag --device cuda:0 --batch_size 8

参数逐个看:

参数作用
--model hf模型后端,hf 表示走 Hugging Facetransformers加载
--model_args pretrained=...指定模型,也可以填本地路径、加revisiondtype等键值对
--tasks hellaswag评测任务名,多个任务用逗号隔开即可并行跑
--device cuda:0把模型放到哪块卡,CPU 则写cpu
--batch_size 8批大小,写auto可自动探测显存能容纳的最大值

跑完任务后,终端会打印各指标的最终得分。想跑更多任务,直接把--tasks改成lambada_openai,arc_easy这样的逗号列表即可。

多 GPU 的话,用accelerate做数据并行(每张卡放一份完整模型,K 张卡约 K 倍速度):

accelerate launch -m lm_eval --model hf --tasks lambada_openai,arc_easy --batch_size 16

如果模型大到单卡放不下,则不加 launch,改用--model_args parallelize=True把权重切分到多张卡。完整的 CLI 参数可以在 CLI 参考 里查到。

新手最容易卡住的点

装完pip install -e .却报缺 torch 或 transformers?这是正常的,新版把模型后端拆成了独立 extra。跑hf模型就补装lm_eval[hf],跑 API 模型装lm_eval[api],跑 vLLM 装lm_eval[vllm],也可以一次装齐lm_eval[hf,vllm,api]

要不要装在系统 Python 里?不建议。先用python -m venv或 conda 建个独立环境再装,datasetstransformers这类依赖版本很敏感,和别的项目共用环境大概率互相打架。

--device cuda:0报错或找不到 GPU?先跑nvidia-smi确认驱动和显卡正常。Mac 上改用--device mps(需要较新版本的 PyTorch)。

不知道有哪些任务名、怕拼错?运行lm-eval ls tasks列出全部可用任务,或者翻一下任务目录说明。

下一步

跑通第一条命令后,换个--tasks(比如mmlugsm8k)或换一个小一点的模型再跑一轮,就能开始你自己的横向对比了;想深挖配置方式可以看 配置指南。

【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 9:08:36

CMSIS-5不是库,是嵌入式系统的宪法级接口规范

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 9:06:50

网络拓扑图在IT运维中的核心价值与实战技巧

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 9:05:16

利用Cursor AI优化Python机器学习训练脚本开发

1. 项目概述:train2.py与Cursor的深度整合这个项目本质上是在探索如何通过Cursor这款AI编程助手来优化和增强Python训练脚本(train2.py)的开发效率。Cursor作为一款新兴的智能编程工具,正在迅速成为开发者日常工作的得力助手。我在…

作者头像 李华
网站建设 2026/9/12 9:03:47

主动配电网最优潮流计算与MATLAB实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 9:03:09

大数据时代的数据清洗技术与实践指南

1. 大数据时代的数据清洗挑战 在数据爆炸式增长的今天,企业每天产生的数据量已经达到PB甚至EB级别。这些原始数据就像刚从矿场开采出来的矿石,含有大量杂质和无效成分。根据IBM的研究,数据科学家80%的时间都花在了数据清洗和准备上&#xff0…

作者头像 李华
网站建设 2026/9/12 9:03:03

Superpowers:编辑器原生AI编程增强工作流实战指南

1. 项目概述:Superpowers 是什么,它解决的到底是什么问题?Superpowers 这个名字听起来像科幻电影里的设定,但放在当前的开发者工具生态里,它指的是一套围绕AI 编程助手深度集成所构建的能力增强体系——不是某个单一软…

作者头像 李华