llmfit 基准测试实战:一键测出你硬件上本地大模型的真实性能
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
这台笔记本跑本地大模型到底快不快?别再靠参数量和显存猜了。llmfit 基准测试可以给你答案:它把数百个模型的硬件适配评分和真实推理速度合在一起,对正在运行的推理服务发出真实请求,测出 tok/s(每秒生成 token 数)与 TTFT(首 token 延迟),还能把实测结果一键提交回社区,让同款硬件的人直接受益。
先认识 llmfit:硬件适配评分 + 推理速度实测
llmfit 是一个面向本地大模型的终端工具,内置数百个模型与多家推理运行时(llama.cpp、Ollama、vLLM、MLX 等)的数据,一条命令回答"哪台机器能跑哪个模型"。启动后,每个模型都会根据你自动检测出的 CPU、内存、GPU 给出适配分和预估速度——但这些数字大多是公式估算。跑一次基准测试,估算才会变成你设备上的实测值:真实的每秒 token 数,加上首 token 延迟。
上手准备:把模型弄上机器,把推理服务跑起来
启动llmfit进入 TUI,顶部显示检测到的系统规格,表格列出全部模型。按/输入关键词(比如qwen3.5),用j/k或方向键定位到目标模型,按d下载。若一家模型有多个提供方,会弹出 "Download With" 选择框,方向键选中后按Enter确认。下载在后台进行,按D可打开下载管理器看进度,GGUF 文件默认落在~/.cache/llmfit/models。💡
基准测试必须打到一个正在运行的推理服务上。以 llama.cpp 为例,在终端启动模型:
llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99等终端出现model loaded和listening on http://127.0.0.1:8080,回 TUI 按r刷新已安装模型——表头出现llama.cpp: ✓ (1 models)就说明服务已被 llmfit 自动探测到。Ollama、vLLM、MLX 同理,各运行时端点与环境变量见 docs/providers.md。
实测核心:跑出一组可信的 tok/s 和 TTFT
在表格中选中刚装好的模型,按b。因为模型已安装、服务在运行,llmfit 会弹出 "Benchmark this model" 提示框,显示即将测量的模型与服务提供方,按Enter开始。它会对运行中的服务执行三次真实推理,给出两个关键数字:
- tok/s:生成阶段每秒吐多少 token,决定"打字速度"手感
- TTFT(Time To First Token):从发出请求到收到第一个 token 的等待时间,决定"响应快不快"
| 按键 | 作用 |
|---|---|
b | 打开排行榜;已选模型已安装且服务在运行时,提示对它实测 |
Enter | 开始基准测试 |
Space/s | 切换"完成后以 PR 分享"开关 |
Esc | 转入后台继续跑,边测边浏览社区排行榜 |
每次运行的结果都先落盘到本地 bench 存储区(~/.config/llmfit)。当时不分享也没关系,日后可用llmfit bench --share补交,实测数据永不丢失。测量逻辑实现见 llmfit-core/src/bench.rs。
分享实测数据:一个 PR,让同款硬件都受益
想在测试完成后自动提交社区,就在开始之前在提示框里按Space(或s)打开分享开关。测试一结束,llmfit 会自动创建社区基准 PR——不需要安装gh命令行工具,认证走 GitHub 设备流(llmfit 打印短码,你在浏览器确认一次即可)。🔧 若提示框显示 "no GitHub credentials",先设置 token 再重启:
export GITHUB_TOKEN="ghp_your_token"每条被合并的提交都随下一个版本发布:你的实测数字会替代模型列表里的估算值(带✓标记),所有相同硬件(同 CPU + GPU)的用户,在自己跑任何测试之前就能拿到校准过的预估。你的已共享记录在排行榜里显示为you (shared),本地未共享的则是you (local)。数字有分歧时,llmfit 的信任顺序是:自己的实测 > 同硬件社区数据 > 公开库中位数 > 公式估算。聚合逻辑见 llmfit-core/src/benchmarks.rs,认证与 PR 机制见 llmfit-core/src/share.rs。
进阶玩法:批量基准、硬件模拟与 CLI 脚本化
- 社区排行榜(
b):浏览其他用户在你同款硬件上的实测数据;按H打开硬件选择器,查看任意 GPU 或芯片的结果 - Inference Bench(
I):对所有运行时上的全部模型做批量基准测试,输出 TTFT、tok/s 与总延迟,附质量评分和路由矩阵 - 硬件模拟(
S):手动改内存、显存、CPU 核数,整张表的适配分和速度预估即时重算——升级前就能预演"换新机后能跑什么";CLI 等价于--memory/--ram/--cpu-cores,更完整的机型描述可用--profile硬件配置文件
以上操作在命令行都有等价命令,方便脚本化:
llmfit bench # 对当前运行中的服务实测 llmfit bench --all --share # 批量测全部模型并自动提交 PR llmfit bench --dry-run # 只预览将提交的内容,不触发任何网络请求加--json可拿到机器可读输出,单独运行llmfit bench --share则把本地存过的所有结果补交,详见 docs/cli.md。
参考文档
- 基准测试完整指南:docs/benchmarking.md
- TUI 使用手册:docs/tui.md
- 运行时端点配置:docs/providers.md
- 社区基准数据模式:llmfit-core/data/community/schema.json
流程走完后,再有人问你"这台机器跑本地大模型多快",你不必再报一个估算值——直接亮排行榜上的实测数字就行。🚀
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考