llmfit bench:3 轮真实推理,一条命令量出你的实测 tok/s
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
模型装好了,却不知道它在你这台机器上到底跑多快?估算值给不出答案——llmfit 的 bench 命令直接对正在运行的推理服务发真实请求,3 轮实测就给你真实的 tok/s(每秒生成的 token 数)和首 token 延迟。测完的数据自动留在本地,想贡献给社区再加一个参数。
核显笔记本上的一条命令:llmfit bench 给出 3.8 tok/s
场景很具体:你在一台集成显卡的笔记本上,用 llama.cpp 起了个 0.8B 的小模型服务。不需要告诉 llmfit 地址和端口,敲下llmfit bench,几秒后终端输出 TPS、TTFT、延迟三组汇总数字。排行榜里你的硬件行直接换成实测值,旁边还能看到社区其他用户在同一硬件上的成绩。
5 种推理后端自动探测:端口、地址一个都不用填
llmfit 会依次探测 Ollama、vLLM/Ferrum、llama-server、MLX 这几类常见运行时,探测成功就自动列出该端点已加载的模型。两个容易撞车的默认端口都处理好了:llama-server 和 MLX 默认同占 8080,llmfit 用 llama.cpp 独有的/props端点把它精确认出来;vLLM 和 Ferrum 同占 8000,则靠/v1/models返回的owned_by身份区分。地址想用非默认值,通过环境变量(如OLLAMA_HOST、VLLM_PORT)或--url覆盖;探测不到任何后端时会明确提示先启动服务,模型没加载好同样会报错而不是跑出假数据。
| 后端 | 默认地址 | 识别方式 |
|---|---|---|
| Ollama | localhost:11434 | /api/tags列出已装模型 |
| vLLM / Ferrum | localhost:8000 | /v1/models的owned_by |
| llama-server | localhost:8080 | 独有的/props端点 |
| MLX | localhost:8080 | /v1/models(llama-server 未占用时) |
1 次热身 + 3 轮真实推理:TPS、TTFT、延迟各怎么测出来
每轮 bench 先发一条不计时的热身请求(内容就是 "Say hello."),把冷启动从数据里剔除;然后循环发送 4 条内置提示词——解释哈希表、写回文字检测的 Python 函数、对比 TCP 与 UDP、评审一段递归代码——每条限制 300 token 输出,默认跑 3 轮。计时上分两条路:Ollama 直接读它返回的eval_duration原生计时,TTFT 精确到毫秒;vLLM、MLX 这类 OpenAI 兼容端点目前走非流式请求,只能按墙钟时间算总延迟,所以 TTFT 显示 n/a——不是故障,精确值依赖流式输出。最终汇总给出 TPS 均值/最小/最大、平均 TTFT、平均总延迟和平均输出 token 数,逐轮明细也一并打印,统计逻辑在 bench 模块。
从安装到出结果的完整命令
先用 uv 装好 llmfit(macOS / Linux 通用):
uv tool install -U llmfit以 llama.cpp 为例起一个本地推理服务,看到model loaded和监听地址就表示就绪,Ollama、vLLM、MLX 同理:
llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99服务就绪后直接跑 bench,自动发现后端与模型;下面几行是批量测试与分享场景:
llmfit bench llmfit bench --all --share llmfit bench --all --share --dry-run llmfit bench --all --share --yes llmfit bench --share常用开关:
--runs N调整测试轮次(默认 3)--provider llamacpp显式指定后端,--url覆盖端点地址--json输出机器可读结果,方便接脚本- TUI 用户更省事:在表格中选中已安装的模型按
b,会弹出Benchmark this model提示,Enter开测、Esc让它转后台跑
数据去向:本地先存档,分享才变 PR
📊 每次 bench 都会先写本地(Linux 下在~/.local/share/llmfit/benchmarks/pending/,可用LLMFIT_BENCH_STORE改位置),跳过分享也不丢数据。本地结果有两个立竿见影的效果:TUI 排行榜顶部出现you (local)行,你的实测 tok/s 替换理论估算;可靠的实测(≥1B 参数、dense 模型)还会反向校准同硬件上其他模型的估算公式——测一个,准一片。
想贡献给社区,--share让 llmfit 自动 fork 仓库、提交结果文件并开 PR,全程不需要 gh CLI,认证走 GitHub 设备码流程(或设GITHUB_TOKEN);--dry-run只预览要提交的 JSON、不碰网络,--yes跳过确认适合自动化,而单独执行llmfit bench --share可以把积压的本地结果一次性批量上传。被合并的数据打进下个版本,同硬件用户不用自己跑就能直接看到带 ✓ 的校准值;换了 CPU/GPU 配置后,旧硬件上的记录会被自动忽略,不会互相干扰。完整流程见 benchmarking 文档,CLI 细节见 cli 文档。
估算回答"能不能跑",bench 回答"跑多快"。现在起一个推理服务,敲下llmfit bench,让你的硬件数据替你说话。
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考