
llmfit bench 实测教程:3 步测出你的 GPU 真实 tok/s,一键贡献回社区【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfitllmfit 是一款一条命令找到能在你硬件上跑的大模型的开源工具,它的 bench 子命令可以用真实推理请求,实测出你硬件的tok/s与TTFT。整个流程三步,跑完就有结果。公式算出来的速度和你实际跑出来的速度,差多少?llmfit 启动时会扫描你的 GPU 和内存,给库里数百个模型估算理论 tok/s。但估算终究是公式算出来的,实测还受量化方式、上下文长度、后端实现影响——两个显存占用相同的模型,本地大模型推理速度可能差出数倍。于是 llmfit 提供了 bench 子命令:向正在运行的推理服务发送真实推理请求,测出硬件实际的 tok/s、首 token 延迟(TTFT)与总延迟。测试逻辑可直接查看源码 llmfit-core/src/bench.rs。三步出结果:安装 llmfit、启动 llama-server 并跑通第一条命令第 1 步,安装。这条命令用 uv 把 llmfit 从 PyPI 装成独立工具,装完即用:uv tool install -U llmfit第 2 步,启动推理服务。这条命令以 llama.cpp 为例,加载 GGUF 模型、把全部层卸载到 GPU,并监听 8080 端口:llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99看到model loaded/listening on http://127.0.0.1:8080即就绪,Ollama、vLLM、MLX 的启动方式同理。第 3 步,跑第一条基准测试。这条命令会自动发现正在运行的后端与模型,3 轮真实推理后输出实测结果:llmfit bench输出包含模型名、所属后端、tok/s 的均值/最小/最大、TTFT 和平均总延迟。用 TUI 的话,选中已安装模型按b也能触发同一套实测。llmfit bench 到底测了什么:热身、3 轮推理与 TTFT实测流程拆成三步:先发一条 Say hello. 请求作为热身轮,不计入统计,排除冷启动干扰;再从内置的 4 条测试提示词中依次取出,做3 轮真实推理;每轮记录首 token 延迟、tok/s 与总延迟,最后汇总均值、最小值与最大值。后端探测完全自动化,你只管把服务跑起来,llmfit 依次尝试这些默认地址:后端默认地址Ollamalocalhost:11434vLLMlocalhost:8000llama-serverlocalhost:8080MLXlocalhost:8080llama-server 与 MLX 共用 8080 端口,llmfit 通过/props端点精确区分出 llama.cpp。Ollama 直接读取服务端原生上报的eval_duration计算速度,TTFT 可精确到毫秒;vLLM 与 MLX 按墙钟时间折算,TTFT 一项显示为 n/a。从本地存档到社区贡献:--share 一键提 PR每次 bench 都会先把结果存到本地(Linux 下为~/.local/share/llmfit/benchmarks/pending/),不分享也不丢数据。它带来两个直接变化:排行榜顶部多出一行you (local),你测过的模型直接显示实测 tok/s 而非估算值;可信的实测(≥1B 参数、dense 模型)还会反向校准同硬件上其他模型的估算公式——测一个,准一片。想贡献给社区,加上--share即可:llmfit 自动 fork、提交结果文件并开 PR,不需要 gh CLI,认证走 GitHub 设备码流程(或设置GITHUB_TOKEN)。被合并的结果会打进下一个版本,同硬件用户不用跑 bench 就能看到带✓标记的校准值。不确定会提交什么时,先干跑一遍预览要发送的 JSON,这条命令全程不联网:llmfit bench --all --share --dry-run⚙️ 进阶用法:--all 批量测试、--yes 与 CI 自动化两个最常用的组合:前者测全部发现的模型并自动提社区 PR,后者跳过确认提示:# 测所有发现的模型,并自动提交社区 PR llmfit bench --all --share # 跳过确认提示(适合脚本/自动化) llmfit bench --all --share --yes--all挂在夜里跑,是批量实测最省心的方式;CI 场景只要环境变量里设好GITHUB_TOKEN,整条测完即交流程无需浏览器。完整参数见 docs/cli.md,下载→部署→实测→分享全流程见 docs/benchmarking.md。踩坑速查:4 个高频问题Q:报 No inference provider found?A:没有任何服务在跑。先启动 Ollama / vLLM / MLX / llama-server 之一,确认模型已加载,再重试。Q:vLLM / MLX 的 TTFT 为什么是 n/a?A:精确 TTFT 需要流式输出,OpenAI 兼容端点目前走非流式请求,只能给出总延迟;Ollama 与 llama.cpp 可精确测量。Q:换了硬件,旧数据会干扰吗?A:不会。记录在不同 CPU/GPU 配置下的运行结果会被自动忽略,不参与排行与校准。Q:几天后想补交实测,必须重跑吗?A:不必,单独执行llmfit bench --share就能把本地待上传的存档一次性批量提交。跑一次 bench,硬件的真实速度被记录下来;再加一次--share,它就变成同硬件用户的校准依据。【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考