llmfit bench 一条命令实测 tok/s:3 轮推理跑通真实速度

发布时间:2026/9/11 11:07:20
llmfit bench 一条命令实测 tok/s:3 轮推理跑通真实速度 llmfit bench 一条命令实测 tok/s3 轮推理跑通真实速度【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit硬件明明跑得动为什么还要相信一个公式算出来的数字理论 tok/s 只是公式真实速度由量化、上下文长度、后端实现共同决定。llmfit bench绕过估算——它向正在运行的推理服务发 4 条真实提示词直接测出你硬件的 tok/s。从安装到第一次 tok/s 的最短路径安装二选一macOS / Linuxcurl -fsSL https://llmfit.axjns.dev/install.sh | sh # 或者用 uv uv tool install -U llmfit再起一个活的推理服务以 llama-server 为例llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99看到model loaded即代表模型就绪。Ollama、vLLM、MLX 同理llmfit 会自动探测最后一条命令llmfit benchllmfit bench 实际在跑什么流程很死板1 次暖机 3 轮计时。暖机用 Say hello. 这类短请求不计入统计冷启动不会污染数据3 轮计时循环使用 4 条内置提示词——解释哈希表、写回文函数、对比 TCP/UDP、评审一段代码输出长度从短到长覆盖典型使用场景避免单一提示词造成偏差。每轮记录三个指标最后汇总平均与极值指标含义测量口径TPS每秒输出 token 数输出 token ÷ 生成耗时TTFT首 token 延迟Ollama 读 eval_duration精确到毫秒Latency请求总耗时墙钟时间输出长这样 Benchmark Results Model: Qwen3.5-0.8B-Q8_0.gguf Provider: llamacpp TPS: 31.5 avg (30.1 min / 33.0 max) TTFT: 95 ms avg Latency: 2050 ms avg别只盯着平均数看 min 与 max 的差距。差得大说明负载不稳。提示词与统计细节见 bench 统计逻辑。后端零配置自动探测后端默认地址识别方式Ollamalocalhost:11434端点直接探测vLLMlocalhost:8000按 owned_by 区分llama-serverlocalhost:8080/props端点精确识别MLXlocalhost:8080兜底探测参数矩阵批量、预览与一键分享# 测所有发现的模型并开一个社区 PR llmfit bench --all --share # 只预览要提交的 JSON不联网 llmfit bench --all --share --dry-run # 跳过确认提示适合脚本与自动化 llmfit bench --all --share --yes # 不重跑只上传本地积压结果 llmfit bench --share参数作用--all遍历所有发现的模型--sharefork 并开 PR 提交结果--dry-run本地预览零网络--yes跳过确认提示TUI用户更省事选中已安装的模型按b打开排行榜会弹出 Benchmark this model——按Enter开始实测按Esc转后台跑。数据去向本地存档、校准与社区 PR无论你是否分享结果都会先落本地。Linux 路径为~/.local/share/llmfit/benchmarks/pending/可用LLMFIT_BENCH_STORE覆盖。跳过分享数据也不丢。本地数据有两层用途排行榜顶部出现you (local)行你的实测 tok/s 直接替换理论估算可靠的实测≥1B 参数、dense 模型反哺同硬件上其他模型的估算公式。信任顺序很清晰你自己的实测排在同硬件社区数据之前社区数据又排在公式估算之前。想贡献给社区加--share自动 fork、提交结果文件、开 PR不需要 gh CLI。认证走设备码流程——终端打印短码浏览器确认一次即可设了GITHUB_TOKEN则免浏览器。已有未合并的 bench PR 时新结果直接追加进去。PR 合并后实测数据打进下一版本。同硬件用户无需跑 bench就能看到带✓标记的校准值——完整四步流程见 基准测试流程全部参数见 完整 CLI 参数。排障速查最常见的三种情况现象、原因、解法都在表里现象原因解法No inference provider found没有活的推理服务起四个后端任一个确认模型已加载TTFT 显示 n/a非流式请求测不到首 tokenOllama/llama.cpp 可精确测vLLM/MLX 只有总延迟换硬件后旧数据是否干扰—不同 CPU/GPU 配置上的运行被自动忽略今天就跑一次一次llmfit bench让你的硬件数据替你说话。 【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考