
MTPLX 完全指南:如何在 Mac 上以 125 tok/s 运行 Qwen 3.8 本地大模型【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLXMTPLX 是一个为 Mac(Apple Silicon)打造的本地大模型运行引擎,让你在自己电脑上高速运行 Qwen 3.8 Flash Next、Qwen 3.8 27B 和 Ternary Bonsai 2 27B 等模型——实测在 M5 Max 上通过 OpenCode 请求达到 125.8 tok/s,并在 16 GB 内存的 Mac 上流畅运行 27B 模型。它自带 OpenAI 与 Anthropic 双兼容的本地 API 服务,并内置 Mac 原生应用与实时仪表盘,是新手部署本地大模型最快的路径。为什么 MTPLX 这么快?MTPLX 的核心是原生 MTP 推测解码:直接复用模型自带的多 Token 预测(MTP)头,让模型自己给自己打草稿,再用一次批量前向验证多个草稿 Token,并采用精确拒绝采样提交结果。没有额外占用内存的第二个草稿模型采样在模型原生温度下进行,任意温度下结果都精确解码速度约为普通解码的 2 倍:M4 Mac mini(16 GB)实测 1.6 倍,M5 Max 实测 2.24 倍硬件要求:你的 Mac 能跑哪个模型?MTPLX 要求 Apple Silicon(M1 及更新)和 macOS 14。应用和 CLI 会按你的内存自动推荐模型,无需手动配置:你的 Mac 内存推荐模型说明8 GB 及以上Qwen 3.5 4B4-bit/8-bit,小内存首选16 GBTernary Bonsai 2 27B三值化 27B,内存占用约为 4-bit 27B 的一半,峰值约 11.8 GiB32 GBQwen 3.8 27B Optimized Speed编码旗舰,4-bit 动态量化,20.4 GB96 GB 及以上Qwen 3.8 Flash Next125B MoE,速度最快128 GB / 256 GBFlash Next Optimized SpeedM5 Max 上 125.8 tok/s 的来源M1、M2 的 Mac 会自动改用 FP16 版本模型包,精度无需手动挑选。详细建议见 docs/install.md 与 docs/quickstart.md。快速安装:三种方式任选方式一:Mac 应用(最省事)下载 DMG 后拖入应用程序即可。应用会自动检查硬件、推荐合适模型、下载模型、配置独立的 Python 引擎(无需 Homebrew)、安装风扇控制,并把mtplx命令加入 PATH,最后还会实测你的机器自动挑选最快解码深度。方式二:Homebrew(推荐终端用户)brew install youssofal/mtplx/mtplx mtplx start方式三:PyPIpython3 -m pip install -U mtplx mtplx doctor --summary安装完成后,mtplx doctor会体检你的环境与依赖,mtplx start则进入交互式流程:选模型、选模式、选界面,然后开聊。完整步骤见 docs/quickstart.md。启动本地 API 服务:接入任意客户端MTPLX 的本地服务与 OpenAI / Anthropic API 双兼容,mtplx start(或应用里的播放按钮)默认在127.0.0.1:8000提供服务:/v1/chat/completions、/v1/responses、/v1/completions、/v1/modelsAnthropic 风格的/v1/messages(支持流式与工具调用)可选的/v1/embeddings与/v1/rerank检索端点把 OpenCode、Claude Code、Cline、Cursor、Open WebUI 等任何会说 OpenAI 或 Anthropic 协议的客户端指向http://127.0.0.1:8000即可。端点细节见 docs/server.md,服务端实现位于 mtplx/server/ 目录。mtplx serve --model Youssofal/Qwen3.8-Flash-Next-MTPLX-Optimized-Speed会话也有记忆:热前缀会话缓存让多轮对话持续加速,SSD 会话缓存让重启后 8 ms 内恢复一场 9 万 Token 的长对话。MTPLX 应用:看得见速度的本地大模型应用内置实时仪表盘,模型干活时数字就摆在眼前:实时 tok/s 大表盘、各草稿深度的接受率、验证瀑布、缓存状态与系统压力,详见 docs/dashboard.md。原生聊天支持思考卡片、文件附件与联网搜索,一键即可拉起 OpenCode 等 Agent 指向本地服务,还内置 AIME 基准测试运行器,让你自己动手给模型打分。自动调优与 Forge:榨干你的 Mac自动调优:mtplx tune --model 模型 --retune会用真实模型在你的 Mac 上逐个深度实测(期间锁定风扇保证计时干净),若某个 MTP 深度快过普通解码就保存下来。例如 16 GB 的 M4 Mac mini 上,9B 模型从基线 14.4 tok/s 提升到 23.0 tok/s。Forge:把 Hugging Face 仓库变成 MTPLX 可用的 MTP 模型——转 MLX、训练 MTP 适配器、实测验证确实更快且仍精确、可选发布。Forge 会诚实地展示判决,比如Depth 1 最快:227.1 → 296.1 tok/s,1.30 倍,而不是假设适配器一定有效。实测性能一览以下数据均在 MacBook Pro M5 Max(128 GB)上实测,风扇拉满,采样用模型自身参数:模型速度场景Qwen 3.8 Flash Next125.8 tok/s单次 OpenCode 请求,18.5K Token 提示词,缓存命中Qwen 3.8 27B Optimized Speed87.6 tok/s改写刚写的文件,默认设置Qwen 3.6 27B Optimized Speed81.74 tok/s27B 纪录:192 Token 基准,普通解码的 2.69 倍Ternary Bonsai 2 27B64.4 tok/s16 GB 内存即可运行,峰值 11.4 GBQwen 3.5 4B227.8 tok/s小模型极限速度完整历史纪录与原始日志见 HISTORY.md。常用命令速查mtplx start # 交互式:选模型、模式,然后开聊 mtplx serve --port 8000 # 只启动 API 服务 mtplx stop # 干净停止服务 mtplx pull hf-repo # 安全下载模型 mtplx models # 查看已缓存模型与大小 mtplx tune --retune # 在你的 Mac 上实测各解码深度 mtplx bench aime --quick # 终端跑 AIME 基准 mtplx doctor # 安装与集成健康检查每个命令都支持--help,多数诊断命令支持--json。模型兼容性分级(已验证 / 未验证 / 仅 AR / 不兼容)的完整说明见 docs/model-compatibility.md,项目主文档索引见 docs/README.md。写在最后MTPLX 把在 Mac 上跑快本地大模型这件事做到了开箱即用:应用一条龙装好环境和模型,CLI 三行命令起服务,仪表盘让你亲眼看到 125 tok/s 的解码过程。无论你的 Mac 是 16 GB 还是 256 GB,它都有对应的模型档位和实测数据等着你。【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考