15. M5 Max 128GB内存能支持的最大模型 ❀ 老梅子学AI

发布时间:2026/10/2 15:23:13
15. M5 Max 128GB内存能支持的最大模型 ❀ 老梅子学AI 【简介】各位都看到了Qwen-27B 8bit 大模型装完后内存只用了一半我想看看128GB内存都用满了能跑什么大模型。各位想看吗ChatGPT 的推荐当代人最幸福的事之一就是有了AI不知道的事问AI准没错。① 打开ChatGPU我问它我的设备适合那些本地大模型最好是能压榨性能的ChatGPT给出我五个答案。② 通常第一选项就是最优解还给出了针对128GB Mac优化的版本名称这不正好嘛。③ 打开LM Studio点击【模型搜索】图标复制粘贴优化版本名称竟然真的有刚刚推出才16天文件大小为107.33GB不知能不能跑下了再说。④ 千辛万苦总算把这一百多G下完了。⑤ 选择【开发者】菜单前面已经装载了Qwen3.8-27B点击【弹出】。为了更好的空出内存我们将Mac Studio重启。⑥ 重启之后可用内存有117.5GB相信装载107.33GB的本地大模型应该够了吧。⑦ 回到LM Studio【开发者】菜单点击【Load Model】。⑧ 选择Qwen3.8 Flash Nexe Server Mixed 4 8bit 大模型。⑨ 立即弹出加载模型失改的提示说我系统资源不足。⑩ 选择【My Models】菜单选择【LLMs】子菜单可以看到我们已经拥有两个大模型,奇怪的是最新的下载的模型这里没有参数量。有点不死心上下文选择最小的8K再次点击【Load Model】。⑪ 勾选允行强制加载点击【Load Anyway】强制加载。⑫ 好吧还是不行报一堆错误提示。⑬ 问问ChatGPT得到的答案是这个大模型太新了当前的LM Studio不支持。解决办法是用MLX Server。MLX Server 安装MLX-Serve只能跑在Apple M芯片MacWindows完全不能用专为统一内存优化。① MLX-Servegithub.com/ddalcu/mlx-serve是由ddalcu维护的一个本地LLM推理服务器用Zig编写面向Apple Silicon支持MLX和GGUF模型并提供OpenAI、Anthropic、Ollama兼容接口。② 这是功能说明。③ 可以通过Homebrew或Ollama安装。我们前面已经安装过Homebrew因此下面用Homebrew安装MLX-Serve。④ 在终端窗口复制粘贴第一行安装命令brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve回车。⑤ 执行完成后再复制粘贴第二行命令brew install --cask mlx-core这个是安装应用当然不用的也可以不安装。⑥ 提示报错说拒绝不受信任的mlx-core提示运行一个信任命令复制上面的提示命令并执行就可以了。⑦ 执行完成后再复制粘贴第三行命令brew install mlx-serve然后回车。⑧ 同样也是报不信任错误需要先执行信任命令再重新执行安装mlx-serve命令。注意前面安装mlx-core时只执行了信任命令没有再次执行安装mlx-core命令实际是没有安装mlx-core的后面再补安装命令。⑨ 安装完mlx-serve后执行命令mlx-serve --version可以查看当前版本号。⑩ 最后再补执行一下安装mlx-core命令。OK全部安装完成。MLX-Serve调用LM Studio下载的模型文件由于LM Studio已经下载了模型文件我们需要找到它再给MLX-Serve使用。① LM Studio 默认通常在 ~/.lmstudio/models/ 因此可以运行命令find ~/.lmstudio/models -type d -name *Qwen3.8-Flash-Next*来查找模型是否存在。② 果然看到模型文件以及存放路径。③ 然后我们再检查里面有没有最关键的文件ls -lh ~/.lmstudio/models/ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit/ngram_table.bin。④ 文件大约 30GB。这个模型把巨大的 n-gram embedding 单独放在这里正是普通 MLX 模型和这个特殊 mlx-serve 包的主要区别之一。⑤ 执行模型启动命令mlx-serve \--model ~/.lmstudio/models/ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit \--serve \--port 11234--model dir 直接指定一个现成的本地模型目录所以你不需要用 mlx-serve pull 重新下载。⑥ 模型加载完成。⑦ 奇怪的是并没有出现理所当然的把100G都装入内存的情况。那这个大模型能用吗⑧ 用浏览器打开地址127.0.0.0:11234出现了一个熟的界面这个是本地 OpenAI-compatible API。左下角显示已经装载一个大模型。⑨ 我让它介绍一下自己它告诉我说这是mlx-server的内置Web控制台。⑩ 我再问它运行的是什么模行告诉我的模型名字没有错但是大小是2MB是什么意思为什么这个模型文件这么大但实际运行内点内存却这么小有谁知道是什么原因吗⑪ 我们看看它自己的回答那花这么大精力运行的本地模型到底能做什么呢相信大家都想知道吧。