
同样准备八九千美元一台M5 Max和两台DGX Spark该怎么选按美国目前的零售价一台16英寸M5 Max MacBook Pro128GB内存、4TB硬盘售价7999美元。DGX Spark单台4699美元两台合计9398美元。两套设备相差1399美元已经进入同一个预算区间。M5 Max是一台主力电脑可以剪片、写代码也能运行本地模型。两台DGX Spark共有两组128GB统一内存和8TB硬盘通过高速网络连接主要任务就是跑AI。只看配置双Spark占了不少优势内存更多支持CUDA还能把模型拆到两台机器上运行。但这些配置值不值钱最后还得看Agent能不能把任务做完。最近我在LocalLLaMA看到一组很有针对性的测试。用户anvarazizov同时拥有一台128GB M5 Max和4台DGX Spark/GX10他从中拿出两台Spark在两边运行DeepSeek-V4-Flash再交给同一个Agent完成Terminal-Bench 2.1的89项终端任务。M5 Max47项54% 双DGX Spark45项52.3%这里的“打成平手”只指任务完成率。生成速度、并发和上下文容量双Spark依然占优。89项任务Mac多做对了两项Terminal-Bench不会用选择题考模型而是直接给Agent一个Linux终端。Agent需要自己读文件、执行命令、修改代码最后由程序检查任务有没有完成。测试内容包括修复代码仓库、恢复数据库、编译扩展、处理数据、训练小模型和破解哈希。模型写了多少分析不计分程序修好、测试通过才算完成。受到运行错误影响M5 Max有87项获得有效成绩完成47项双Spark有86项获得有效成绩完成45项。在两边都得到结果的86项任务中66项结果相同36项两边都完成30项两边都失败。另外20项出现分歧M5 Max单独完成11项双Spark单独完成9项。两项任务的差距不足以分出胜负原帖作者给出的结论也是这一轮没有检测到明显的任务完成能力差异。80.8GB版本为什么没有掉队两边运行的都是DeepSeek-V4-Flash但模型文件和推理软件并不相同。DeepSeek-V4-Flash共有2840亿参数采用MoE架构。模型每次生成内容只会调用其中约130亿参数。Mac上运行的是一份80.8GiB的GGUF量化版本平均每个参数约2.45bit。体积最大的专家权重被大幅压缩注意力、路由和输出层等容易影响结果的部分保留较高精度。它没有把所有部分压到同一精度。占空间最多的专家权重负责减小体积容易影响能力的关键部分则尽量保留。负责运行模型的是DwarfStar 4也就是ds4。这个项目由Redis创始人Salvatore Sanfilippo主导开发专门优化DeepSeek-V4、GLM-5.2等少数大模型。测试中的Mac还把部分KV缓存放到了SSD上。KV缓存相当于模型执行长任务时需要保存的临时记忆放到硬盘后可以把更多内存留给模型权重。依靠量化和磁盘缓存这份80.8GiB的模型可以在128GB统一内存中运行并向Agent提供100K上下文。这里的100K代表模型一次可以保留的代码和文档量。双Spark的优势没有写进得分里双DGX Spark运行的是约167GB的FP8和FP4混合精度权重压缩程度比Mac上的版本低得多。每台DGX Spark配备128GB统一内存和4TB硬盘。两台机器通过ConnectX-7的200Gbps链路连接再用张量并行把模型分到两个节点上运行。两组128GB内存不会自动变成一块256GB内存推理软件需要负责拆分模型并协调两台机器共同计算。双Spark使用针对GB10修改过的vLLM并启用了DSpark推测解码。原帖记录的单路生成速度为54至58 token/s。token是模型生成内容时的计量单位这里可以直接看成输出速度。同时运行8路任务时双Spark的总生成速度达到253 token/s平均每路约31.6 token/s。它还能提供262K服务端上下文本次测试向Agent开放了200K是Mac端的两倍。Terminal-Bench只检查任务成功或者失败不会因为提前完成而多给分多Agent并发也不会反映在最终成绩中。双Spark的价值会在长任务和多人使用时体现出来。一个Agent运行和八个Agent同时运行对个人用户区别不大对团队却是两种体验。这笔钱怎么花只给一个人使用我会买M5 Max。独立开发者、内容创作者和需要移动办公的人可以把它作为主力电脑。白天写代码、剪视频空闲时运行本地模型。128GB4TB版本还能比双Spark节省1399美元也不用维护两台Linux主机。它的限制也很明确没有完整的CUDA生态多Agent并发和长上下文不如双Spark。机器固定放在办公室同时供多人调用双DGX Spark更合适。两台设备一共有256GB物理内存和8TB硬盘支持CUDA、vLLM和200K上下文可以同时运行多个Agent。像实验室、小型开发团队和本地AI服务器更容易用到这些能力。只做本地聊天、文档问答和普通编程两套都没有必要买。其实32GB到64GB内存配合更小的模型已经能覆盖大部分轻量需求。80.8GiB的量化版本在这轮测试中的任务完成率并没有明显落后于167GB版本。对个人用户来说量化方法和推理引擎可以弥补不少硬件差距到了多人并发和长任务双Spark多出来的配置才会转化成时间优势。M5 Max适合一个人的完整工作流双DGX Spark适合多个Agent持续运行。预算接近用途完全不同。