
2026年,AMD显卡终于能跑本地大模型了!实测Qwen3.6-35B-A3B,96 tok/s不是梦TL;DR: 用MoE4All v0.5.0在AMD RX 7900 XTX上跑Qwen3.6-35B-A3B-Q4_K_M,decode速度96.8 tok/s,prefill速度587.8 tok/s。不需要N卡,不需要CUDA,Vulkan就完事了。0x00 写在前面:A卡用户的苦,终于到头了如果你和我一样,手里攥着一张AMD显卡,看着隔壁N卡用户用vLLM、llama.cpp、Ollama各种工具跑得飞起,心里那个酸……2025年之前,AMD显卡跑本地大模型基本是地狱难度。llama.cpp的Vulkan后端?慢得离谱Ollama?只认CUDA各种推理框架?清一色N卡优化但2026年,情况变了。MoE4All这个项目,专门为AMD显卡优化,支持分页MoE(Mixture of Experts)、ReBAR显存管理、Vulkan计算,关键是——真的快。今天这篇文章,我就带你从零开始,在Win11 + AMD显卡上部署一个35B参数的本地大模型,实测速度96 tok/s,比很多N卡方案还快。0x01 硬件环境:我用的什么配置先亮家底:组件型号备注CPUAMD Ryzen 7 7800X3D8核16线程,3D V-Cache显卡AMD Radeon RX 7900 XTX24GB GDDR6,RDNA3架构内存64GB DDR5-4800 (2×32GB)Kingston,双通道系统Windows 11 23H264位关键参数:显卡显存:24GB(够用,但不是无限)内存带宽:约36.6 GB/s(实测有效值)Vulkan支持:✅ f16、bf16、i8dot(关键特性都有)为什么这个配置重要?因为MoE4All的核心优化就是分页MoE——专家权重不全塞进显存,而是按需从内存搬运。这意味着:24GB显存能跑35B模型(量化后约19.5GB)内存带宽成为关键瓶颈(实测已验证)不需要48GB、80GB的"专业卡"0x02 软件准备:下载MoE4All2.1 获取发布包去 MoE4All GitHub Releases 下载最新版。我用的版本:v0.5.0MoE4All-Windows-x86_64-v0.5.0.zip解压到任意目录,比如:E:\AI\MoE4All-rel\v0.5.0\MoE4All-Windows-x86_64-v0.5.0\里面就一个核心文件:infr.exe(约35MB)。2.2 验证Vulkan支持打开PowerShell,运行:'E:\AI\MoE4All-rel\v0.5.0\MoE4All-Windows-x86_64-v0.5.0\infr.exe'--version应该输出:infr 0.5.0如果报错"找不到Vulkan运行时",去 Vulkan SDK官网 下载安装。0x03 模型选择:为什么是Qwen3.6-35B-A3B3.1 模型家族对比MoE4All支持多种GGUF格式模型,但不是所有模型都适合AMD显卡。模型参数量激活参数量化后大小推荐度Qwen3.6-35B-A3B35B3B19.5GB (Q4_K_M)⭐⭐⭐⭐⭐Qwen3.6-35B-A3B-APEX35B3B23.9GB⭐⭐⭐⭐DeepSeek-V3-Flash16B2B~10GB⭐⭐⭐Llama-3.1-70B70B8B~40GB⭐⭐为什么选Qwen3.6-35B-A3B-Q4_K_M?MoE架构:35B总参数,但每个token只激活3B,推理速度快量化友好:Q4_K_M量化后19.5GB,刚好塞进24GB显存中文能力强:Qwen系列对中文优化好,适合国内用户实测最快:在我的配置上,这个模型decode速度96.8 tok/s,是其他模型的2-3倍3.2 下载模型从 ModelScope 或