)
Win11 RTX 5080 本地 Coding 模型测试笔记测试环境Windows 11 NVIDIA GeForce RTX 5080 16GB AMD Ryzen 7 9800X3D llama.cpp主要目标寻找适合OpenCode 本地编程的模型及最佳量化/Context 配置。先看结果 还是留着买5080的钱去订阅吧排名模型量化ContextPromptGenerationVRAMQwen3-14BQ4_K_M16K1247.184.512.68GBQwen3-14BQ4_K_M32K1170.885.815.12GBQwen3-14BQ4_K_M4K715.183.510.75GBQwen3-14BQ8_08K363.827.815.95GB4Qwen3-Coder-30B-A3BQ4_K_M8K120.516.3~15.7GB5GLM-4.7-FlashQ4_K—82.212.4—不同测试的 prompt、Context 和运行状态并不完全一致因此表格主要用于实际体验和硬件适配参考不能视为严格的模型 benchmark。1. 测试环境硬件项目配置CPUAMD Ryzen 7 9800X3DCPU 核心8 核 / 16 线程GPUNVIDIA GeForce RTX 5080GPU 显存16303 MiB ≈ 16GBNVIDIA Driver610.52CUDA13.3系统Windows 11llama.cppb10375 / build 10417 等测试版本GPU BackendCUDAFlash Attention-fa onllama.cpp 目录D:\AI\llama-cuda模型目录D:\AI\models2. 测试参数说明本次主要使用-ngl 999含义尽可能将模型层全部卸载到 GPU。-c 8192Context Window8192 tokens 8K测试过程中还使用16384 16K 32768 32K-fa on开启 Flash Attention。当前 llama.cpp 版本要求明确指定-fa on不能写成单独的-fa否则会被解析成--flash-attn -p导致unknown value for --flash-attn: -p3. Qwen3-Coder-30B-A3B-Q4_K_M模型qwen3-coder-30b-a3b-instruct-q4_k_m.gguf文件大小18,556,688,704 bytes ≈ 17.27 GiB模型Qwen3-Coder-30B-A3B-Instruct Q4_K_M测试参数.\llama-cli.exe -mD:\AI\models\qwen3-coder-30b-a3b-instruct-q4_k_m.gguf-ngl 999 -c 8192 -fa on -p用 TypeScript 实现一个 LRU Cache要求支持泛型、最大容量和 TTL。测试结果Prompt: 120.5 tok/s Generation: 16.3 tok/s VRAM: ≈ 15.7GB评价优点Coding 能力较强30B 级别模型复杂代码理解能力较好缺点RTX 5080 16GB 显存压力非常大Generation 只有约16 tok/sOpenCode Agent 多轮工作时等待时间明显结论复杂架构 / 深度代码分析★★★★☆ 日常 Coding★★☆☆☆ 速度★★☆☆☆ 显存效率★★☆☆☆4. GLM-4.7-Flash-Q4_K测试模型GLM-4.7-Flash-Q4_K.gguf注意本次使用的是Q4_K不是Q4_K_M。测试结果Prompt: 82.2 tok/s Generation: 12.4 tok/s评价Generation12.4 tok/s明显低于 Qwen3-14B-Q4_K_M84.5 tok/s因此在当前硬件上的实际 Coding 体验并不理想。结论Coding★★★☆☆ 速度★☆☆☆☆ OpenCode★★☆☆☆5. Qwen3-14B-Q4_K_M模型Qwen3-14B-Q4_K_M.gguf这是目前测试中表现最好的模型。5.1 4K Context测试结果Prompt: 715.1 tok/s Generation: 83.5 tok/s VRAM: 10745 MiB约10.75GB结果Generation 83.5 tok/s已经非常快。6. Qwen3-14B-Q4_K_M / 16K测试结果Prompt: 1247.1 tok/s Generation: 84.5 tok/s VRAM: 12679 MiB显存12.68GB剩余16303 - 12679 3624 MiB约3.5GB评价这是目前最推荐的配置。Qwen3-14B-Q4_K_M 16K Context Full GPU Offload Flash Attention速度≈84.5 tok/s显存≈12.7GB具有比较充足的显存余量。7. Qwen3-14B-Q4_K_M / 32K测试结果Prompt: 1170.8 tok/s Generation: 85.8 tok/s VRAM: 15115 MiB显存15.12GB剩余16303 - 15115 1188 MiB约1.16GB评价非常值得注意16K: 84.5 tok/s 32K: 85.8 tok/sGeneration 基本没有下降。但16K: 12.68GB 32K: 15.12GB显存已经达到92.7%因此日常 OpenCode推荐16K大型项目临时分析可以32K但不建议长期作为默认配置。8. Qwen3-14B-Q8_0模型Qwen3-14B-Q8_0.gguf测试参数.\llama-cli.exe -mD:\AI\models\Qwen3-14B-Q8_0.gguf-ngl 999 -c 8192 -fa on -p用 TypeScript 实现一个高性能 LRU Cache要求支持泛型、最大容量、TTL并解释设计思路和时间复杂度。测试结果Prompt: 363.8 tok/s Generation: 27.8 tok/s VRAM: 15950 MiB显存15.95GB剩余16303 - 15950 353 MiB仅约0.35GB9. Q4_K_M vs Q8_0这是本次最有价值的对比之一。项目Q4_K_MQ8_0模型Qwen3-14BQwen3-14BContext8K~32K8KGeneration83~86 tok/s27.8 tok/sVRAM10.7~15.1GB15.95GB显存余量较充足仅353MBOpenCode⭐⭐⭐⭐⭐⭐⭐⭐综合推荐★★★★★★★★Q8 的问题非常明显84.5 tok/s ↓ 27.8 tok/s速度下降约67%同时显存几乎完全占满。10. 当前所有模型测试汇总排名模型量化ContextPromptGenerationVRAMQwen3-14BQ4_K_M16K1247.184.512.68GBQwen3-14BQ4_K_M32K1170.885.815.12GBQwen3-14BQ4_K_M4K715.183.510.75GBQwen3-14BQ8_08K363.827.815.95GB4Qwen3-Coder-30B-A3BQ4_K_M8K120.516.3~15.7GB5GLM-4.7-FlashQ4_K—82.212.4—不同测试的 prompt、Context 和运行状态并不完全一致因此表格主要用于实际体验和硬件适配参考不能视为严格的模型 benchmark。11. 当前最佳配置 日常 OpenCode模型 Qwen3-14B-Q4_K_M.gguf 参数 -ngl 999 -c 16384 -fa on实际测试Generation: 84.5 tok/s VRAM: 12679 MiB / 16303 MiB这是目前最推荐的配置。 大型项目Qwen3-14B-Q4_K_M -ngl 999 -c 32768 -fa on实测85.8 tok/s 15115 / 16303 MiB适合临时进行大型代码库分析多文件重构架构分析大量代码上下文但是不建议长期默认使用。 高质量代码分析Qwen3-Coder-30B-A3B-Q4_K_M虽然≈16.3 tok/s但模型规模更大可以作为复杂架构 复杂重构 代码 Review 困难问题的备用模型。12. 最终推荐针对RTX 5080 16GB Ryzen 7 9800X3D Windows 11 llama.cpp OpenCode目前推荐┌─────────────────────┐ │ OpenCode │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ Qwen3-14B-Q4_K_M │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ 16K Context │ │ -ngl 999 │ │ -fa on │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ ~84.5 tok/s │ │ ~12.7GB VRAM │ └─────────────────────┘推荐等级Qwen3-14B-Q4_K_M★★★★★目前它是你这张RTX 5080 16GB上测试出来的最佳速度 / 显存 / Coding / Context综合平衡点。