
Qwen 量化模型性能评估实战指南Qwen2 系列 GPTQ 与 AWQ 的 MMLU/C-Eval/IFEval 基准详解【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5本指南围绕 Qwen 官方文档 量化模型效果评估 展开系统解读 Qwen2 系列在 BF16、GPTQ-Int8、GPTQ-Int4、AWQ 四种精度下的生成性能评估结果说明三项核心评测指标MMLU、C-Eval、IFEval的含义与解码设置并结合仓库中 GPTQ、AWQ 与 速度基准 文档讲解量化模型的加载运行、自行量化的完整实操路径。读完本文你将掌握量化模型性能评估的完整方法论并能据此为具体场景选择量化方案。量化模型评估为什么精度指标与推理效率同等重要大语言模型量化通过将权重从 16 位浮点BF16/FP16压缩到 8 位或 4 位整数换取显存占用与推理速度的显著改善。但量化不可避免地带来精度损失因此需要在压缩收益与能力保留之间做权衡。官方文档专门以独立章节报告量化模型的生成性能generation performance其目的正是让开发者拿到量化前后的可量化对比数据而不是凭感觉决策。需要注意本评估数据目前针对Qwen2 系列0.5B / 1.5B / 7B / 72B文档顶部明确标注了 To be updated for Qwen3即该基准表尚待更新到 Qwen3 系列Qwen3 系列的相关量化速度与显存数据可参考 速度基准。因此本文数据是理解 Qwen 量化方法论的历史基准而 Qwen3 系列读者应结合最新模型卡与本文方法自行复测。评估协议三项指标与贪心解码文档规定了统一的评估协议保证不同模型、不同量化方式之间的可比性MMLU (Accuracy)大规模多任务语言理解基准覆盖 STEM、人文、社科等多个领域的选择题衡量模型的综合知识面与理解能力。C-Eval (Accuracy)中文综合评估基准涵盖中国语境下的多学科知识是衡量中文能力的关键指标。IFEval (Strict Prompt-Level Accuracy)指令遵循评估检测模型是否严格遵循用户指令中的各类约束格式、长度、关键词等采用严格的提示词级别准确率统计。解码设置所有模型统一使用贪心解码greedy decoding即每一步选择概率最高的 token以消除采样随机性对结果的影响保证量化引入的差异能够被稳定、可复现地观测。量化精度全览Qwen2 系列 0.5B 至 72B 实测对比下表完整呈现官方文档的评估结果。Average 为三项指标的算术平均数据为百分比%模型量化方式AverageMMLUC-EvalIFEvalQwen2-72B-InstructBF1681.382.383.877.6Qwen2-72B-InstructGPTQ-Int880.781.383.477.5Qwen2-72B-InstructGPTQ-Int481.280.883.978.9Qwen2-72B-InstructAWQ80.480.583.976.9Qwen2-7B-InstructBF1666.970.577.253.1Qwen2-7B-InstructGPTQ-Int866.269.176.752.9Qwen2-7B-InstructGPTQ-Int464.167.875.249.4Qwen2-7B-InstructAWQ64.167.473.651.4Qwen2-1.5B-InstructBF1648.452.463.829.0Qwen2-1.5B-InstructGPTQ-Int848.153.062.528.8Qwen2-1.5B-InstructGPTQ-Int445.050.757.427.0Qwen2-1.5B-InstructAWQ46.551.658.129.9Qwen2-0.5B-InstructBF1634.437.945.220.0Qwen2-0.5B-InstructGPTQ-Int832.635.643.918.1Qwen2-0.5B-InstructGPTQ-Int429.733.039.216.8Qwen2-0.5B-InstructAWQ31.134.442.116.7读表要点如何解读量化损失从表格中可以提取几条关键规律帮助你在实际部署中做取舍规模越大量化抗性越强72B 模型在 BF16 平均 81.3 分的基础上GPTQ-Int481.2与 AWQ80.4的绝对下降仅 0.1~0.9 分而 0.5B 模型从 BF16 的 34.4 分降至 GPTQ-Int4 的 29.7 分损失约 4.7 分。模型参数量越小冗余度越低量化越敏感。Int8 几乎无感各规模下 GPTQ-Int8 相对 BF16 的降幅普遍在 0.5~2 分以内是低风险压缩的首选尤其适合对精度敏感的场景。Int4 存在明显权衡GPTQ-Int4 与 AWQ 在 7B 及以下模型的 C-Eval 上降幅可达 1~4 分如 Qwen2-7B AWQ 的 C-Eval 为 73.6较 BF16 的 77.2 低 3.6 分但在 72B 上甚至出现个别指标反超GPTQ-Int4 的 C-Eval 83.9、IFEval 78.9 均高于 BF16说明大模型的冗余空间足以吸收 Int4 量化误差。AWQ 与 GPTQ 互有胜负两者在 Average 上接近但分项上各有侧重例如 1.5B 下 AWQ46.5明显优于 GPTQ-Int445.0主要赢在 C-Eval58.1 vs 57.4与 IFEval29.9 vs 27.0。选择时应结合任务画像偏中文知识看 C-Eval偏指令遵循看 IFEval。量化方法速览GPTQ 与 AWQ 的底层原理与差异要正确使用上述量化模型先要理解两种主流方法的本质区别二者在 GPTQ 文档 与 AWQ 文档 中有详细说明GPTQ一种面向 GPT 类 LLM 的 one-shot 权重量化方法基于近似二阶信息Hessian 矩阵逐层或逐列调整权重将量化误差在层内传播补偿从而以极少的校准数据达到接近训练后量化的精度。AWQActivation-aware Weight Quantization一种硬件友好的低比特仅权重量化方法。其核心洞察是并非所有权重同等重要基于激活值统计识别显著权重salient weights并通过按通道缩放来保护这些权重而非依赖反向传播式的误差补偿。AutoAWQ 官方宣称相较 FP16 可实现约 3 倍加速与 3 倍显存缩减该数据来自 AWQ 文档对 AutoAWQ 库的描述实际效果以你的硬件实测为准。一句话总结GPTQ 靠数学补偿保住精度AWQ 靠激活感知保住关键权重。这也是二者在评估表中表现各有千秋的根源。加载运行量化模型transformers 与 vLLM 两条路径量化模型拿到手后如何跑起来以 Qwen2.5 官方量化权重为例评估表基于 Qwen2 系列而实操仓库文档基于 Qwen2.5 系列两者同属 Qwen 量化方法论体系GPTQ 文档 与 AWQ 文档 给出了两种主流方式。路径一Hugging Face Transformers 直接加载transformers已官方支持 AutoGPTQ 与 AutoAWQ 内核因此加载量化模型与加载普通模型几乎无异from transformers import AutoModelForCausalLM, AutoTokenizer model_name Qwen/Qwen2.5-7B-Instruct-GPTQ-Int4 # 或 Qwen/Qwen2.5-7B-Instruct-AWQ model AutoModelForCausalLM.from_pretrained( model_name, device_mapauto, ) tokenizer AutoTokenizer.from_pretrained(model_name) prompt Give me a short introduction to large language models. messages [ {role: system, content: You are Qwen, created by Alibaba Cloud. You are a helpful assistant.}, {role: user, content: prompt}, ] text tokenizer.apply_chat_template( messages, tokenizeFalse, add_generation_promptTrue, ) model_inputs tokenizer([text], return_tensorspt).to(model.device) generated_ids model.generate(**model_inputs, max_new_tokens512) response tokenizer.batch_decode(generated_ids[:, model_inputs.input_ids.size(-1):], skip_special_tokensTrue)[0]注意事项来自 GPTQ 文档使用官方 GPTQ 模型需保证optimum1.20.0及兼容版本的transformers与auto_gptq可执行pip install -U optimum1.20.0。若日志提示CUDA extension not installed.且推理变慢说明auto_gptq未找到匹配的融合 CUDA 内核、已回退到普通实现应安装预编译 wheel 或从源码安装。AWQ 模型建议搭配autoawq使用transformers 同样原生支持。路径二vLLM 提供 OpenAI 兼容 APIvLLM 已支持 GPTQ 与 AWQ且对 GPTQ 会在可行时自动启用更高效的 GPTQ Marlin 内核。启动服务只需一行命令# GPTQ 示例 vllm serve Qwen2.5-7B-Instruct-GPTQ-Int4 # AWQ 示例建议 vllm0.6.1其 AWQ 性能已有明显优化 vllm serve Qwen/Qwen2.5-7B-Instruct-AWQ随后通过 OpenAI 兼容接口调用curl http://localhost:8000/v1/chat/completions -H Content-Type: application/json -d { model: Qwen2.5-7B-Instruct-GPTQ-Int4, messages: [ {role: system, content: You are Qwen, created by Alibaba Cloud. You are a helpful assistant.}, {role: user, content: Tell me something about large language models.} ], temperature: 0.7, top_p: 0.8, repetition_penalty: 1.05, max_tokens: 512 }也可以使用openaiPython SDK 调用以openai_api_base http://localhost:8000/v1指向本地 vLLM 服务即可。自行量化用校准数据复现评估中的量化模型评估表中的 GPTQ-Int8/Int4 与 AWQ 权重并非凭空而来——它们由校准数据驱动生成。如果你想对自己的微调模型执行同样的量化流程两份文档给出了完整步骤。使用 AutoGPTQ 量化GPTQ 路径from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig from transformers import AutoTokenizer model_path your_model_path quant_path your_quantized_model_path quantize_config BaseQuantizeConfig( bits8, # 4 或 8对应评估表中的 GPTQ-Int4 / GPTQ-Int8 group_size128, damp_percent0.01, desc_actFalse, # 设为 False 可显著提速但困惑度可能略有上升 static_groupsFalse, symTrue, true_sequentialTrue, model_name_or_pathNone, model_file_base_namemodel, ) max_len 8192 tokenizer AutoTokenizer.from_pretrained(model_path) model AutoGPTQForCausalLM.from_pretrained(model_path, quantize_config)校准数据准备将对话按 ChatML 模板格式化后分词构造input_ids与attention_mask列表import torch data [] for msg in dataset: text tokenizer.apply_chat_template(msg, tokenizeFalse, add_generation_promptFalse) model_inputs tokenizer([text]) input_ids torch.tensor(model_inputs.input_ids[:max_len], dtypetorch.int) data.append(dict(input_idsinput_ids, attention_maskinput_ids.ne(tokenizer.pad_token_id)))随后执行量化并保存model.quantize(data, cache_examples_on_gpuFalse) model.save_quantized(quant_path, use_safetensorsTrue) tokenizer.save_pretrained(quant_path)使用 AutoAWQ 量化AWQ 路径pip install autoawq0.2.7from awq import AutoAWQForCausalLM from transformers import AutoTokenizer model_path your_model_path quant_path your_quantized_model_path quant_config {zero_point: True, q_group_size: 128, w_bit: 4, version: GEMM} tokenizer AutoTokenizer.from_pretrained(model_path) model AutoAWQForCausalLM.from_pretrained(model_path, device_mapauto, safetensorsTrue) # 校准数据对话消息格式化后的纯文本列表 data [] for msg in dataset: text tokenizer.apply_chat_template(msg, tokenizeFalse, add_generation_promptFalse) data.append(text.strip()) model.quantize(tokenizer, quant_configquant_config, calib_datadata) model.save_quantized(quant_path, safetensorsTrue, shard_size4GB) tokenizer.save_pretrained(quant_path)实操提示校准数据的领域分布直接决定量化质量。文档建议直接使用微调数据如 Alpaca 格式进行校准让量化过程看到目标域的真实输入分布这是降低 MMLU/C-Eval/IFEval 等指标掉点的最有效手段。延伸量化后的速度与显存实测Qwen3 系列精度只是量化决策的一面另一面是速度与显存。速度基准 报告了 Qwen3 系列在 BF16、FP8、AWQ-INT4、GPTQ-Int8/Int4 下的推理速度与显存占用可视为本评估表的效率侧补充。要点包括评估环境Transformers 侧使用 NVIDIA H20 96GBPyTorch 2.6.0、Flash Attention 2.7.4、Transformers 4.51.3SGLang 侧为 SGLang 0.4.6.post1。速度定义Speed (tokens_prompt tokens_generation) / timebatch size 为 1使用尽可能少的 GPU。测试覆盖生成 2048 tokens输入长度覆盖 1、6144、14336、30720、63488、129024 tokens。代表性结论以 Qwen3-8B Transformers 为例输入长度 1 时BF16 显存约 15.9 GB、FP8 约 9.3 GB、AWQ-INT4 约 6.2 GB输入长度 30720 时 AWQ-INT4 速度可达约 438 tokens/s显著高于 BF16 的约 209 tokens/s。可见 INT4 量化在长上下文场景下的显存与吞吐收益非常可观。注意限制文档明确提示 Transformers 的 FP8 速度目前非最优待优化SGLang 的 GPTQ-Int4 性能也待改进MoE 模型如 Qwen3-30B-A3B在 Transformers 下 GPTQ-Int4 标注为MoE Kernel Unsupported——这些都是选型时必须知晓的边界条件。量化选型决策清单综合精度基准与实操文档给出如下决策参考基于仓库文档数据实际以你的硬件与任务复测为准显存紧张、追求极致吞吐优先 AWQ-Int4或 GPTQ-Int47B 级模型可将显存压到 6~8 GB 量级若任务对中文知识C-Eval敏感注意 7B 及以下 AWQ/GPTQ-Int4 约 2~4 分的掉点是否可接受。精度敏感、希望低风险选 GPTQ-Int8各规模下平均掉点普遍小于 2 分。超大模型72B 级量化代价极小甚至分项反超INT4 方案几乎是无损省显存。小模型0.5B/1.5B 级量化损失相对明显若任务精度优先建议保留 BF16 或仅用 Int8。效率验证闭环选型后参考 速度基准 的协议固定 batch size、输入长度序列、统一解码参数自测确保精度 速度 显存三者同时满足需求。小结量化模型性能评估是精度-效率权衡决策的基石。本文完整继承了官方 量化模型效果评估 中的 Qwen2 系列四项指标实测数据阐释了 MMLU、C-Eval、IFEval 与贪心解码的评估协议并结合 GPTQ 文档 与 AWQ 文档 给出了量化模型加载与自行量化的完整实操路径。同时提醒读者本基准面向 Qwen2 系列Qwen3 系列的速度与显存数据请查阅 速度基准精度数据请以最新模型卡为准。掌握这套方法论后你便能为自己的部署场景做出数据驱动的量化决策。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考