把权重压到 1.58-bit、激活压到 4-bit,推理反而更快:ICML 2026 这篇让端侧大模型不再卡——TWLA 精读

发布时间:2026/8/12 15:20:31
把权重压到 1.58-bit、激活压到 4-bit,推理反而更快:ICML 2026 这篇让端侧大模型不再卡——TWLA 精读 系列第 6 篇 · 子领域端侧与高效推理 / On-device【来源信息】 - 类型顶会论文 - 标题TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization - 作者/机构Zhixiong Zhao, Zukang Xu, Zhixuan Chen, Xing Hu, Zhe Jiang, Dawei Yang - 出处ICML 2026 · arXiv:2606.13054 - 原文https://arxiv.org/abs/2606.13054 - 本文性质论文解读非原创研究关键结论以原文为准一句话结论三值量化权重压到 1.58-bit过去只能压权重、激活仍留全精度端到端根本快不起来ICML 2026 的 TWLA 第一次把权重 1.58-bit 激活 4-bit同时做下来还实打实加速了——端侧部署的最后一公里被打通。背景与痛点LLM 靠堆参数换能力但 DeepSeek-R1-671B 光 FP16 权重就要 ≥1TB端侧根本装不下。量化是核心压缩手段三值化权重 ∈ {−1,0,1}压缩率高还能把大部分浮点乘法换成加法和分支。但老方法有个致命坑只量化权重激活留在全精度。推理时还得把三值权重反量化回来端到端加速被彻底堵死。少数能做三值权重 4-bit 激活的如 BitNet v2又靠昂贵的量化感知训练QAT报告训练成本超 10⁴ GPU 小时对任意预训练模型不可迁移。核心方法讲人话TWLA 是个免重训PTQ框架三件套解决「权重三峰 激活重尾」的双重错配E2M-ATQ欧氏→流形非对称三值量化器从欧氏初始化到流形重定位两阶段优化最小化层输出误差KOTMSKronecker 正交三模态整形用 Kronecker 结构正交旋转把单峰高斯权重塑成三值友好的三峰分布顺手压住激活离群值ILA-AMP层间感知激活混合精度把相邻层的二阶交互成本压进比特分配防少数弱层引发级联崩塌。实验与数字在W1.58A4权重 1.58-bit、激活 4-bit下保持高精度并带来显著端到端推理加速论文摘要明确maintains high accuracy under W1.58A4, while delivering significant inference acceleration。激活呈重尾 极端离群值低 bit 下这些离群值主导失真——KOTMS 共享旋转从统计上抑制离群值是加速能成立的关键。对比基线其它方法在加 4-bit 激活量化后精度大幅退化TWLA 在「只量化权重」和「权重激活」两种设置下都稳健。注具体基准百分点以原文表格为准本文不 extrapolate 未披露数字。为什么重要反直觉点端侧推理的瓶颈不是「压得不够小」而是「压了却用不上」。只量化权重是假省激活和反量化开销还在。TWLA 证明W1.58A4 端到端可加速这条之前被认作不可能的路能走通而且免重训、可迁移到任意预训练模型。对手机 / IoT / 嵌入式这意味着 7B 级模型有望在极小内存上跑起来而不是停在「论文里的 1.58-bit」。复现 / 落地思路代码已开源github.com/Kishon-zzx/TWLA可直接对 LLaMA 系模型做 PTQ 验证 W1.58A4配套关注 EdgeRazorarXiv:2605.04062南京大学 微软1.58-bit 混合精度 自适应蒸馏让 0.6B Qwen3 在 iPhone 上 15 倍加速是端侧落地的互补方案资源有限时先用 4-bit 权重量化如 Gemma 4 的 QAT 检查点验证链路再试三值。今日可做的 3 件事拿你手头一个 7B 模型先跑标准 4-bit 权重量化看精度/显存建立基线。试用 TWLA 或 EdgeRazor 的公开代码对比 W1.58A4 下激活量化前后的端到端延迟。给你的端侧场景画一条「内存预算 vs 可接受精度」曲线确定最低可用比特。下篇预告第 7 期我们读评测看 ICLR 2026 的 Toolathlon——32 个软件应用、604 个工具最强模型也只做对 38.6%现有榜单为什么测不出真实差距。