(论文速读)TAP:一种无训练扩散加速的令牌自适应预测器框架

发布时间:2026/9/27 10:25:43
(论文速读)TAP:一种无训练扩散加速的令牌自适应预测器框架 论文题目TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion AccelerationTAP一种无训练扩散加速的令牌自适应预测器框架会议CVPR2026摘要扩散模型获得了很强的生成性能但由于需要重复全模型去噪过程因此推理速度仍然很慢。我们提出了令牌自适应预测器(TAP)这是一个无需训练、探测驱动的框架它在每个采样步骤自适应地为每个令牌选择一个预测器。TAP使用模型第一层的单个完整评估作为低成本探测器来计算紧凑的候选预测器家族的代理损失(主要通过变化阶数和水平的泰勒展开实例化)然后为每个令牌分配具有最小代理误差的预测器。这种按令牌的“探测-然后选择”策略利用了不同的时间动态不需要额外的训练并且与各种预测器设计兼容。TAP的开销可以忽略不计同时实现了极大的加速而感知质量损失很小或没有损失。在多个扩散架构和生成任务上的广泛实验表明与固定的全局预测器和仅缓存的基线相比TAP显著提高了精度-效率边界。TAP一种无需训练的Token自适应扩散模型加速框架一、背景扩散模型的推理困境扩散模型Diffusion Models已经成为图像与视频生成领域的主力军。无论是 FLUX、Stable Diffusion还是 HunyuanVideo其生成质量有目共睹。然而这类模型有一个根本性的效率瓶颈每一步去噪都必须对整个大型神经网络做一次完整的前向传播。对于一个 50 步采样过程这意味着要运行 50 次完整的 Transformer 计算——成本极高。为了解决这一问题研究者们提出了两类主流加速方案时间步压缩如 DDIM、DPM-Solver减少采样步数但在极端加速比下会损害生成质量。特征缓存与预测如 DeepCache、TaylorSeer、TeaCache利用相邻时间步的特征相似性避免重复计算。然而这两类方法都存在明显短板引出了本文要解决的核心问题。二、现有方法的三大局限2.1 直接复用误差随时间步间隔爆炸最直接的特征缓存策略是直接复用在 N 步窗口内只在第一步做完整计算后续步骤直接沿用缓存的特征。这相当于 N 倍的无损加速——理论上很美好但实践中随着窗口 N 增大特征已经发生显著变化直接复用会导致严重的近似误差和图像质量下降。2.2 全局预测忽视了 Token 间的异质性以 TaylorSeer 为代表的预测型方法更进一步不再直接复用旧特征而是用 Taylor 展开来预测未来时间步的特征。这是一个重要进步但存在一个根本缺陷——对所有 token 使用同一个全局预测器。然而现实并非如此均一。观察扩散模型的去噪过程可以发现低纹理区域如平滑背景的特征随时间步变化缓慢、规律性强低阶预测器已经足够。高纹理或内容丰富的区域如物体边缘、文字在中间时间步可能发生剧烈变化需要更高阶或不同展开点的预测器。【Figure 9Token 演化模式分析图展示低纹理 token蓝色与高纹理 token橙色的相对距离随时间步的变化曲线】将同一个预测器强加给所有 token就会在最难预测的那些 token 上积累大量误差进而拖累整体生成质量。2.3 自适应方法阈值难以泛化SpeCa 和 TeaCache 等方法尝试在样本层面做自适应决策决定某一步是否跳过但它们依赖人工设定的阈值且在不同模型之间需要重新调参难以泛化部署。此外逐样本的动态计算量也会破坏批并行推理的效率。三、TAP 的核心思想本文提出的Token-Adaptive PredictorTAP框架在统一的设计中同时解决了以上三个问题。其核心理念一句话概括为每个 token 在每个时间步从候选预测器池中动态挑选误差最小的那一个。TAP 的工作流程分为三个模块计算与缓存、Taylor 预测器族构建、以及 Probe-then-Select 机制。【Figure 1TAP 框架总览图展示三个模块a计算与缓存、bTaylor 预测器族、cProbe-then-Select 机制的关系】四、方法详解4.1 计算与缓存只存两样东西在每个 N 步窗口的第一步TAP 执行一次完整的模型前向传播并缓存两个关键张量第一层调制输入即经过时间步嵌入调制后的第一层归一化输出全局残差模型输出与输入之差这两个张量是后续探针打分和特征预测的基础。值得注意的是TAP只缓存这两项额外显存为 O(1)与模型层数无关——而 TaylorSeer 等逐层缓存方法的额外显存为 O(L)。4.2 Taylor 预测器族多样化覆盖 Token 动态标准 TaylorSeer 使用固定展开阶数 m 和固定预测距离k 为距离上次完整计算的步数对所有 token 统一预测TAP 的关键改进是同时变化展开阶数和预测距离构建一个预测器族展开阶数默认包含 0 阶、1 阶、2 阶三种。低阶预测器对突变、不连续的 token 动态更鲁棒高阶预测器对平滑、稳定的 token 动态拟合更精确。预测距离以步长离散化默认。当预测距离超过某 token 的 Taylor 收敛半径时高阶项会发散放大误差通过选择更小的即更靠近展开点可以规避这一风险。默认配置下预测器族共包含个候选预测器。【Figure 2Taylor 预测器族消融实验图展示a预测阶数和b预测距离范围对 ImageReward 的影响热力图与曲线】消融实验表明将展开阶数从 O2 扩展到ImageReward 从 0.89 提升至 0.95同时引入距离变化进一步提升至 0.99将距离窗口向右移动如 [k, k2]收益甚微说明向更早的展开点靠拢更有利于避免发散。4.3 Probe-then-Select用第一层打分跳过后续层在窗口内的跳过步骤TAP 不再执行完整的前向传播而是Step 1获取探针输出利用当前输入仅运行第一层得到真实的调制输入。Step 2并行计算各预测器的代理误差对预测器族中每个预测器 p用其对第一层调制输入的预测值与真实值计算余弦距离作为代理损失Step 3逐 Token 选择最优预测器对每个 token (b, n)选择代理损失最小的预测器Step 4用最优预测器预测残差输出结果用选出的对缓存的残差进行预测组装出完整预测残差最终输出为整个探针打分和预测器选择完全并行代价极低在 FLUX.1-dev 50 步推理中TAP 引入的额外 FLOPs 仅约为单一全局预测器基线的0.015%额外显存仅0.1 GB约 0.3%。此外由于选择依据是候选预测器之间的相对代理误差而非与固定阈值的比较TAP 天然是无阈值的无需针对不同模型手动调参。【Figure 7探针代理损失与下游特征误差的相关性图验证第一层调制输入作为探针的可靠性】五、实验结果5.1 文生图FLUX.1-dev【Table 1FLUX.1-dev 与 FLUX.1-schnell 上的定量对比表包含延迟、FLOPs、ImageReward、CLIP、PSNR、SSIM、LPIPS 等指标】在 FLUX.1-dev 的多个加速档位上TAP 全面超越对比方法方法加速比ImageRewardPSNRTaylorSeer (N8)6.24×0.9114.72TeaCache (l2.0)6.17×0.6614.23TAP (N8)6.24×0.9916.11在 6.24× 的高加速比下TAP 的 ImageReward 达到 0.99不仅远超对比方法甚至略高于 4.16× 加速时的基线0.97。作者分析认为TAP 在更大预测窗口下有时反而能产生更连贯、更干净的输出。【此处配Figure 3FLUX.1-dev 可视化对比图展示 6.24× 加速下各方法的图像质量比较】【此处配Figure 5FLUX.1-dev 的 Pareto 图延迟 vs. CLIP / ImageReward直观展示 TAP 处于效率-质量 Pareto 前沿】5.2 文生图Qwen-Image【此处配Table 2Qwen-Image 与 Qwen-Image-Lightning 上的定量对比表】在 Qwen-Image 上TAP 在 3.57× 加速比下实现 ImageReward 1.23TaylorSeer 为 1.18PSNR 超越 TeaCache 约 1.1 dB超越 TaylorSeer 约 2.1 dB。在精简版 Qwen-Image-Lightning8 步上TAP 同样以 2× 加速取得最优的感知质量指标。【此处配Figure 12Qwen-Image 可视化对比图包括含文字渲染的复杂场景】5.3 视频生成HunyuanVideo【此处配Table 3HunyuanVideo 在 VBench 上的定量对比表】视频生成任务对时序一致性要求更高更容易暴露全局预测器的缺陷。实验结果表明TAPN6以4.98× 加速达到 VBench 评分65.46为所有方法中最高与无加速基线66.61相比仅下降1.7%接近无损TaylorSeerN6同等加速比下仅达 64.89TeaCache 更低。【此处配Figure 4HunyuanVideo 可视化对比图展示大熊猫在篝火边弹吉他的视频帧质量】【此处配Figure 13HunyuanVideo 更多可视化结果】5.4 显存开销TAP 的隐形优势【此处配Table 5各模型骨干网络上的峰值 GPU 显存对比表Original / TaylorSeer / TAP】TAP 只缓存两个张量第一层调制输入和全局残差额外显存为O(1)。以 HunyuanVideo 为例方法额外显存相对原模型TaylorSeer11.91 GB26.27%TAP0.29 GB0.6%这使 TAP 在显存受限的场景下具有显著的部署优势。5.5 人类评测【此处配Table 8FID、VQAScore 和人类偏好评测对比表】在 DrawBench 上进行的人类偏好研究10 名评测员显示TAP 被偏好的比例为35.5%而 TaylorSeer 仅为16.5%。FID 方面TAP 为82.98显著优于 TaylorSeer 的 102.25。六、消融分析6.1 探针的选择TAP 使用时间步嵌入调制后的第一层输入作为探针而非原始输入。【此处配Table 6不同探针选择的对比原始输入探针 vs. 调制输入探针】实验表明调制输入与模型输出动态的相关性更强即第一层的归一化调制操作已经将时间步信息融入更能反映特征的演化趋势因此作为探针时效果更好PSNR15.98 → 16.11ImageReward0.97 → 0.99。【此处配Figure 7代理损失与下游特征误差的时序相关性曲线输入、调制输入、输出三者对比】6.2 代理损失的选择【此处配Table 7L1 损失 vs. 余弦距离的对比】余弦距离0.99 / 16.11略优于 L1 损失0.97 / 16.05两者均大幅超越无 TAP 的基线0.90 / 14.70说明代理损失的核心优势来自相对比较机制本身具体度量方式影响有限。6.3 扩展到其他预测器【此处配Table 4基础 TAP vs. TAP含 Hermite 预测器的对比】TAP 框架对预测器设计是开放的。当在候选集中加入基于 Hermite 多项式的非线性预测器后ImageReward 从 0.97 进一步提升至 0.98PSNR 从 17.43 提升至 17.52验证了框架的可扩展性。6.4 Token 预测模式的时序规律【此处配Figure 10TAP 选择的预测阶数与预测距离随时间步的分布变化图】对 TAP 实际选择的预测器进行统计分析可以发现明显的时序规律早期阶段0–18 步模型主要选择低阶预测器偏好较小的预测距离——此时特征演化快速且不平滑Taylor 展开的收敛半径小需要保守的预测策略。中后期阶段18–50 步逐步转向高阶预测器方差明显增大说明不同 token 之间的演化差异愈发显著per-token 自适应的必要性也愈发突出。这一模式与扩散模型生成过程的物理直觉高度一致生成早期内容尚未成形特征剧烈变化后期内容趋于稳定更适合高阶平滑预测。七、与现有方法的核心差异维度直接复用FORA等全局预测TaylorSeer样本自适应TeaCache/SpeCaTAPToken 粒度全局统一全局统一样本级别Token 级别预测器数量10阶1固定阶115多阶多距离阈值依赖无无有需调参无批并行✅✅❌破坏批均匀性✅额外显存O(1)O(L)逐层缓存O(1)O(1)需要训练❌❌❌❌八、总结与展望TAP 从一个简洁而有力的观察出发——不同 token 的时间动态是异质的最优预测器因 token 和时间步而异——并围绕这一观察构建了一套优雅的无训练加速框架。其核心贡献在于将全局预测升级为逐 Token 自适应预测在不增加训练成本的情况下大幅提升近似精度用第一层的轻量级探针代替完整前向传播来进行预测器评分将选择的计算代价压缩到几乎可以忽略不计以相对误差替代绝对阈值实现了跨模型的零调参泛化。在 FLUX、Qwen-Image、HunyuanVideo 等多个主流架构上TAP 在相同或更高的加速比下始终优于所有对比方法且显存开销极小。未来值得探索的方向包括将 TAP 与时间步压缩方法如 DPM-Solver结合以获得叠加收益在候选预测器池中引入更多异构预测器如频域方法 FreqCa以及将 per-token 自适应的思想应用于扩散模型的其他加速瓶颈如 Attention 计算。