
这项由德克萨斯大学奥斯汀分校研究团队完成的研究以预印本形式于2026年5月7日发布论文编号为arXiv:2607.14106v1感兴趣的读者可通过该编号在arXiv平台检索完整论文。现在的AI写作工具大多数人对它的印象是一字一字往外蹦——像极了你高中时盯着考卷苦苦思索先写第一个字再写第二个字每次落笔都要参考前面已经写下的内容。这种方式叫自回归生成它很好用但速度是它的硬伤必须一步一步来无法并行加速。正因如此另一类AI写作方案近年来引发了广泛关注——扩散语言模型。这类方法的思路更像一位画家先在画布上涂抹一片朦胧的噪点然后一轮一轮地细化直到清晰的图像浮现出来。在语言版本里AI从一堆随机字符出发经过多轮去噪最终得到一段有意义的文字。最大的优势在于这个过程可以并行处理所有位置的字符大幅提升生成速度。然而现有的扩散语言模型存在一个根本性的缺陷德克萨斯大学奥斯汀分校的研究团队将其称为因式分解问题。简单说当AI在一步之内同时决定多个字的内容时它实际上是把每个字独立地猜出来而不是真正考虑它们之间的搭配关系。这就好比你让一群人同时猜谜每个人只能听到谜面相互之间无法交流——结果虽然每人都给出了合理的答案合在一起却可能驴唇不对马嘴。面对这个问题研究团队提出了一种全新的方案名为Token时间连续扩散模型TTCDToken Time Continuous Diffusion。这个名字听起来很拗口但它背后的核心思想却出人意料地直觉化不同的字应该以不同的速度从噪声变成清晰。有些字天生容易猜就让它先变清楚有些字需要参考更多上下文就让它慢一点。一、从一锅炖到分档火候——扩散语言模型的困境与出路要理解TTCD究竟解决了什么问题先得明白现有扩散语言模型的运作方式。现有的扩散语言模型大体上分为两类。第一类在离散空间里操作也就是直接对词汇表中的具体词语进行操作。比较有代表性的方式是遮盖扩散把文章中的每个词都先用[MASK]遮住然后一步一步地揭开遮盖让AI逐渐填上正确的词。另一种方式是从完全随机的词语出发然后逐步替换成更合适的词。第二类在连续空间里操作把每个词转换成一个数字向量可以理解为词语的坐标然后让这些坐标从随机噪声出发一步步流向正确词语对应的坐标位置。因式分解问题主要困扰的是离散空间模型。每当模型需要在一步之内同时决定多个词的内容时它其实是在独立地对每个位置做决策就像多个互不相识的演员同时即兴表演虽然各自表现都不错但合演出来的戏却缺乏默契。这个问题在生成步数很少也就是高倍速生成时尤为突出——步数越少每步需要同时决定的词就越多集体各说各话的概率就越大。连续空间模型理论上能绕开这个问题因为词语的坐标在变成最终答案之前一直处于模糊状态不需要在中途做出明确的离散决策。然而连续空间模型有自己的麻烦研究人员发现词语的坐标在从噪声向目标移动的过程中存在一个突变区间——在很长一段时间内坐标仍然一片混乱毫无规律但当噪声水平降到某个临界点时所有词语几乎同时跳变为清晰的答案。这意味着大部分去噪步骤都是无效的真正有用的信息只在极短的窗口内出现。更麻烦的是当AI需要根据已有的前缀输入的提示词来生成后续内容时现有连续空间模型的全局时间机制会把输入词和待生成词都放在同一个噪声水平下处理无法区分这是已知的干净输入和这是需要从噪声中生成的内容。研究团队的核心洞察是这两个问题都源于同一个设计缺陷——整个句子中所有词语共享同一个时间即噪声水平。有些词本来很容易猜但受制于统一的时间表不得不和难猜的词一起慢慢等待。提示词明明是干净的已知信息却被强行赋予与待生成词相同的噪声水平。二、给每个词配一块独立进度条——per-token时间的设计TTCD的核心创新是引入了每个词独立时间per-token时间的概念。在传统连续扩散模型里有一个全局时间参数取值从0到10代表纯噪声1代表干净的词语。这个参数对句子里所有词都是一样的就像一个统一的闹钟所有词同步出发、同步到达。TTCD打破了这个统一闹钟。每个词现在有自己的本地时间这个本地时间由两个因素决定全局时间相当于整场比赛进行了多久和这个词的排名rank相当于这个词被分配到了哪个赛道。排名高的词本地时间推进得更快也就是更早从噪声变成清晰的词语排名低的词本地时间推进得更慢更晚才变清晰。具体的数学设计颇为精巧。每个词的排名是从0到1的均匀随机数在整个生成过程中固定不变。给定全局时间和排名本地时间通过一个特殊函数计算得出。这个函数的设计满足几个关键要求当全局时间为0时所有词的本地时间都是0全部处于纯噪声状态当全局时间为1时所有词的本地时间都是1全部变成干净词语在中间过程中排名越高的词本地时间越大越靠近清晰状态而且所有词本地时间的平均值恰好等于全局时间保持整体进度的一致性。研究团队选用了Beta分布的分位数函数来实现这个映射。直观上可以把这个设计理解为一场马拉松全局时间是比赛进行的总时长每个词是一名选手排名决定了选手的起跑优势——排名高的选手跑得快已经接近终点排名低的选手跑得慢还在后半段苦苦追赶。但无论快慢所有人都在同一场比赛里开始时同在起跑线结束时都会抵达终点。这个设计带来了几个直接好处。在任何给定的全局时间点句子中同时存在处于不同清晰程度的词有些词已经接近清晰可以为模型提供参考有些词还在噪声中需要借助前者的信息来猜测自己的内容。这让模型在训练和推理过程中能自然地学会利用已清晰词语来推断未清晰词语这正是语言建模的核心能力——理解词语之间的依赖关系。三、聪明地分配进度条——基于确信度的排名分配TTCD的per-token时间设计还解决了另一个问题哪些词应该被赋予更高的排名更早变清晰哪些词应该被赋予更低的排名更晚变清晰最简单的方式是随机分配排名就像随机给马拉松选手分配出发顺序。研究团队在Sudoku数独实验中测试了这种方式发现确实比现有方法有所提升但还不够好。更好的方式是让模型自己判断哪些词它已经很有把握哪些词它还很不确定有把握的词应该更早固定下来为其他不确定的词提供参考不确定的词应该多等一等等周围词变清晰之后再做决定。TTCD的推理算法中实现了这个想法。在正式开始逐步去噪之前模型先做一次侦察把所有待生成的词都初始化为纯噪声做一次前向推理看看模型对每个位置的预测有多确定。衡量确定程度的指标是熵entropy——熵越低说明模型对这个位置的预测越集中比如有90%的概率认为这里应该是的确信度越高熵越高说明模型对这个位置摸不准头脑各种可能性都有。侦察结束后按照每个词的熵值重新排列排名熵低确信度高的词获得高排名熵高确信度低的词获得低排名。这样那些模型一眼就能看出来的词会更早变清晰成为其他词的参照锚点那些需要更多上下文才能确定的词则等待更多信息后再做决定。这个设计和人类写作的直觉高度吻合。当你写一篇文章时有些词几乎是自然而然就确定了比如文章的主题词、固定搭配而有些词需要斟酌再三比如一个微妙的形容词。TTCD让AI也能做到这种自然的先确定容易的再处理难的。四、连续空间里的确定性之路——去噪步骤的设计在正式介绍去噪步骤的设计之前有必要解释一下连续扩散模型的基本操作逻辑。在连续空间里每个词都对应一个词向量一组数字可以理解为词语在多维空间里的坐标。纯噪声状态是一堆随机散布的坐标干净词语状态是每个词对应的固定坐标。去噪的过程就是让坐标从随机位置逐步移向目标词的坐标位置。每一步的移动方向怎么确定模型根据当前的坐标状态以及词语的本地时间预测每个位置最终应该是什么词然后用预测词的词向量的加权平均作为目标计算出移动的方向和距离。这就像你在迷雾中移动每一步都根据当前位置和隐约看到的目标灯塔方向向前迈一步。TTCD在这个基础上加入了per-token时间的调整每个词的移动步长不再由统一的全局步长决定而是由它自己的本地时间步长决定。排名高、本地时间推进快的词每步移动得更多排名低、本地时间推进慢的词每步移动得更少。这保证了整个系统的一致性每个词都严格按照自己的进度条前进。对于有输入提示词的情况也就是给定前缀续写后文TTCD的处理极为自然提示词的本地时间直接设为1完全干净在整个生成过程中保持不变对应的词向量也永远是提示词的真实词向量。这意味着模型始终能看到完整、干净的输入提示而无需猜测它。相比之下现有的连续空间模型会把提示词和待生成词放在同一个时间尺度下处理无法做出这种清晰的区分。五、一步压缩多步——快捷模型的蒸馏TTCD还引入了一套自我蒸馏self-distillation机制进一步提升少步生成的质量。这套机制参考了快捷模型shortcut model的思路正常的扩散模型需要很多小步才能从噪声走到干净状态快捷模型则试图让一大步比如直接从全局时间0.3跳到0.7的效果等同于两个小步从0.3到0.5再从0.5到0.7叠加的效果。实现方式是在原有的TTCD模型训练完成之后用一个额外的微调阶段来训练快捷模型。微调时模型需要同时接收起始全局时间、终止全局时间以及辅助稳定训练的中间全局时间作为条件输入学会预测在这段时间区间内的平均流速。训练目标是让一步的预测结果与两步展开的预测结果保持一致通过最小化两者的KL散度一种衡量两个概率分布差异的指标来实现。此外还保留了一个辅助损失项确保当步长趋近于0时模型的预测与真实数据保持吻合。在推理阶段快捷模型与标准TTCD的推理流程相同只是额外接收终止时间作为条件。这让快捷模型能够在更少的步数内完成高质量生成对于需要快速响应的应用场景尤为重要。研究团队在OpenWebText一个大规模互联网文本数据集上的实验中先用1M步训练标准TTCD模型再用5万步微调快捷版本其中前4万步用均匀采样的时间区间后1万步用特殊的采样策略进一步强化少步场景。实验中还发现在快捷蒸馏时除了起始和终止时间外额外提供中间时间作为条件输入能显著稳定训练过程——这是因为大步长会导致排名信息模糊而中间时间的加入能弥补这一信息损失。六、改造建筑结构——在Transformer中嵌入per-token时间实现per-token时间还需要对模型架构做出调整否则模型无法感知每个词各自处于什么时间。TTCD基于扩散TransformerDiT架构这是一种在图像和语言扩散模型中广泛使用的结构。标准DiT通过自适应层归一化adaLN机制将全局时间信息注入模型将全局时间编码成一个向量然后用这个向量来缩放、平移和门控每一层的归一化操作相当于让时间信息渗透到模型的每一个计算步骤中。TTCD的改造思路是保持完全相同的参数结构但把全局时间替换成每个词各自的本地时间。也就是说同一层的不同词用的是不同的时间向量来调制归一化操作。这个改造不引入任何新的参数只是改变了输入的构成方式。对于快捷蒸馏版本需要同时接收多个时间作为条件起始、中间、终止研究团队采用了拼接后降维的方式把三个时间的嵌入向量拼在一起再通过一个线性层压缩到与标准单时间嵌入相同的维度然后喂给adaLN层。这样在不增加参数量的前提下实现了多时间条件的支持。七、数独游戏里的压力测试——极限少步生成研究团队选择数独Sudoku作为第一个测试场景原因颇为有趣数独是一个有严格约束的逻辑推理任务每个空格的答案与其他空格强烈相关完美地暴露了独立采样多个token的问题所在。测试设定是9×9数独约25个格子作为已知输入其余56个格子需要模型填写评估指标是整块棋盘完全正确的比例。测试了2步、4步、8步、16步四种生成预算。对比方法包括基于遮盖的离散扩散随机揭盖和按熵值揭盖两种策略、全局时间连续扩散不使用时间翘曲和使用时间翘曲两种变体、以及TTCD的两种变体随机排名和基于熵的排名。所有方法都在相同的小型6M参数Transformer上训练100个epoch。结果相当清晰。在最极限的2步生成场景下离散遮盖模型随机策略的准确率仅0.62%几乎等于乱猜离散遮盖模型熵策略有11.65%连续全局时间模型接近0%而TTCD基于熵的排名达到了31.51%在所有方法中遥遥领先。在4步生成时TTCD达到61.33%而最佳离散基线熵策略达到68.29%两者接近。在8步和16步时离散熵策略凭借足够的步数占据优势92.90%和97.30%而TTCD分别为65.85%和68.46%。这个结果验证了核心假设在极少步数的情况下连续空间per-token时间的组合能有效规避因式分解问题同时基于熵的排名分配能让模型在第一次前向推理后就正确识别出容易的格子和难的格子赋予合理的去噪顺序。八、在真实语言上的较量——OpenWebText上的规模化实验研究团队将TTCD扩展到160M参数规模在OpenWebText数据集上进行了1M步的完整训练并对蒸馏版本进行了系统性评估。评估分为两种模式。无条件生成模式下模型需要凭空生成1024个token的文本不依赖任何输入提示。前缀条件生成模式下模型接收1024-K个token的干净前缀生成后续K个tokenK分别取32和128两种设定更接近实际应用场景。评估指标使用了生成困惑度Generative PPL和文本熵的组合。生成困惑度由GPT2-large模型评估数值越低意味着生成文本越像真实人类写作文本熵衡量词汇多样性数值越高说明生成文本越不重复。一个好的模型应该在这两个指标上都表现良好即位于困惑度低、熵值高的右下方区域。研究团队通过调整推理参数采样温度和初始噪声标准差来描绘每个模型的表现曲线提供更全面的性能图景。对比的方法涵盖非蒸馏和蒸馏两组。非蒸馏组包括MDLM遮盖离散扩散、Duo均匀噪声离散扩散、FLM连续空间离散生成扩散即Flow Map LM以及TTCD。蒸馏组包括Duo w/ DCD蒸馏版Duo、FMLM蒸馏版FLM以及TTCD w/ Shortcut。在无条件生成实验中TTCD在4步和8步生成时与Duo表现相当并优于MDLM而在16步和32步时TTCD与Duo的差距进一步缩小。与FLM的对比尤为显著FLM在改变推理参数时表现极不稳定文本熵的可调范围很窄且在某些参数设置下会出现严重的重复熵值趋近于0TTCD的表现则平稳得多在更广泛的参数范围内都能维持正常的文本多样性。在蒸馏版本的对比中TTCD w/ Shortcut在1步到4步的生成中优于Duo w/ DCD与FMLM相比也有竞争力且在文本熵的可调范围上明显更宽。一个具体的数字在4步蒸馏生成时TTCD w/ Shortcut的生成困惑度在温度1.0时约为249而Duo w/ DCD约为305FMLM约为112但文本熵仅约5.37相比TTCD的5.56说明FMLM以牺牲多样性换取了较低的困惑度。前缀条件生成的结果更为突出。在32 token画布的2步生成相当于16倍加速场景下TTCD w/ Shortcut的表现全面优于所有基线。FLM在这个任务上几乎完全失效生成的文本熵值低于3极度重复甚至超出了图表范围。这印证了per-token时间在处理输入/输出不对称场景时的天然优势提示词直接被赋予时间1无需特殊处理待生成词从时间0出发完全与提示词区分开来。研究团队还提供了定性生成样本作为辅助说明可以看到TTCD包括蒸馏版本在不同步数下都能生成语义连贯、词汇多样的文本尽管在2步这种极端加速下语义连贯性仍不如步数较多时的版本。九、分子设计上的迁移——QM9数据集上的分类引导实验除了语言任务研究团队还在分子生成任务上验证了TTCD的迁移能力使用的数据集是QM9一个包含小分子结构的化学数据集。测试场景是分类引导生成classifier-free guidance在生成分子时同时优化分子的某个化学属性此处为环计数即分子中苯环等环状结构的数量引导系数从1到5变化。评估指标包括生成的新颖分子数量在1024次生成中不重复的新分子有多少和新颖分子的平均环计数。对比方法包括UDLM均匀噪声离散扩散、MDLM遮盖离散扩散、全局时间连续扩散以及TTCDper-token时间连续扩散。结果显示连续空间方法整体优于离散方法能生成更多新颖的有效分子。在连续方法内部TTCD相比全局时间连续扩散进一步拓展了性能边界——在引导强度变化时TTCD能在更高的环计数水平下维持更多的新颖分子数量。此外无论是2步、8步还是32步生成TTCD的性能边界都持续优于全局时间连续方法证明per-token时间的优势不依赖于特定的生成步数也不局限于文本领域。说到底TTCD讲述的是一个关于差异化对待的故事。在AI领域很长一段时间里我们习惯于用统一的流程处理所有内容同一个噪声水平、同一个去噪速度、同一个时间表。这种整齐划一的方式有其美学吸引力但它忽略了一个基本事实内容本身是有差异的有些词天然比其他词更容易确定有些位置的信息比其他位置更早明朗。TTCD所做的就是把这种差异性纳入模型设计的核心。用一个通俗的说法现有模型像是一个整齐的合唱团所有人必须同步出声、同步停止TTCD则更像一支爵士乐队每件乐器都有自己的节奏但整体上保持协调最终奏出一曲有层次感的乐章。这项研究目前的局限性也值得坦率面对实验规模最大只到160M参数与业界动辄数十亿参数的主流模型相比仍是小体量。是否能在更大规模下保持性能优势仍是一个开放问题。此外尽管TTCD在少步生成场景下表现出色但在步数较多如32步以上的场景下与最优基线相比的优势趋于收窄说明per-token时间的收益主要集中在压缩步数这一维度。对于想进一步探索的读者可以考虑这样几个方向per-token时间的理念能否迁移到离散扩散模型中论文末尾也提及了这一方向在代码生成、数学推理等结构性更强的任务上per-token时间的差异化处理是否能带来更显著的收益排名分配策略除了基于熵之外是否存在更优的方案完整论文可通过arXiv编号2607.14106v1检索有兴趣的读者可以直接在arXiv平台上找到所有技术细节和实验数据。QAQ1TTCD与传统离散扩散语言模型相比最大的区别是什么A传统离散扩散模型在生成时需要同时对多个词做独立决策容易产生词语之间不协调的问题在少步生成时尤为明显。TTCD在连续空间中操作词语的坐标在变成最终答案前始终保持模糊状态不需要在中途做出离散决策从根本上规避了这个问题。同时per-token时间让部分词先变清晰为其他词提供参考进一步提升了生成质量。Q2TTCD的per-token时间在前缀条件生成任务中如何发挥作用A在前缀条件生成任务中已知的输入提示词直接被赋予时间等于1的状态也就是完全干净状态整个生成过程中始终保持真实词向量不变。待生成的词从时间等于0的纯噪声出发逐步推进。这样模型始终能看到完整干净的输入而不是把输入和输出放在同一个噪声水平下混淆处理使得条件生成的准确性大幅提升。Q3TTCD的快捷蒸馏是如何实现少步高质量生成的A快捷蒸馏的基本思路是让模型学会跳步让一大步的生成效果等同于两个小步叠加的效果。训练时模型同时接收起始、中间、终止三个全局时间作为条件学习在时间区间内的平均流速目标是让一步预测结果与两步展开结果保持一致。经过5万步微调后蒸馏版TTCD能在极少步数1到4步内完成高质量生成在少步场景下优于对比的离散蒸馏基线。