BART:用于自然语言生成、翻译与理解的去噪序列到序列预训练

发布时间:2026/7/27 7:11:34
BART:用于自然语言生成、翻译与理解的去噪序列到序列预训练 论文翻译自BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and ComprehensionMike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad, Abdelrahman Mohamed, Omer Levy, Ves Stoyanov, Luke ZettlemoyerFacebook AI · arXiv:1910.13461v1 · 2019-10-29摘要我们提出 BART一种用于预训练序列到序列模型的去噪自编码器。BART 通过两步进行训练1使用任意噪声函数破坏文本2学习一个模型以重建原始文本。它采用标准的基于 Transformer 的神经机器翻译架构。尽管结构简单但它可以被视为对 BERT、GPT 以及许多更近期预训练方案的推广因为它同时具有双向编码器与从左到右的解码器。我们评估了多种加噪方式发现最佳效果来自两种变换的结合随机打乱原始句子的顺序以及一种新的填充方案其中若干连续文本片段被单个掩码标记替换。BART 在面向文本生成的微调中尤其有效但在理解任务上同样表现良好。在与 RoBERTa 可比的训练资源下它在 GLUE 通用语言理解评测与 SQuAD 阅读理解基准上达到相近表现在一系列抽象式对话、问答和摘要任务上取得新的当时最优结果最高提升达 6 个 ROUGE 点在机器翻译中仅使用目标语言预训练BART 相较回译系统还可提升 1.1 BLEU。我们还报告了在 BART 框架内复现其它预训练方案的消融实验以更好地衡量哪些因素最影响终端任务表现。1. 引言自监督方法已经在广泛的 NLP 任务中取得显著成功。最成功的方法大多是掩码语言模型即一种去噪自编码器训练时恢复那些随机被遮盖的词。近期工作表明通过改进被遮盖词元的分布、被遮盖词元的预测顺序以及用于替换被遮盖词元的可用上下文都可以进一步提升效果。然而这些方法通常聚焦于特定类型的终端任务例如跨度预测或生成因此其适用范围仍然有限。本文提出 BART即“双向与自回归 Transformer”Bidirectional and Auto-Regressive Transformers。BART 通过任意噪声函数破坏文本再训练一个序列到序列模型来恢复原文。该设定的一个关键优势在于噪声的灵活性可以对原文施加任意变换包括改变其长度因为编码器输入与解码器输出并不需要对齐。在所评估的多种加噪方式中最佳效果来自随机打乱原始句子顺序与新的文本填充方案的结合在该方案中任意长度的文本片段会被单个掩码标记替换。这一做法推广了 BERT 中的词级遮盖与下一句预测目标因为它迫使模型更多地推理整体句长并在输入上执行更长距离的结构变换。BART 在文本生成类微调任务上尤其有效但在理解任务上同样表现良好。它在 GLUE 和 SQuAD 上与 RoBERTa 的表现相当同时在抽象摘要、对话生成和长答案问答等任务上取得新的最优结果。除此之外BART 还提供了一种用于机器翻译的新微调方式在 BART 之上叠加少量额外 Transformer 层使模型先把源语言映射为带噪英语表示再通过 BART 恢复为自然英语。2. 模型BART 是一种去噪自编码器它把损坏后的文档映射回生成该文档的原始文档。它被实现为一个序列到序列模型编码器对损坏文本进行双向建模解码器则从左到右自回归地生成原始文档。对于预训练我们优化原始文档的负对数似然。2.1 架构BART 使用标准的序列到序列 Transformer 架构Vaswani et al., 2017。不同之处在于遵循 GPT 的做法作者将 ReLU 激活函数替换为 GeLUHendrycks and Gimpel, 2016并将参数初始化为N(0, 0.02)。对于基础模型编码器与解码器均为 6 层对于大模型编码器与解码器均为 12 层隐藏维度为 1024。图 1BART 与 BERT、GPT 的结构性对比。BART 的编码器输入与解码器输出不要求一一对齐因此可以自然支持更一般的加噪与恢复过程。ReLURectified Linear Unit修正线性单元ReLU(x)max(0,x)当输入x0时输出就是x本身当 x≤0时输出严格为 0。如果输入一直落在负区间梯度为 0权重就不再更新这个神经元就永久失效。尤其在较大的学习率或偏置设置不当时容易出现“神经元死亡” (Dead ReLU)。GeLUGaussian Error Linear Unit高斯误差线性单元可以视为 ReLU 的平滑、概率化版本给输入 x 乘上了一个在 [0,1] 之间的“门控系数” Φ(x)负区间也有较小梯度不会出现 ReLU 那样彻底的 0 梯度死区信息保留更多。2.2 噪声变换作者研究了多种输入扰动方式主要包括1. 文本填充text infilling从文档中采样若干文本跨度其长度服从泊松分布然后用单个[MASK]标记替换整段内容。由于跨度长度可以为 0因此该目标也能够模拟插入噪声。2. 句子置换sentence permutation将文档按完整句切分再随机打乱这些句子的顺序。3. 文档旋转document rotation从文档中均匀随机地选取一个词元并把文档旋转到以该词元开头模型必须据此识别真正的文档起点。4. 词元遮盖、词元删除等更接近 BERT 或删除噪声目标的退化变体。图 2本文实验使用的输入加噪方式。它们既可以单独使用也可以组合使用。chatGPT阅读后生成的图片3. BART 的表示与微调方式BART 所学习到的表示既可以用于下游判别任务也可以直接用于生成任务。由于其解码器本身就是自回归的BART 可以非常自然地被微调用于摘要、对话生成与抽象式问答。3.1 序列分类任务对于序列分类任务完整输入会同时送入编码器和解码器并使用解码器最后一个词元的表示作为文档表示再在其上接一个多类别线性分类器。这一点不同于 BERT 使用的[CLS]表示BART 使用的是解码器端的最终状态。3.2 词元级分类任务对于 SQuAD 这类词元级分类任务完整文档会输入编码器和解码器模型基于解码器每个位置的表示预测答案的起止索引。3.3 序列生成任务由于 BART 的解码器本身就是自回归的因此它可以直接用于摘要和抽象式问答等序列生成任务。在这些任务中输出通常需要从输入中复制信息、整合信息并重新表述而 BART 的预训练形式与这种设定高度一致。3.4 机器翻译论文还提出了一种利用 BART 改进机器翻译的方法增加一个较小的源语言编码器用它来替代 BART 输入端的词嵌入。该编码器负责把外语输入映射为一种表示使 BART 能够将其去噪恢复为英语从而把 BART 用作预训练的目标语言侧模型。训练分为两个阶段首先固定 BART仅训练新增编码器随后解冻全部参数进行少量联合微调。图 3BART 的两类微调方式左图用于分类右图用于机器翻译。4. 预训练目标比较为了更直接地比较不同预训练目标作者在统一实现框架下复现了若干近期提出的强方法并尽可能控制那些与预训练目标本身无关的因素。尽管为了提升各自表现学习率与层归一化的使用方式做了少量调整但整体上数据、训练步数、模型规模和微调过程都被尽量保持一致。比较对象包括左到右语言模型、置换语言模型、掩码语言模型、多任务掩码语言模型、掩码 Seq2Seq以及几种不同噪声目标下的 BART。4.1 设定所有模型均在图书语料与维基百科语料的组合上训练 100 万步。论文还把这些复现结果与 BERT 已发表数字一起列出作为额外参考不过作者强调这一部分比较的重点不是逐条复刻原论文配置而是在统一设定下观察不同目标函数的相对行为。4.2 任务评测任务包括 SQuAD 抽取式问答、MNLI 多体裁自然语言推断、ELI5 长答案抽象式问答、XSum 新闻摘要、ConvAI2 对话响应生成以及 CNN/DailyMail 摘要。这些任务同时覆盖理解和生成两大类设定因此适合用来考察不同预训练目标的泛化范围。4.3 结果与结论表 1 的结果揭示出若干清晰趋势。首先预训练方法的效果会随着下游任务而显著变化例如纯语言模型在 ELI5 上最好却在 SQuAD 上最差。其次词元级遮盖或删除至关重要单独依赖文档旋转或句子打乱的目标表现明显较弱。再次从生成任务看包含左到右语言建模成分的方法通常更有优势而对 SQuAD 这类任务而言双向编码器仍然非常关键。总体而言带文本填充的 BART 在几乎所有任务上都表现稳健而“文本填充 句子打乱”的组合给出了最一致的综合性能。表 1不同预训练目标的对比基础规模模型模型SQuAD 1.1F1MNLIAccELI5PPLXSumPPLConvAI2PPLCNN/DMPPLBERT Base88.584.3----掩码语言模型90.083.524.777.8712.597.06掩码 Seq2Seq87.082.123.406.8011.436.19语言模型76.780.121.407.0011.516.56置换语言模型89.183.724.037.6912.236.96多任务掩码语言模型89.282.423.737.5012.396.74BART Base词级遮盖90.484.125.057.0811.736.10BART Base词删除90.484.124.616.9011.465.87BART Base文本填充90.884.024.266.6111.055.83BART Base文档旋转77.275.353.6917.1419.8710.59BART Base句子打乱85.481.541.8710.9316.677.89BART Base文本填充 句子打乱90.883.824.176.6211.125.415. 大规模预训练实验在第 4 节基础模型实验的基础上作者进一步把 BART 扩展到与 RoBERTa 相同的训练规模。大模型的编码器和解码器各有 12 层隐藏维度为 1024训练采用 8000 的批大小总计 500000 步。文档使用与 GPT-2 相同的字节对编码BPE。根据前述消融结果正式大模型采用文本填充与句子置换的联合噪声每篇文档遮盖约 30% 的词元并打乱全部句子的顺序。5.1 判别任务表 2 比较了 BART 与若干近期方法在 SQuAD 和 GLUE 上的结果。其中最可直接对照的基线是使用相同训练资源、但采用不同目标函数的 RoBERTa。总体来看BART 与这些模型的表现非常接近说明 BART 在生成任务上的优势并不是以牺牲判别任务性能为代价换来的。表 2大模型在 SQuAD 与 GLUE 上的结果模型SQuAD 1.1EM/F1SQuAD 2.0EM/F1MNLIm/mmSST准确率QQP准确率QNLI准确率STS-B相关性RTE准确率MRPC准确率CoLAMccBERT84.1/90.979.0/81.886.6/-93.291.392.390.070.488.060.6UniLM-/-80.5/83.487.0/85.994.5-92.7-70.9-61.1XLNet89.0/94.586.1/88.889.8/-95.691.893.991.883.889.263.6RoBERTa88.9/94.686.5/89.490.2/90.296.492.294.792.486.690.968.0BART88.8/94.686.1/89.289.9/90.196.692.594.991.287.090.462.85.2 生成任务在生成任务上BART 作为标准序列到序列模型从输入文本映射到输出文本进行微调。训练时使用带标签平滑的交叉熵损失生成时束宽设为 5并在验证集上调节最短长度、最长长度和长度惩罚等超参数。结果显示BART 在 CNN/DailyMail 与 XSum 上都超过了此前工作尤其在更具抽象性的 XSum 上相比之前基于 BERT 的最好结果三个 ROUGE 指标都大约提升了 6 分。表 3两项标准摘要任务上的结果模型CNN/DailyMailXSumR1R2RLR1R2RLLead-3 基线40.4217.6236.6716.301.6011.95PTGEN36.4415.6633.4229.709.2123.24PTGENCOV39.5317.2836.3828.108.0221.72UniLM43.3320.2140.51---BERTSUMABS41.7219.3938.7638.7616.3331.15BERTSUMEXTABS42.1319.6039.1838.8116.5031.27BART44.1621.2840.9045.1422.2737.25在 ConvAI2 上BART 也优于先前系统的自动指标结果在 ELI5 上它相较此前最好方法又提升了 1.2 个 ROUGE-L。论文同时指出ELI5 是一个明显的例外该任务的输出与输入之间约束较弱因此纯语言模型反而更具优势。这说明 BART 的收益主要体现在那些需要同时理解输入并进行受约束生成的任务上。表 4ConvAI2 对话响应生成任务结果模型验证集 F1验证集困惑度Seq2Seq Attention16.0235.07此前最佳系统19.0917.51BART20.7211.85表 5ELI5 抽象式问答结果模型R1R2RL最佳抽取式系统23.53.117.5语言模型27.84.723.1Seq2Seq28.35.122.8Seq2Seq Multitask28.95.423.1BART30.66.224.35.3 翻译在 WMT16 罗马尼亚语到英语翻译任务上作者遵循第 3.4 节介绍的方法将 BART 用作目标语言侧预训练模型并在包含回译数据的设定下进行评估。结果表明完整微调的 BART 在强 Transformer 基线之上把 BLEU 分数从 36.80 提升到 37.96。作者也指出若没有回译数据这一方案更容易过拟合因此未来仍需探索更强的正则化策略。表 6WMT16 罗马尼亚语-英语翻译结果BLEU模型RO-EN基线系统36.80固定 BART36.29微调 BART37.966. 定性分析BART 在摘要任务上的提升并不只体现在自动指标上。论文对生成样例的分析显示模型输出通常流畅、语法正确并且高度抽象往往会综合文中多个位置的信息而不是简单抽取原句。作者指出BART 还会在一定程度上利用背景知识补全实体或推断隐含关系。不过这种能力并不总是完全可靠在个别案例中模型也会生成源文并未明确支持的细节。表 7XSum 微调后的 BART 在 WikiNews 上的摘要示例源文片段节选BART 生成摘要中文研究人员考察了斐济近海珊瑚礁中的三类珊瑚。结果发现当鱼类数量充足时它们会吃掉附着在珊瑚上的藻类和海藻这似乎让珊瑚更能抵抗与白化相关的细菌 Vibrio coralliilyticus。研究者认为藻类与升温一样可能会削弱珊瑚的化学防御而鱼类通过清除藻类在保护珊瑚。英文The researchers examined three types of coral in reefs off the coast of Fiji ... The researchers found when fish were plentiful, they would eat algae and seaweed off the corals, which appeared to leave them more resistant to the bacterium Vibrio coralliilyticus, a bacterium associated with bleaching. The researchers suggested the algae, like warming temperatures, might render the corals’ chemical defenses less effective, and the fish were protecting the coral by removing the algae.中文斐济近海渔业正在保护珊瑚礁免受全球变暖影响一项发表于《Science》的研究这样指出。英文Fisheries off the coast of Fiji are protecting coral reefs from the effects of global warming, according to a study in the journal Science.中文拥有外交豁免权的 Sacoolas 卷入一起交通事故。英国首相约翰逊在医院面对媒体提问时表示希望 Anne Sacoolas 能返回英国如果问题无法解决他将亲自向白宫提出此事。英文Sacoolas, who has immunity as a diplomat’s wife, was involved in a traffic collision ... Prime Minister Johnson was questioned about the case while speaking to the press at a hospital in Watford. He said, “I hope that Anne Sacoolas will come back ... if we can’t resolve it then of course I will be raising it myself personally with the White House.”中文鲍里斯·约翰逊表示他将就美国外交官 Anne Sacoolas 的外交豁免问题向白宫交涉。英文Boris Johnson has said he will raise the issue of US diplomat Anne Sacoolas’ diplomatic immunity with the White House.中文叙利亚国家媒体称政府军已开始进入此前由叙利亚民主力量控制的地区。此前美国总统特朗普与土耳其总统埃尔多安通话随后土耳其开始对叙利亚东北部发动空袭与地面攻势。英文According to Syrian state media, government forces began deploying into previously SDF controlled territory yesterday. ... On October 6, US President Donald Trump and Turkish President Recep Tayyip Erdoan spoke on the phone. Then both nations issued statements speaking of an imminent incursion into northeast Syria ... . On Wednesday, Turkey began a military offensive with airstrikes followed by a ground invasion.中文叙利亚政府军已进入美国支持的叙利亚民主力量SDF控制区以应对土耳其对该地区的军事进入。英文Syrian government forces have entered territory held by the US-backed Syrian Democratic Forces (SDF) in response to Turkey’s incursion into the region.中文这是首次有人在非正式竞赛条件下将全程马拉松 42.195 公里跑进两小时。虽然不被 IAAF 认定为正式世界纪录但基普乔格在奥地利维也纳跑出了 1 小时 59 分 40.2 秒。英文This is the first time anyone has been recorded to run a full marathon of 42.195 kilometers (approximately 26 miles) under this pursued landmark time. It was not, however, an officially sanctioned world record, as it was not an ”open race” of the IAAF. His time was 1 hour 59 minutes 40.2 seconds. Kipchoge ran in Vienna, Austria. It was an event specifically designed to help Kipchoge break the two hour barrier.中文肯尼亚选手埃鲁德·基普乔格完成了两小时内马拉松。英文Kenyan runner Eliud Kipchoge has run a marathon in less than two hours.中文PGE 表示由于高风和干燥条件带来的野火风险公司计划实施停电措施。预计将有接近 80 万用户受到影响停电至少持续到次日中午。英文PGE stated it scheduled the blackouts in response to forecasts for high winds amid dry conditions. The aim is to reduce the risk of wildfires. Nearly 800 thousand customers were scheduled to be affected by the shutoffs which were expected to last through at least midday tomorrow中文作为停电计划的一部分加利福尼亚数百万用户被切断供电。英文Power has been turned off to millions of customers in California as part of a power shutoff plan.7. 相关工作相关工作大体可分为三类。第一类是传统语言模型路线例如 GPT 仅建模左侧上下文ELMo 则把左右两个方向的表示拼接起来。第二类是掩码语言模型路线例如 BERT 通过恢复被遮盖词元来学习双向表示后续工作又通过跨度遮盖、更长训练和更大批量等方式继续强化这一范式。第三类是试图统一理解与生成的模型如 UniLM、MASS 和 XLNet。在这些模型中UniLM 通过固定注意力掩码使同一模型可同时用于判别和生成XLNet 通过置换自回归目标让预测同时依赖左右上下文而 MASS 则让模型从被遮盖的连续片段中恢复文本。论文认为MASS 是与 BART 最接近的方法但它让编码器和解码器分别看到不相交的词元集合因此在判别任务上不如 BART 灵活。相较之下BART 始终使用双向编码器处理带噪输入再由标准自回归解码器恢复原文这使它与真实生成场景更加一致。在机器翻译方面以往最显著的提升通常来自同时对源语言和目标语言进行预训练但这要求覆盖所有相关语言。BART 展示了一种更简单的替代路径只通过目标语言侧预训练也能显著增强翻译系统中的解码器。8. 结论本文提出了 BART一种把损坏文档映射回原始文档的预训练方法。实验表明BART 在判别任务上可达到与 RoBERTa 相似的性能同时在多个文本生成任务上取得新的最优结果。更重要的是论文通过统一框架下的比较说明与其说是哪一种“大而全”的预训练范式决定了表现不如说真正关键的是噪声函数是否能有效驱动模型学习恢复长距离结构和受约束生成。在本文实验中文本填充与句子打乱的组合给出了最稳定的整体效果。未来工作可以继续探索新的文档破坏方式并考虑让这些噪声设计更贴合具体下游任务。原始论文链接https://arxiv.org/pdf/1910.13461.pdf参考文献Agirre, E., Márquez, L., and Wicentowski, R. (eds.). Proceedings of the Fourth International Workshop on Semantic Evaluations (SemEval-2007). Association for Computational Linguistics, 2007.Dagan, I., Glickman, O., and Magnini, B. The PASCAL recognising textual entailment challenge. InMachine Learning Challenges, pp. 177-190, 2006.Devlin, J., Chang, M.-W., Lee, K., and Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. InNAACL-HLT, 2019.Dinan, E. et al. The second conversational intelligence challenge (ConvAI2). arXiv:1902.00098, 2019.Dolan, W. B. and Brockett, C. Automatically constructing a corpus of sentential paraphrases. InProceedings of the International Workshop on Paraphrasing, 2005.Dong, L. et al. Unified language model pre-training for natural language understanding and generation. arXiv:1905.03197, 2019.Edunov, S., Baevski, A., and Auli, M. Pre-trained language model representations for language generation. InNAACL-HLT, 2019.Fan, A., Grangier, D., and Auli, M. Controllable abstractive summarization. arXiv:1711.05217, 2017.Fan, A., Jernite, Y., Perez, E., Grangier, D., Weston, J., and Auli, M. ELI5: Long form question answering. arXiv:1907.09190, 2019.Hendrycks, D. and Gimpel, K. Gaussian error linear units (GELUs). arXiv:1606.08415, 2016.Hermann, K. M. et al. Teaching machines to read and comprehend. InAdvances in Neural Information Processing Systems, 2015.Joshi, M., Chen, D., Liu, Y., Weld, D. S., Zettlemoyer, L., and Levy, O. SpanBERT: Improving pre-training by representing and predicting spans. arXiv:1907.10529, 2019.Lample, G. and Conneau, A. Cross-lingual language model pretraining. arXiv:1901.07291, 2019.Lan, Z. et al. ALBERT: A lite BERT for self-supervised learning of language representations. arXiv:1909.11942, 2019.Levesque, H. J., Davis, E., and Morgenstern, L. The Winograd schema challenge. InAAAI Spring Symposium, 2011.Lewis, M. et al. BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension. arXiv:1910.13461, 2019.Liu, Y. and Lapata, M. Text summarization with pretrained encoders. arXiv:1908.08345, 2019.Liu, Y. et al. RoBERTa: A robustly optimized BERT pretraining approach. arXiv:1907.11692, 2019.Mikolov, T., Chen, K., Corrado, G., and Dean, J. Efficient estimation of word representations in vector space. arXiv:1301.3781, 2013.Narayan, S., Cohen, S. B., and Lapata, M. Don’t give me the details, just the summary! Topic-aware convolutional neural networks for extreme summarization. arXiv:1808.08745, 2018.Pereyra, G., Tucker, G., Chorowski, J., Kaiser, Ł., and Hinton, G. Regularizing neural networks by penalizing confident output distributions. arXiv:1701.06548, 2017.Peters, M. E. et al. Deep contextualized word representations. arXiv:1802.05365, 2018.Radford, A., Narasimhan, K., Salimans, T., and Sutskever, I. Improving language understanding by generative pre-training. OpenAI, 2018.Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., and Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog, 2019.Rajpurkar, P., Zhang, J., Lopyrev, K., and Liang, P. SQuAD: 100,000 questions for machine comprehension of text. arXiv:1606.05250, 2016.See, A., Liu, P. J., and Manning, C. D. Get to the point: Summarization with pointer-generator networks. arXiv:1704.04368, 2017.Sennrich, R., Haddow, B., and Birch, A. Edinburgh neural machine translation systems for WMT 16. InProceedings of the First Conference on Machine Translation: Volume 2, 2016.Socher, R. et al. Recursive deep models for semantic compositionality over a sentiment treebank. InEMNLP, 2013.Song, K., Tan, X., Qin, T., Lu, J., and Liu, T.-Y. MASS: Masked sequence to sequence pretraining for language generation. InICML, 2019.Vaswani, A. et al. Attention is all you need. InAdvances in Neural Information Processing Systems, 2017.Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., and Bowman, S. R. GLUE: A multi-task benchmark and analysis platform for natural language understanding. arXiv:1804.07461, 2018.Warstadt, A., Singh, A., and Bowman, S. R. Neural network acceptability judgments. arXiv:1805.12471, 2018.Williams, A., Nangia, N., and Bowman, S. R. A broad-coverage challenge corpus for sentence understanding through inference. arXiv:1704.05426, 2017.Yang, Z. et al. XLNet: Generalized autoregressive pretraining for language understanding. arXiv:1906.08237, 2019.