【大模型后训练SFT】Exploring the Impact of Instruction Data Scaling on Large Language Models

发布时间:2026/10/7 23:57:18
【大模型后训练SFT】Exploring the Impact of Instruction Data Scaling on Large Language Models Exploring the Impact of Instruction Data Scaling on Large Language Models An Empirical Study on Real-World Use Cases探索指令数据规模扩展对大型语言模型的影响一项关于真实世界用例的实证研究论文摘要ChatGPT的成功近来吸引了大量复现努力其中指令微调策略是实现显著成果的关键因素。指令微调不仅显著提升模型性能和泛化能力还使模型生成结果更符合人类语言模式。然而当前研究很少考察不同数量的指令数据对模型性能的影响尤其是在真实世界用例中。本文探讨基于指令微调的大语言模型在不同规模指令数据下的性能。实验中构建了一个由12个主要在线用例组成的评估数据集。以 Bloomz-7B1-mt 为基础模型结果表明1仅仅增加指令数据量就会使开放式生成等任务持续改进2在数学和代码等任务中随着数据规模增加模型性能曲线仍相当平缓。我们进一步分析这些现象的可能原因并提出潜在的未来研究方向例如有效选择高质量训练数据、扩展基础模型以及专用于困难任务的训练方法。我们将发布训练和评估数据集以及模型检查点1。代码1.引言指令微调 Wei et al. (2021)Sanh et al. (2021)Chung et al. (2022)Ouyang et al. (2022) 的目的是使模型能够理解并正确响应各种人类指令。关键在于通过拼接一段文本来引导模型理解任务要求。在输入文本之前将任务描述为指令。与微调模型以解决特定 NLP 任务不同指令微调旨在提升模型在未见任务上的泛化能力这是通过以生成的方式处理所有任务并使用多种类型的指令进行训练来实现的。近来使用人类反馈训练的模型 Ouyang 等 (2022)Bai 等 (2022)Ziegler 等 (2020)Stiennon 等 (2022)Ganguli 等Nakano 等 (2022)Korbak 等 (2023)尤其是 ChatGPT 和 GPT-4引起了人工智能领域研究者的广泛关注因为它们能够针对人类输入生成高质量回复甚至能根据后续对话自我纠正先前的错误。指令微调策略是 ChatGPT 取得显著成果的关键因素之一。为了复现 ChatGPT研究社区 Taori 等 (2023)Computer (2023) 主要致力于通过在多样且高质量的指令数据集上微调大语言模型来获得一个能力强的指令遵循模型。然而指令数据规模的影响尚未得到充分探索尤其是针对来自在线 ChatGPT 用户的典型用例进行评估时。Liang 等 (2022)Qin 等 (2023)Ye 等 (2023)Bang 等 (2023)Srivastava 等 (2022)Suzgun 等 (2022) 评估了现有的大语言模型但未关注训练策略的影响。同时大多数评估集中于传统 NLP 任务并使用英文数据集进行。为填补这些空白我们构建了一个多样且高质量的中文指令训练与评估数据集并进行了大量实验以分析模型在不同规模指令数据上的性能。最终我们获得了以下重要实验结果• 在头脑风暴和翻译等任务中200 万样本甚至更少的数据集就能使模型达到令人满意的性能。• 增加数据规模仍会带来开放问答和抽取等任务的性能提升这表明尚未达到瓶颈。但提升潜力可能有限。arXiv:2303.14742v1 [cs.CL] 26 Mar 2023• 模型在数学和代码方面的性能仍然较差增加数据规模不再带来性能提升。这表明了一些未来研究方向例如有效选择高质量训练数据、在参数和基础能力方面扩展基础模型以及针对数学和代码等任务的专门训练方法。总之我们针对训练数据规模对指令遵循模型性能的影响进行了实验并获得了若干初步结论为未来工作提供了方向。同时我们将开源我们的训练和评估数据以及模型的检查点。2 相关工作2.1 大语言模型基于 Transformer 的语言模型尤其是生成式大语言模型极大地推动了自然语言处理的发展 Vaswani 等 (2017)Devlin 等 (2018)Lan 等 (2019)Yang 等 (2019)Dong 等 (2019)Clark 等 (2020)Raffel 等 (2020)Brown 等 (2020)Zhang 等 (2022)Chowdhery 等 (2022)Black 等 (2022)Hoffmann 等 (2022)Glaese 等 (2022)Srivastava 等 (2022)。GPTGenerative Pre-trained Transformer系列模型是一个显著的例子其理解和遵循人类指令的能力已通过 ChatGPT 中的 RLHF Ouyang 等 (2022)Bai 等 (2022)Ziegler 等 (2020)Stiennon 等 (2022)Ganguli 等Nakano 等 (2022)Korbak 等 (2023) 得到增强。因此ChatGPT 已从基本的 NLP 任务求解器演变为一个完整的自然语言助手可以执行诸如生成对话和检测一段代码中的错误等职责。2.2 指令微调指令微调是 Wei 等 (2021)Sanh 等 (2021)Mishra 等 (2021) 中兴起的一种新趋势旨在通过教会语言模型遵循自然语言来提高其性能。通过将所有任务格式化为自然语言生成式语言模型能够处理几乎所有 NLP 任务。早期研究侧重于对通用 NLP 任务求解器进行指令微调并且存在一种趋势将越来越多的 NLP 数据集转换为统一数据集然后进行多任务训练 Xu 等 (2022)Xie 等 (2022)Wang 等 (2022a)Khashabi 等 (2020)Min 等 (2021)Ye 等 (2021)Liu 等 (2019)Zhong 等 (2021)Chung 等 (2022)。然而这些模型在理解一般人类指令方面仍然存在困难尤其是在真实世界使用场景中。直到 RLHF Ouyang 等 (2022)Bai 等 (2022)Ziegler 等 (2020)Stiennon 等 (2022) 等训练方法的出现模型才真正开始理解各种人类指令并产生良好的回应。最近研究界在复现 ChatGPT 方面付出了巨大努力 Taori 等 (2023)Computer (2023)。在他们的工作中数据量和任务类型差异很大而这些因素对模型性能的影响尚未得到充分探索。2.3 大语言模型的评估针对大语言模型存在许多评估例如在各种任务中的 OPT Zhang 等 (2022)、BLOOM Workshop 等 (2022)、GLM Zeng 等 (2023) 和 GPT-3 Brown 等 (2020)。Liang 等 (2022) 对 30 个大语言模型进行了全面评估。Qin 等 (2023) 评估了 ChatGPT 在各种 NLP 任务上的性能。Ye 等 (2023) 比较了 GPT 和 GPT-3.5 系列模型的能力。Bang 等 (2023) 比较了 ChatGPT 在多种语言和模态下的推理、减少幻觉和交互能力。然而这些评估主要关注现有模型的性能并未评估模型在不同规模指令数据下的性能。此外许多评估数据由传统 NLP 任务组成这与真实世界的人类使用场景不同。Srivastava 等 (2022) 提供了 204 个任务这些任务被认为超出了当前大语言模型的能力。Suzgun 等 (2022) 从 BIG-Bench 中选择了 23 个最难的任务形成了 BIG-Bench Hard (BBH)。我们提出的评估数据集更接近真实世界的人类使用场景并且专门面向中文社区。3 方法在本节中我们将介绍获取高质量指令微调数据的方法以及构建多样化测试指令的方法。与我们先前的工作 Ji et al. (2023) 相同同样需要 ChatGPT 来评估由指令遵循模型生成的回复。提示列于附录 6.1。3.1 生成训练数据人工标注高质量指令数据需要大量资源。鉴于强大的上下文学习能力方面大型语言模型可以基于高质量种子集 Wang 等2022b生成大量多样化的指令数据。本文采用与 Taori 等2023相同的方法。我们将 Taori 等2023提供的开源种子数据翻译成中文并修改一些大量涉及西方文化和背景知识的数据使其更符合中国文化和背景知识。然后我们将这些种子数据用作上下文示例要求 ChatGPT 生成更多样本。3.2 生成评估数据我们选择一部分由 ChatGPT 生成的数据用于评估。标注者被要求纠正 ChatGPT 的回复以获得测试指令的金标准回复。我们的测试指令被分为 12 种类型涵盖在线用户最常见的用例。表1 显示了这些测试指令的详细信息。此外我们计划继续扩展我们的评估数据集因为更多数据会带来更可靠的评估结果。4 实验4.1 指令遵循模型本文关注模型在中文文本上的性能。尽管 LLAMATouvron 等2023、OPTZhang 等2022和 GPT-JWang 和 Komatsuzaki2021尚未针对中文进行特别优化但我们选择 Bloomz-7b1-mtWorkshop 等2022Muennighoff 等2022作为我们的基座模型该模型具有 71 亿参数并在基于 Bloom-7b1 的 xP3mt 数据集上进一步微调。如表2所示我们训练使用 20 万、60 万、100 万和 200 万条指令示例训练 Bloomz-7b1-mt以分别获得 BELLE-7B-0.2M、BELLE-7B-0.6M、BELLE-7B-1M 和 BELLE-7B-2M。本文仅探究数据规模的影响并将模型规模的影响留待未来工作。我们以批大小为64 6464、2 22个 epoch、恒定学习率为3 e − 6 3e-63e−6、权重衰减为0.001 0.0010.001训练这些模型。对于每条指令我们的指令遵循模型需要生成一次回复。尽管模型针对同一指令生成的回复可能不同但我们认为这种波动对实验结果影响很小。4.2 指标如 6.1 节所述ChatGPT 被要求评估指令遵循模型生成的回复。对于所有指令ChatGPT 给出一个介于0 00和1 11之间的得分其中得分0 00最差得分1 11最好。对于每一类指令我们计算模型在测试样例上的平均得分。此外考虑到 ChatGPT 生成结果的波动性每个模型回复被评估三次并对得分取平均。值得注意的是我们不采用自一致性 Wang 等人 (2022b)因为我们测试集中的许多类型指令没有唯一的标准答案。评估是在 2023 年 3 月 25 日通过调用 gpt-3.5-turbo API 完成的。4.3 分析对于总体得分随着数据量的增加模型性能持续提升而这种持续提升并非在所有类型指令上都能预期。同时我们发现模型仅用 20 万条训练示例就已经取得了良好性能。数学、代码和 COT 对于数学、代码和 COT 指令模型在 20 万条训练示例时性能较差。在增加将训练样本增加到100万之后模型的性能有所提升然后进一步提升性能变得困难并且远未达到令人满意的水平。可能存在两个原因1这三类训练数据的质量较差因此随着数据量的增加错误的训练数据抑制了性能的提升。2模型规模不够大无法实现能力的涌现因此无法在这三类需要推理能力的指令上进一步改进。抽取、分类、封闭式问答和摘要对于抽取、分类、封闭式问答和摘要这些常见的NLP任务增加训练数据量可以持续带来性能提升。这表明我们在未来的训练计划中仍然可以通过简单增加训练样本来获得进一步的性能提升。然而重要的是要注意增加这类数据的比例是否会导致其他类型指令上的性能下降。开放式问答对于开放式问答模型的性能随着数据量的增加而持续提升。解决这一任务需要模型的参数化知识因此我们可以得出结论增加训练数据量能使模型更好地产生事实性答案并减少幻觉。翻译在翻译任务中Belle-7b-0.2m已经取得了良好的性能表明模型的翻译能力可能来自Bloomz-7b1-mt的多语言能力。重写在重写任务中模型需要纠正语法错误或改写原文使其更加流畅和简洁。这类任务相对简单模型仅用60万训练样本就表现良好因此我们未来可以专注于其他任务。生成在生成任务中例如就某一主题生成文章、写邮件将数据规模从20万增加到100万会导致性能显著提升之后性能趋于平稳。头脑风暴在头脑风暴任务中20万的数据集被证明是模型性能的最佳规模。这可能是因为这类指令的响应多种多样缺乏判断响应质量的明确标准导致ChatGPT在评分时倾向于给出更高的分数。这也表明大型语言模型擅长响应这类指令。总之对于翻译、重写、生成和头脑风暴任务200万甚至更少的数据量就能使模型表现良好。对于抽取、分类、封闭式问答和摘要任务模型的性能可以随着数据量的增加而持续提升表明我们仍然可以通过简单增加训练数据量来提高模型性能。但提升潜力可能有限。模型在数学、代码和COT指令上的表现仍然较差需要在数据质量、模型规模和训练策略方面进行进一步探索。5 结论与未来工作本文评估了不同数量的指令数据对模型性能的影响。我们发现数十万条训练样本可以在翻译、改写、生成和头脑风暴任务上取得良好结果。增加数据规模仍会在抽取、分类、封闭式问答和摘要等任务上带来性能提升表明尚未达到瓶颈。然而在数学、代码和 COT 等任务中模型性能较差增加数据规模也不再带来性能提升。上述发现为我们的未来工作指出了三个方向。首先我们将继续探索在抽取、分类、封闭式问答和摘要任务中增加数据量的极限。其次我们将提高训练数据质量以进一步增强模型性能尤其是在数学、代码和 COT 领域因为 ChatGPT 生成的训练数据质量较低。此外有效选择高质量数据也值得研究。最后我们将评估基座模型对性能的影响包括模型参数数量和预训练语言模型的基础能力。引用文献Jason Wei, Maarten Bosma, Vincent Y. Zhao, et al. Finetuned language models are zero-shot learners. arXiv:2109.01652 [cs], September 2021.Victor Sanh, Albert Webson, Colin Raffel, et al. Multitask prompted training enables zero-shot task generalization. arXiv:2110.08207 [cs], October 2021.Hyung Won Chung, Le Hou, Shayne Longpre, et al. Scaling instruction-finetuned language models, October 2022.Long Ouyang, Jeff Wu, Xu Jiang, et al. Training language models to follow instructions with human feedback, March 2022.Yuntao Bai, Saurav Kadavath, Sandipan Kundu, et al. Constitutional ai: Harmlessness from ai feedback, December 2022.Daniel M. Ziegler, Nisan Stiennon, Jeffrey Wu, et al. Finetuning language models from human preferences, January 2020.Nisan Stiennon, Long Ouyang, Jeff Wu, et al. Learning to summarize from human feedback, February 2022.Deep Ganguli, Liane Lovitt, Jackson Kernion, et al. Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.Reiichiro Nakano, Jacob Hilton, Suchir Balaji, et al. Webgpt: Browser-assisted question-answering with human feedback, June 2022.Tomasz Korbak, Kejian Shi, Angelica Chen, et al. Pretraining language models with human preferences, February 2023.Rohan Taori, Ishaan Gulrajani, Tianyi Zhang, Yann Dubois, Xuechen Li, Carlos Guestrin, Percy Liang, and Tatsunori B. Hashimoto. Stanford alpaca: An instructionfollowing llama model. https://github.com/tatsu-lab/stanford_alpaca, 2023.Together Computer. OpenChatKit: An Open Toolkit and Base Model for Dialogue-style Applications, 3 2023. URL https://github.com/togethercomputer/OpenChatKit.Percy Liang, Rishi Bommasani, Tony Lee, et al. Holistic evaluation of language models, November 2022.Chengwei Qin, Aston Zhang, Zhuosheng Zhang, et al. Is chatgpt a general-purpose natural language processing task solver?, February 2023.Junjie Ye, Xuanting Chen, Nuo Xu, Can Zu, Zekai Shao, Shichun Liu, Yuhan Cui, Zeyang Zhou, Chao Gong, Yang Shen, et al. A comprehensive capability analysis of gpt-3 and gpt-3.5 series models. arXiv preprint arXiv:2303.10420, 2023.Yejin Bang, Samuel Cahyawijaya, Nayeon Lee, Wenliang Dai, Dan Su, Bryan Wilie, Holy Lovenia, Ziwei Ji, Tiezheng Yu, Willy Chung, et al. A multitask, multilingual, multimodal evaluation of chatgpt on reasoning, hallucination, and interactivity. arXiv preprint arXiv:2302.04023, 2023.Aarohi Srivastava, Abhinav Rastogi, Abhishek Rao, Abu Awal Md Shoeb, Abubakar Abid, Adam Fisch, Adam R Brown, Adam Santoro, Aditya Gupta, Adrià GarrigaAlonso, et al. Beyond the imitation game: Quantifying and extrapolating the capabilities of language models. arXiv preprint arXiv:2206.04615, 2022.Mirac Suzgun, Nathan Scales, Nathanael Schärli, Sebastian Gehrmann, Yi Tay, Hyung Won Chung, Aakanksha Chowdhery, Quoc V Le, Ed H Chi, Denny Zhou, et al. Challenging big-bench tasks and whether chain-of-thought can solve them. arXiv preprint arXiv:2210.09261, 2022.Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin. Attention is all you need. Advances in neural information processing systems, 30, 2017.Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805, 2018.Zhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel, Piyush Sharma, and Radu Soricut. Albert: A lite bert for self-supervised learning of language representations. arXiv preprint arXiv:1909.11942, 2019.Zhilin Yang, Zihang Dai, Yiming Yang, Jaime Carbonell, Russ R Salakhutdinov, and Quoc V Le. Xlnet: Generalized autoregressive pretraining for language understanding. Advances in neural information processing systems, 32, 2019.Li Dong, Nan Yang, Wenhui Wang, Furu Wei, Xiaodong Liu, Yu Wang, Jianfeng Gao, Ming Zhou, and HsiaoWuen Hon. Unified language model pre-training for natural language understanding and generation. Advances in neural information processing systems, 32, 2019.Kevin Clark, Minh-Thang Luong, Quoc V Le, and Christopher D Manning. Electra: Pre-training text encoders as discriminators rather than generators. arXiv preprint arXiv:2003.10555, 2020.Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J Liu. Exploring the limits of transfer learning with a unified text-to-text transformer. The Journal of Machine Learning Research, 21(1):5485–5551, 2020.Tom B. Brown, Benjamin Mann, Nick Ryder, et al. Language models are few-shot learners, July 2020.Susan Zhang, Stephen Roller, Naman Goyal, et al. Opt: Open pre-trained transformer language models, June 2022.Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, et al. Palm: Scaling language modeling with pathways, October 2022.Sid Black, Stella Biderman, Eric Hallahan, et al. Gpt-neox20b: An open-source autoregressive language model, April 2022.Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, et al. Training compute-optimal large language models, March 2022.Amelia Glaese, Nat McAleese, Maja Trębacz, John Aslanides, Vlad Firoiu, Timo Ewalds, Maribeth Rauh, Laura Weidinger, Martin Chadwick, Phoebe Thacker, et al. Improving alignment of dialogue agents via targeted human judgements. arXiv preprint arXiv:2209.14375, 2022.Swaroop Mishra, Daniel Khashabi, Chitta Baral, and Hannaneh Hajishirzi. Cross-task generalization via natural language crowdsourcing instructions. arXiv preprint arXiv:2104.08773, 2021.Hanwei Xu, Yujun Chen, Yulun Du, Nan Shao, Yanggang Wang, Haiyu Li, and Zhilin Yang. Zeroprompt: Scaling prompt-based pretraining to 1,000 tasks improves zeroshot generalization. arXiv preprint arXiv:2201.06910, 2022.Tianbao Xie, Chen Henry Wu, Peng Shi, Ruiqi Zhong, Torsten Scholak, Michihiro Yasunaga, Chien-Sheng Wu, Ming Zhong, Pengcheng Yin, Sida I Wang, et al. Unifiedskg: Unifying and multi-tasking structured knowledge grounding with text-to-text language models. arXiv preprint arXiv:2201.05966, 2022.Yizhong Wang, Swaroop Mishra, Pegah Alipoormolabashi, Yeganeh Kordi, Amirreza Mirzaei, Atharva Naik, Arjun Ashok, Arut Selvan Dhanasekaran, Anjana Arunkumar, David Stap, et al. Super-naturalinstructions: Generalization via declarative instructions on 1600 nlp tasks. In Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, pages 5085–5109, 2022a.Daniel Khashabi, Sewon Min, Tushar Khot, Ashish Sabharwal, Oyvind Tafjord, Peter Clark, and Hannaneh Hajishirzi. Unifiedqa: Crossing format boundaries with a single qa system. arXiv preprint arXiv:2005.00700, 2020.Sewon Min, Mike Lewis, Luke Zettlemoyer, and Hannaneh Hajishirzi. Metaicl: Learning to learn in context. arXiv preprint arXiv:2110.15943, 2021.Qinyuan Ye, Bill Yuchen Lin, and Xiang Ren. Crossfit: A few-shot learning challenge for cross-task generalization in nlp. arXiv preprint arXiv:2104.08835, 2021.Xiaodong Liu, Pengcheng He, Weizhu Chen, and Jianfeng Gao. Multi-task deep neural networks for natural language understanding. arXiv preprint arXiv:1901.11504, 2019.Ruiqi Zhong, Kristy Lee, Zheng Zhang, and Dan Klein. Adapting language models for zero-shot learning by meta-tuning on dataset and prompt collections. arXiv preprint arXiv:2104.04670, 2021.BigScience Workshop, Teven Le Scao, Angela Fan, et al. Bloom: A 176b-parameter open-access multilingual language model, December 2022.Aohan Zeng, Xiao Liu, Zhengxiao Du, Zihan Wang, Hanyu Lai, Ming Ding, Zhuoyi Yang, Yifan Xu, Wendi Zheng, Xiao Xia, Weng Lam Tam, Zixuan Ma, Yufei Xue, Jidong Zhai, Wenguang Chen, Zhiyuan Liu, Peng Zhang, Yuxiao Dong, and Jie Tang. GLM-130b: An open bilingual pre-trained model. In The Eleventh International Conference on Learning Representations (ICLR), 2023. URL https://openreview.net/forum?id-Aw0rrrPUF.Yunjie Ji, Yan Gong, Yiping Peng, Chao Ni, Peiyan Sun, Dongyu Pan, Baochang Ma, and Xiangang Li. Exploring chatgpt’s ability to rank content: A preliminary study on consistency with human preferences. arXiv preprint arXiv:2303.07610, 2023.Yizhong Wang, Yeganeh Kordi, Swaroop Mishra, Alisa Liu, Noah A Smith, Daniel Khashabi, and Hannaneh Hajishirzi. Self-instruct: Aligning language model with self generated instructions. arXiv preprint arXiv:2212.10560, 2022b.Hugo Touvron, Thibaut Lavril, Gautier Izacard, et al. Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971, 2023.Ben Wang and Aran Komatsuzaki. GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model. https://github.com/kingoflolz/mesh-transformer-jax, May 2021.Niklas Muennighoff, Thomas Wang, Lintang Sutawika, et al. Crosslingual generalization through multitask finetuning, November 2022.