LLaMA-Factory数据集处理指南:从JSON到高效微调数据

发布时间:2026/7/31 21:50:40
LLaMA-Factory数据集处理指南:从JSON到高效微调数据 LLaMA-Factory数据集处理指南从JSON到高效微调数据【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory在大语言模型LLM微调过程中高质量的数据集是模型性能的关键决定因素。LLaMA-Factory作为一款功能全面的微调框架提供了灵活的数据处理流程支持从原始JSON文件到模型输入的全链路转换。本文将详细介绍如何使用LLaMA-Factory进行数据集准备包括数据格式规范、配置文件设置、数据解析与格式化的完整流程并提供实际案例和工具使用指南。数据集格式概览LLaMA-Factory支持两种主流数据格式Alpaca格式和ShareGPT格式分别适用于单轮指令微调与多轮对话场景。这两种格式通过src/llamafactory/data/parser.py中的DatasetAttr类进行统一管理确保不同来源的数据能够被标准化处理。Alpaca格式单轮指令Alpaca格式采用instruction-input-output三元组结构适合构建简单的问答数据。典型示例可见data/alpaca_zh_demo.json{ instruction: 识别并解释给定列表中的两个科学理论细胞理论和日心说。, input: , output: 细胞理论是生物科学的一个理论它认为所有生命体都是由微小的基本单元——细胞所构成... }该格式通过prompt指令、query输入、response输出三个核心字段定义样本对应src/llamafactory/data/parser.py中的配置参数。当input字段为空时表示该样本为纯指令类型。ShareGPT格式多轮对话ShareGPT格式采用会话列表结构支持多轮交互场景如data/mllm_demo.json所示{ messages: [ {role: user, content: 描述这张图片的内容, images: [mllm_demo_data/1.jpg]}, {role: assistant, content: 图片中展示了一只正在玩耍的猫...} ] }这种格式通过messages字段存储对话历史每个消息对象包含role角色和content内容并支持images/videos/audios等多模态字段。data/dataset_info.json中定义了MLLM多模态大模型数据的解析规则包括formatting: sharegpt和columns: {messages: messages, images: images}等配置。数据配置文件详解data/dataset_info.json是数据集处理的核心配置文件定义了不同数据集的元信息和解析规则。该文件采用JSON格式每个键对应一个数据集名称值包含加载方式、格式类型、字段映射等关键参数。配置结构解析以DPO直接偏好优化数据集配置为例dpo_zh_demo: { file_name: dpo_zh_demo.json, ranking: true, formatting: sharegpt, columns: { messages: conversations, chosen: chosen, rejected: rejected } }file_name: 指定数据文件路径相对于data/目录ranking: 标记是否为排序类数据如DPO/KTO任务formatting: 指定数据格式alpaca或sharegptcolumns: 字段映射关系将原始数据字段映射到框架标准字段完整的配置参数说明可参考src/llamafactory/data/parser.py中的DatasetAttr类定义包括基础配置加载方式、数据集名称、格式配置字段映射、标签定义和高级配置子集选择、样本数量限制等。自定义数据集配置添加新数据集时需在data/dataset_info.json中添加相应配置。例如为自定义的医疗问答数据集添加配置medical_qa_zh: { file_name: medical_qa_zh.json, formatting: alpaca, columns: { prompt: question, response: answer } }其中columns字段将原始数据的question字段映射为框架的prompt字段answer字段映射为response字段。这种灵活的映射机制使LLaMA-Factory能够兼容各种结构的原始数据。数据解析与处理流程LLaMA-Factory的数据处理流程通过src/llamafactory/data/parser.py和src/llamafactory/data/formatter.py实现包含数据加载、字段解析、格式转换三个核心步骤。数据加载Loader数据加载模块根据load_from参数src/llamafactory/data/parser.py#L31支持多种来源file: 本地JSON/JSONL文件如data/alpaca_zh_demo.jsonhf_hub/ms_hub/om_hub: 模型仓库数据集如llamafactory/alpaca_zhscript: 自定义脚本生成数据如data/belle_multiturn/belle_multiturn.py加载逻辑在src/llamafactory/data/parser.py#L93-L147的get_dataset_list函数中实现根据配置自动选择合适的加载方式。数据解析Parser解析模块将原始数据转换为统一的内部表示。以Alpaca格式解析为例核心逻辑如下读取JSON文件并遍历样本根据data/dataset_info.json中的字段映射提取prompt/query/response应用模板格式化如添加指令前缀返回标准化样本列表解析过程中会处理特殊情况如空input字段的处理直接忽略、多轮对话的拼接等。src/llamafactory/data/parser.py中的DatasetAttr类提供了完整的字段映射机制通过join方法整合配置中的columns和tags信息。数据格式化Formatter格式化模块将解析后的标准化数据转换为模型输入格式关键实现位于src/llamafactory/data/formatter.py。框架提供多种格式化器StringFormatter: 处理带占位符的模板字符串FunctionFormatter: 格式化工具调用数据ToolFormatter: 处理工具定义数据例如Alpaca格式的默认模板为{prompt}\n{query}\n\n{response}当query为空时自动简化为{prompt}\n\n{response}。这种动态调整确保了不同类型样本的正确格式化。实操案例处理自定义JSON数据以下通过一个完整案例演示如何将自定义JSON数据集成到LLaMA-Factory的微调流程中。假设我们有一个电商产品问答数据集product_qa.json结构如下[ { question: 这款手机支持5G网络吗, answer: 是的本机型支持全网通5G网络... }, // 更多样本... ]步骤1放置数据文件将product_qa.json复制到data/目录下确保文件编码为UTF-8。步骤2配置dataset_info.json在data/dataset_info.json中添加配置product_qa: { file_name: product_qa.json, formatting: alpaca, columns: { prompt: question, response: answer, query: // 显式指定query字段为空 } }步骤3验证数据加载使用以下命令验证数据加载是否正常python src/train.py \ --model_name_or_path your_model \ --dataset product_qa \ --do_train \ --output_dir ./output \ --overwrite_output_dir若配置正确程序将输出数据加载日志显示样本数量和格式统计信息。常见问题排查字段映射错误检查data/dataset_info.json中的columns配置是否与JSON文件中的字段名匹配格式类型错误单轮数据使用formatting: alpaca多轮数据使用formatting: sharegpt文件路径问题确保file_name路径正确相对于data/目录高级功能多模态与偏好数据处理LLaMA-Factory支持复杂数据类型处理包括多模态数据和偏好优化数据满足高级微调需求。多模态数据处理多模态数据如图文问答通过ShareGPT格式扩展实现需在样本中包含媒体文件路径。例如data/mllm_demo.json中的配置{ messages: [ { role: user, content: 描述这张图片的内容, images: [mllm_demo_data/1.jpg] }, { role: assistant, content: 图片中展示了一只正在玩耍的猫... } ] }媒体文件需放置在data/mllm_demo_data/目录下支持JPG/PNG等常见格式。data/dataset_info.json中的mllm_demo配置定义了媒体字段的解析规则。偏好优化数据DPO/KTO偏好数据如DPO的chosen/rejected样本对需在data/dataset_info.json中设置ranking: true。以data/dpo_zh_demo.json为例{ conversations: [{role: user, content: 推荐一部科幻电影}], chosen: {role: assistant, content: 推荐《星际穿越》...}, rejected: {role: assistant, content: 不知道} }该配置通过src/llamafactory/data/parser.py中的chosen和rejected字段定义正负样本用于训练模型的偏好排序能力。数据集质量控制建议高质量的数据是微调效果的基础建议从以下方面进行数据质量控制去重处理使用脚本去除重复样本避免模型过拟合长度过滤过滤过短10 tokens或过长2048 tokens的样本人工审核随机抽查样本确保回答准确性和指令相关性格式统一使用src/llamafactory/data/utils.py中的工具函数标准化标点和空格LLaMA-Factory提供了基础的数据清洗工具可通过num_samples参数src/llamafactory/data/parser.py#L39限制样本数量快速验证数据处理流程。总结与最佳实践LLaMA-Factory通过灵活的配置系统和标准化的数据处理流程降低了LLM微调的数据准备门槛。关键要点总结格式选择单轮指令用Alpaca格式多轮对话用ShareGPT格式配置核心通过data/dataset_info.json定义数据解析规则工具支持利用src/llamafactory/data/parser.py和src/llamafactory/data/formatter.py进行高级定制质量第一重视数据清洗和验证避免引入噪声样本建议在开始大规模微调前先用少量样本测试数据处理流程确认输出格式符合预期。通过合理利用LLaMA-Factory的数据处理能力可以显著提升微调效率和模型性能。完整的数据处理流水线实现可参考src/llamafactory/data/目录下的源代码其中src/llamafactory/data/loader.py和src/llamafactory/data/processor/包含了数据加载和预处理的完整实现。【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考