从SFT到RLHF:聚宝盆(Cornucopia)技术路线图全解读——multi-task SFT、next-pretrain与13B展望

发布时间:2026/8/23 17:57:24
从SFT到RLHF:聚宝盆(Cornucopia)技术路线图全解读——multi-task SFT、next-pretrain与13B展望 从SFT到RLHF聚宝盆(Cornucopia)技术路线图全解读——multi-task SFT、next-pretrain与13B展望【免费下载链接】Cornucopia-LLaMA-Fin-Chinese聚宝盆(Cornucopia): 中文金融系列开源可商用大模型并提供一套高效轻量化的垂直领域LLM训练框架(Pretraining、SFT、RLHF、Quantize等)项目地址: https://gitcode.com/gh_mirrors/co/Cornucopia-LLaMA-Fin-Chinese聚宝盆Cornucopia-LLaMA-Fin-Chinese是一个中文金融领域 LLaMA 微调模型项目开源了中文金融指令数据集、LoRAint8 轻量化训练框架涵盖 Pretraining、SFT、RLHF、Quantize 等链路以及两个 7B 金融问答模型。本文将完整解读它从 SFT 出发经过 multi-task SFT、next-pretrain、RLHF 直至 13B 的金融大模型技术路线图带你快速看懂一条垂直领域 LLM 的落地路径。1️⃣ 项目全景聚宝盆(Cornucopia)是什么聚宝盆的核心思路并不复杂用中文金融数据“教”LLaMA 学会金融问答。项目以 LLaMA 系基模型为底座通过「中文金融公开问答数据 爬取的金融问答数据」构建指令数据集再对模型做指令精调Instruct-tuning / SFT显著提升模型在保险、理财、股票、基金、贷款、信用卡、社保等场景下的中文金融问答效果。目前已开源的核心资产资产说明LoRA 微调模型Fin-Alpaca-LoRA-7B-Meta基于 llama-7b-hf12M 指令数据、Fin-Alpaca-LoRA-7B-Linly基于 Chinese-LLaMA-7B14M 指令数据指令数据集instruction_data/fin_data.json覆盖商业汇票、可转债、T1 交易规则等真实金融问答训练框架tuning_train.pyLoRA int8 训练支持多卡 DDP推理框架infer.pyutils/prompter.py提示词模板机制templates/内置 alpaca / fin_template 等模板整个项目从数据处理到推理部署的完整流水线如下图所示左侧是金融数据经 GPT-4 加工后构建指令集中间是 LLaMA 基座上的 LoRAA×B 矩阵微调右侧是推理后处理与面向摘要生成、报告生成、事实抽取等任务的 Prompt Designer 应用层2️⃣ 训练流水线金融大模型是如何“练”出来的数据侧指令数据 GPT-4 数据增强指令数据采用标准的 instruction / input / output 三元组格式样例可直接查看 指令数据文件例如「可转债风险大吗和股票比风险大还是小」「股票和基金能当天随买随卖吗」等真实业务问答。针对早期数据不准确、类型单一的问题项目引入 GPT3.5/4.0 接口做两件事清洗与重构用大模型优化已有问答修正错误表述多 Prompt 形式 multi-task 扩展设置多种任务形式实现金融领域多业务场景覆盖详见下文路线图。训练侧LoRA int8 的轻量微调方案训练入口是 tuning_train.py关键设计让消费级显卡也能跑int8 量化加载以 8 位精度加载基座模型显存最多节省 4 倍LoRA 低秩适配默认lora_r8、lora_alpha16只训练q_proj、v_proj投影层可训练参数仅占全量的一小部分梯度累积batch_size64由micro_batch_size累积实现长序列截断至 512 token。显存参考官方单卡 A100-SXM-80GB 实测配置显存占用batch_size 64约 40 GBbatch_size 96约 65 GB官方预计3090 / 409024GB 显存及以上显卡即可较好支持按显存大小调整 batch_size 即可。推理侧一键推理与多模型横评单模型推理bash scripts/infer.sh加载 LoRA 权重 fin_template模板逐条回答instruction_data/infer.json中的测试用例多模型对比bash scripts/comparison_test.sh自动对比原始 LLaMA、Fin-Alpaca-LoRA-7B-Meta 与 Linly 三个版本的输出。3️⃣ 技术路线图全解读SFT 之后的四步演进在 README 的 TODO List 中聚宝盆规划了一条清晰的演进路线阶段目标解决的问题① multi-task SFT中文金融多业务场景指令微调数据类型单一场景覆盖不足② next-pretrain中文金融领域继续预训练基座模型缺少中文金融知识③ RLHF强化学习→Chat化对齐人类偏好对话化输出输出不够流畅、难以交互式使用④ 支持 13B 模型更大的基座提升能力上限7B 参数容量有限3.1 multi-task SFT从“会答一道题”到“会干一类活”这是路线图的第一步也是数据工程的核心升级。项目将利用 GPT3.5/4.0 API 构建更高质量的指令数据集并设置多种 Prompt 形式以 multi-task 方式拓展丰富指令集实现金融领域多业务场景覆盖同时计划在中文知识图谱-金融与CFLEB 金融数据集上进一步扩充高质量指令数据。对新手而言这意味着未来的模型不仅能回答 FAQ还能应对摘要、抽取、报告生成等更贴近业务的任务类型。3.2 next-pretrain用继续预训练补上“领域知识”SFT 教模型“怎么答”next-pretrain继续预训练教模型“懂什么”。聚宝盆计划基于已有数据和持续爬取的中文金融语料做领域继续预训练让基座模型在参数层面沉淀中文金融知识从源头降低幻觉与知识盲区。3.3 RLHF从“能用”到“好用”TODO 中的「强化学习 → Chat化」指向 RLHF 阶段通过人类偏好反馈对模型做强化学习对齐让输出更符合中文金融对话习惯——更口语、更可控、更适合多轮交互最终走向类 Chat 的体验。3.4 13B 展望更大的能力上限路线图的终点是支持 13B 模型。在 LoRAint8 这套轻量框架下从 7B 迁移到 13B 的边际成本并不高而更大的参数规模通常意味着更强的推理与知识容量是垂直领域金融 LLM 能力跃升的关键一步。4️⃣ 快速上手三步跑起 Cornucopia克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/co/Cornucopia-LLaMA-Fin-Chinese cd Cornucopia-LLaMA-Fin-Chinese pip install -r requirements.txt下载 7B 基座模型建议 3090/4090 以上显卡git lfs install bash ./base_models/load.sh按需微调或推理bash ./scripts/finetune.sh # LoRA 微调需准备自有金融指令数据 bash ./scripts/infer.sh # 单模型推理 bash ./scripts/comparison_test.sh # 多模型对比想用自有数据微调时只需按instruction_data/fin_data.json的格式准备数据修改 finetune.sh 中的--data_path与--base_model参数即可。5️⃣ 效果参考与使用说明官方提供了与原始 LLaMA、文心一言、讯飞星火的输出对比面对「老年人理财好还是存定期好」「股票和基金能当天随买随卖吗」等测试问题两个 Fin-Alpaca 模型都给出了包含T1 交易规则、风险等级R2/R3、涨跌停限制等中文金融细节的回答相比原始 LLaMA 直接输出英文领域适配性提升明显。⚠️免责声明本项目资源仅供学术研究之用。模型输出受随机性与量化精度影响不构成任何投资建议请谨慎对待模型生成内容。小结聚宝盆(Cornucopia)用 LoRAint8 的轻量框架证明了一条低成本的中文金融 LLM 路线——SFT 打好底子 → multi-task SFT 拓宽场景 → next-pretrain 补知识 → RLHF 做对齐 → 13B 拉上限。对想进入垂直领域大模型的新手来说它的数据构建方式、训练脚本与路线图都是一份难得的“活教材”。【免费下载链接】Cornucopia-LLaMA-Fin-Chinese聚宝盆(Cornucopia): 中文金融系列开源可商用大模型并提供一套高效轻量化的垂直领域LLM训练框架(Pretraining、SFT、RLHF、Quantize等)项目地址: https://gitcode.com/gh_mirrors/co/Cornucopia-LLaMA-Fin-Chinese创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考