5 步训练你的第一个 LoRA:kohya_ss 图形化 AI 绘画模型微调完整指南

发布时间:2026/9/14 13:40:51
5 步训练你的第一个 LoRA:kohya_ss 图形化 AI 绘画模型微调完整指南 5 步训练你的第一个 LoRAkohya_ss 图形化 AI 绘画模型微调完整指南【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_sskohya_ss 是一个 Stable Diffusion 图形化训练工具把专业的模型微调脚本包成了可视化界面——你勾选参数、填好路径就能训练自己的 LoRA 风格模型或 DreamBooth 角色模型。它专为不写代码的新手和普通用户设计从环境搭建到出图全程有界面兜底。场景手头有 20 张照片想让 AI 学会画你假设你拍了 20 张同一只猫、同一个人或同一种插画风格的图想让 AI 稳定地画出来。传统做法是敲一堆命令行参数学习率、网络维度、优化器类型、分桶策略……任何一个拼错都会报错报错信息还常常看不懂。装环境这一步就劝退了一半人Python 版本、CUDA、依赖冲突光看报错日志就能耗掉一下午。kohya_ss 把这些事全部搬进了图形界面参数变成下拉框和输入框训练命令由它自动生成你只负责做选择。它到底是什么一个包住专业脚本的图形化训练 GUI一句话定位kohya_ss 是基于 Gradio 的 Stable Diffusion 训练界面底层集成 Kohya 的训练脚本sd-scripts你操作的每个按钮最后都会变成一条正确的训练命令。它支持的模型架构覆盖主流选项Stable Diffusion 1.5/2.x、SDXL、SD3、Flux.1、Lumina Image 2.0、Anima、HunyuanImage-2.1。训练方法上LoRA、LoHa、LoKr、DreamBooth、全量微调Finetune、文本反转Textual Inversion、LECO 概念擦除都有对应界面。![使用 kohya_ss 训练的 AI 绘画示例图](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki.jpg?utm_sourcegitcode_repo_files)训练方式速查先选对方法再动手五种常见训练方式各有取舍选错方法比调错参数更浪费时间训练方式产物体量上手难度适用场景显存参考LoRA / LoCon几 MB~几十 MB低角色、风格、概念微调6GBSDXL 建议 12GBDreamBooth几个 GB完整模型中个性化主体直接改基础模型8GB文本反转几十 KB低造一个自定义提示词4GB全量微调几个 GB高大数据集的整体风格重塑16GBLECO 概念擦除中等中删除或编辑模型里某个概念6GB绝大多数新手的第一条路是 LoRA产物小、出结果快、失败成本几乎为零。![LoRA 风格训练数据示例kohya_ss 内置测试图片](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki_4.jpg?utm_sourcegitcode_repo_files)图形化界面带来的便利不只是好看自动生成训练命令你填的每个参数都会被拼成可直接执行的命令界面里可预览。训练中实时出样图按固定间隔生成样本图不盲等。预设一键加载presets/目录里有大量调好的参数组合新手直接套用。默认路径记忆用根目录的 config example.toml 改名为config.toml后模型、数据集、输出目录都不用每次手填。TensorBoard 监控界面内集成损失曲线查看。从 0 到跑通装环境→起界面→备数据→配参数→看结果下面是最小可用路径目标是先让第一次训练成功出图而不是一次性调到完美。装环境一条命令克隆一个脚本装依赖Windows 用户安装 Python 3.11.9、CUDA 12.8 和 Git 后克隆仓库git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss克隆后运行仓库自带的setup.batLinux/macOS 用setup.sh它会处理依赖安装。分平台的详细步骤见 docs/Installation/里面有 uv 和 pip 两种装法新手不确定就选 uv。一键启动训练界面环境装好后Windows 双击gui.batLinux/macOS 执行./gui.sh。浏览器会自动打开 Gradio 界面左侧是功能标签页LoRA、DreamBooth、Finetune、Textual Inversion、LECO、各类标注工具各占一栏。备好训练数据标准目录格式把图像按一个子文件夹 一个训练对象摆放每张图配一个同名 txt 描述文件dataset/ ├── 训练目标/ │ ├── 0001.jpg │ ├── 0001.txt # 图像描述如 biomechanical skull, brass gears, dark background │ ├── 0002.jpg │ └── 0002.txt └── 正则化图像/ # 可选防止模型跑偏要点准备 20~50 张高质量图描述要准确具体描述画面里有什么不是我觉得像什么分辨率 512×512 到 1024×1024 之间即可。描述文件可以手写也可以直接用界面里的 WD14 / BLIP / GIT 等自动标注工具批量生成再人工修正。格式规范和分桶细节见 docs/image_folder_structure.md。配置参数最小可用路径第一次训练不用研究所有选项只动这几处源模型选一个本地 SD 1.5 模型新手第一枪建议 SD 1.5显存门槛最低。数据集填上一步的目录分辨率 512批大小 1~2。网络网络类型 LoRA维度dim32、alpha 16 是稳妥起点。优化器与学习率AdamW8bit 恒定学习率 1e-4先跑通再谈调优。保存每 500 步存一次格式 safetensors。点开始训练kohya_ss 会生成命令并启动。看结果样图比日志更诚实训练过程中界面会按设定间隔生成样图——同一个提示词随着步数增加风格是否越来越像你的目标一眼就能判断。损失曲线在 TensorBoard 面板里可查但样图才是第一判断依据。训练结束产物是一个几 MB 的 .safetensors 文件放进 ComfyUI 或 WebUI 的 LoRA 目录即可使用。进阶调优让训练效果更稳的 4 个手段跑通之后再逐个引入这些手段每个都对应一类具体问题。学习率调度给不同阶段选不同油门Constant恒定何时用——小数据集、求稳。好处是行为可预期翻车率低。Constant with Warmup带预热何时用——SDXL LoRA 等敏感场景。好处是开头几十步用小学习率过渡避免前期震荡。Cosine余弦退火何时用——中后期需要收敛打磨。好处是学习率平滑下降细节更干净。Cosine with Restarts带重启何时用——训练卡在平台期。好处是周期性重新加速有助于跳出局部最优。经验法则一次只改一个变量对比样图再决定去留。掩码控制只让 AI 学你想让它学的区域masked loss掩码损失让你指定只计算某些像素的损失为每张训练图配一张同尺寸 RGB 掩码图白色区域R255是要重点学的部分黑色区域被忽略中间灰度则是部分权重。好处很直接训练人脸时屏蔽背景杂乱、学服装风格时不学姿势、局部重绘模型训练时精确控制区域。掩码数据的组织方式参考 docs/train_lllite_README.md。注意该功能仍在完善中遇到异常属正常可提 Issue 反馈。预设复用站在调好的肩膀上presets/lora/、presets/finetune/、presets/dreambooth/ 三个目录收录了大量社区调好的参数组合例如 SDXL - 1 image LoRA v1.0单图 LoRA 场景、adafactor不同优化器配置等。做法在界面里选择对应预设再按自己数据集微调一两个参数。好处是把别人踩坑后的经验直接变成你的起点presets/lora/prepare_presets.md 解释了每个字段含义。多阶段训练先用低学习率打底再精修复杂任务可以拆两段第一阶段用较高学习率让模型快速学会主体特征第二阶段降低学习率专攻细节避免早期就定型。examples/LoRA%20based%20finetuning%202%20phase.ps1 是现成的两阶段脚本范例presets/lora/ 里也有 finetuning phase 1 / phase 2 配套预设可直接套用。高频疑问速答显存 6GB 能训吗能。SD 1.5 的 LoRA 训练 6GB 基本够用SDXL 的 LoRA 建议 12GB 起。显存不够时批大小调到 1、开 8bit 量化加载、训练分辨率降一档。多久能看到效果LoRA 一般 30 分钟到 2 小时出初步效果DreamBooth 约 2~8 小时取决于数据量和硬件。判断标准看样图不看还要跑多少步。怎么避免过拟合三个立即可做的动作① 加入正则化图像② 开启数据增强随机翻转③ 每几百步存一个检查点挑像但没死记的那一版而不是一定要用最终版。训练直接报错怎么办按这个顺序自查数据目录和文件格式对不对、显存是否撑爆看日志最后的 OOM 提示、学习率是否高得离谱、模型路径是否真实存在。V100 老卡还有专门的 GPU 利用率问题见 docs/troubleshooting_tesla_v100.md。怎么知道训练值不值得继续盯样图。如果连续几个采样点样图都在变好就让它跑完如果样图开始扭曲、色彩崩坏立刻停下换参数别硬等。资源地图按需求取用文档docs/Installation/ 分平台安装说明docs/LoRA/top_level.md 与 docs/LoRA/options.md 是 LoRA 训练的系统手册docs/train_README.md 覆盖数据准备与通用选项根目录 config example.toml 是所有可配置路径的完整模板。工具集tools/ 下有自动标注caption.py、图像分组group_images.py、格式转换convert_images_to_hq_jpg.py、LoRA 分析analyse_loha.py、LoRA 尺寸调整resize_lora.py等训练前后的杂活基本都在这。测试数据集test/ 里是一套完整的图 描述样例格式不确定时直接对照抄结构test/masked_loss/ 是掩码训练的配套示例。示例脚本examples/ 提供两阶段训练、批量标注、词频统计等现成 .ps1 脚本改改路径就能跑。今天就开始的 4 步清单按 docs/Installation/ 装好环境克隆仓库并运行setup.bat或setup.sh。用 test/ 里的现成数据集先跑一次 SD 1.5 LoRA——目的不是出好图是把装→训→出图链路走通。换上自己的 20~50 张图套一个 presets/lora/ 预设只改数据集路径就开始训练。盯着样图挑最满意的检查点把它放进你的绘图软件里用起来。复杂的专业流程被拆成了点按钮、填路径、看样图三件事。这不是把训练变简单而是把门槛从会写代码降到了会用软件——而后者人人做得到。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考