news 2026/9/13 17:39:00

kohya_ss 实战手册:从 10 张图到可出图的 LoRA 微调完整流程

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
kohya_ss 实战手册:从 10 张图到可出图的 LoRA 微调完整流程

kohya_ss 实战手册:从 10 张图到可出图的 LoRA 微调完整流程

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

想在两天内把自己的 10 张图变成一版可用的 LoRA 训练权重,kohya_ss 是最短的路径。它把 Stable Diffusion 训练脚本包成了图形界面:你在界面上填参数,它负责生成并执行真正的训练命令。这篇手册带你走完整条链路:装环境、备数据、跑通第一次 LoRA 训练,最后把权重文件拿到手。

项目能力全景:kohya_ss 是什么

kohya_ss 是 Kohya 那套 Stable Diffusion 训练脚本的 Gradio 图形前端,解决的是"手写训练命令太劝退"的问题。相比直接啃命令行参数,它把选项变成下拉框和输入框,同时保留了等价的 CLI 能力。和同类工具比,它的优势是训练方式覆盖最全:从轻量 LoRA 到整模型微调都有入口。

  • GUI 生成命令行:界面上每个选项都对应一条真实的 sd-scripts 参数,可复制可复现
  • 多种训练方式:LoRA / LoHa / LoKR、DreamBooth、全量微调、文本反转训练
  • 基础模型覆盖广:SD1.5、SD2.x、SDXL、SD3、Flux.1、Lumina Image 2.0、Anima、HunyuanImage 2.1
  • 自带打标签工具:BLIP、WD14 等打标签入口,省去手写提示词
  • 预设与掩码损失:presets/ 内置社区训练预设;支持 masked loss 按区域算损失

![生物机械风格训练样本文件夹示例](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki.jpg?utm_source=gitcode_repo_files)

环境要求与安装命令

硬件底线一句话:NVIDIA 显卡、8GB 以上显存、CUDA 12.8 驱动,系统为 Windows 或 Linux;Python 3.10–3.11 和 Git 由安装脚本负责,你不用手动折腾。

Windows(PowerShell 或 CMD):

git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss setup.bat

Linux:

sudo apt install python3.11 python3.11-tk python3.11-venv git git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss ./setup.sh

装完依赖后,不习惯命令行的用户也有替代入口:Windows 直接双击 gui.bat,Linux 执行 gui.sh,效果等价。

分步操作:从零到首次产出

把项目拉到本地并启动 GUI

目标:跑起 kohya_ss 的 Web 界面。安装脚本结束后,Windows 双击gui.bat,Linux 执行./gui.sh。预期:浏览器自动打开 7860 端口(或终端打印的地址),看到分标签页的界面,"LoRA" 选项卡就在顶部。

按规范摆放训练数据

目标:让程序认识你的图。按 docs/image_folder_structure.md 的规范建目录:每类概念一个子文件夹,命名"数字_概念名",数字是训练时的重复权重;每张图配一个同名.txt,里面写这张图的提示词,提示词会优先于文件夹名生效。

仓库里的 test/img/ 就是一组现成样本,照它的结构搭自己的文件夹最省事,连.txt怎么写都有参照。

配置并启动第一次 LoRA 训练

目标:产出第一个.safetensors文件。在 "LoRA" 选项卡依次填入:基础模型路径、训练数据目录(上一步的文件夹)、输出目录;训练参数区填 LoRA 秩 16、学习率 1e-4、最大步数 1000、最大分辨率 1024,其余保持默认。预期:点击训练后界面拼出完整命令并弹出训练窗口,loss 从 0.5 上下开始逐步回落。

取走模型去生成图片

目标:验证 LoRA 生效。训练跑完一轮,outputs/里会出现.safetensors文件。把它放进 Stable Diffusion WebUI 的 LoRA 目录,生成图时提示词写模型名并加权重 0.8 左右;出图带上了你训练的风格,说明整条链路通了。

核心参数速查:LoRA 训练最常动的五个旋钮

参数名白话作用推荐起始值改大 / 改小的后果
learning_rate学习率,模型每步修正的幅度1e-4(Adafactor 用 2e-6 级)改大容易出图糊掉、变噪;改小几乎学不动
network_dimLoRA 秩,模型能记住的容量16改大文件变大、易过拟合;改小细节学不全
max_train_steps总训练步数,决定学多久500–1500过多过拟合出重复纹理;过少学不充分
train_batch_size一次吃几张图,直接占显存1显存爆就保持 1,用梯度累积补
max_resolution训练分辨率上限SD1.5 用 1024改大吃显存、拖慢速度;改小丢细节

新手最常改错的是 learning_rate:没有"越大越快"一说,先按 config example.toml 的默认值跑,等出图有问题再动它。

高频翻车点:四种典型现象的排查路径

如果训练中途显存爆满(OOM)

  • 现象:loss 打印几行后报 CUDA out of memory,进程直接退出
  • 根因:分辨率或 batch 超出显存余量,SDXL 基座尤其吃紧
  • 解法:在 Advanced 区打开 gradient checkpointing,train_batch_size 保持 1,max_resolution 降到 512(SDXL 可先试 768),重跑

如果出图重复纹理、五官扭曲

  • 现象:生成图里出现固定花纹、重复元素或结构崩坏
  • 根因:过拟合,步数相对数据量太多
  • 解法:max_train_steps 砍半,learning_rate 降一个数量级(1e-4 改 1e-5),重训后对比样本图

如果结果忽好忽坏、提示词不生效

  • 现象:同一提示词有时像有时完全不像,权重拉到 1 也没用
  • 根因:数据本身风格不一致,或.txt提示词与画面内容对不上
  • 解法:剔除模糊和离群样本,用 tools/caption.py 或 GUI 里的 WD14 打标签页统一重打提示词

如果 Windows 启动报 No module named 'tkinter'

  • 现象:setup.batgui.bat刚跑就抛 ModuleNotFoundError
  • 根因:Python 安装时未勾选 tcl/tk 组件
  • 解法:卸载重装 Python 3.10–3.11,安装器里勾上 "tcl/tk and IDLE",再重跑安装脚本

延伸资源:流程跑通之后去哪看

  • docs/Installation/:uv 与 pip 两套安装方法,按平台各有一篇
  • docs/LoRA/options.md:LoRA 参数逐项说明,调参前翻一遍
  • presets/lora/:社区验证过的参数组合,可一键载入
  • examples/caption.ps1:批量生成提示词的脚本示例
  • docs/train_lllite_README.md:训练脚本参数全集,含 masked loss 说明

先拿 10 张图和默认参数把完整流程跑一遍,出图正常后再逐项调参。

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/13 17:38:02

鸿蒙人脸识别门禁对接业务系统:API与MQTT工程规范实战

鸿蒙人脸识别门禁这东西,单机跑起来不难,真正让人头疼的是怎么跟业务系统打通。前阵子我正好在做一个园区项目,设备端基于鸿蒙系统做人脸识别门禁,后端要对接一套现成的综合管理平台。刚开始我天真地以为不就是调几个接口嘛&#…

作者头像 李华
网站建设 2026/9/13 17:35:46

2026年程序员接单平台选择与优化指南

1. 程序员接单平台概述程序员接单平台已经成为技术从业者获取项目机会、拓展职业发展的重要渠道。随着远程工作和自由职业的兴起,这类平台在2026年呈现出更加多元化和专业化的发展趋势。无论是刚入行的新手,还是经验丰富的技术专家,都能在这些…

作者头像 李华
网站建设 2026/9/13 17:35:36

ISO转CHD快速指南:游戏库省空间完整方案

ISO转CHD快速指南:游戏库省空间完整方案 【免费下载链接】romm A beautiful, powerful, self-hosted ROM manager and player. 项目地址: https://gitcode.com/GitHub_Trending/rom/romm 周末把散落各处的游戏搬进 romm(一个自托管的 ROM 管理器兼…

作者头像 李华
网站建设 2026/9/13 17:35:35

Simscape Electrical 仿真加速:从瓶颈诊断到系统优化

1. 为什么“Simscape Electrical 快速仿真”不是调个步长就能解决的事?Simscape Electrical 是 MATLAB/Simulink 生态里专攻电气系统建模与仿真的硬核模块,它用物理连接(Physical Connection)替代传统信号线,让电路、电…

作者头像 李华
网站建设 2026/9/13 17:34:29

嵌入式三大硬门槛:硬件电路、C底层、系统建模

1. 这不是危言耸听:嵌入式入门前必须直面的三个硬门槛“搞不懂这三个方向,千万别碰嵌入式!”——这句话在B站、知乎、CSDN上被反复截屏转发,评论区里挤满刚买完STM32开发板却连LED都点不亮的新人,也蹲着一批干了八年单…

作者头像 李华