kohya_ss Stable Diffusion LoRA 训练:5 张图跑出自己的风格模型
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
输入提示词点生成,出来的图带着和你自己作品一样的色调、光影和笔触——这就是训练完成后的第一次回报。kohya_ss 是带图形界面的 Stable Diffusion 训练工具,通过它的 Web 界面就能完成 LoRA(只微调少量参数、小而快的训练方式)和 Dreambooth(教会模型某个特定角色或物体的训练方式),全程不用碰命令行。

它能帮你做什么 / 不能帮你做什么
三个输入到输出的场景,帮你判断它是不是你要的东西:
- 输入你拍的照片或你画的 10~20 张同风格图 + 一个基础模型(如 SDXL)→操作LoRA 标签页里加载一个预设、点开始训练 →输出一个几十 MB 的
.safetensorsLoRA 模型文件,放进 WebUI / ComfyUI 就能按你的风格出图。 - 输入某个特定角色或道具的若干张照片 →操作Dreambooth 标签页填触发词和配置 →输出一个完整微调后的模型,用触发词调用这个角色。
- 输入一堆没写描述的照片 →操作跑
tools/caption.py或界面里的标注功能 →输出每张图片配一个同名.txt描述文件。
它不能做的:不是日常出图软件。训练好的模型要拿到 WebUI / ComfyUI 里生成图片,kohya_ss 负责"造模型",训练中会出预览图但不适合当画板用。
🎯 最短路径跑通
四个检查点,每过一个就知道下一步没白干:
检查点 1:仓库完整。
git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss通过标准:目录里能看到gui-uv.sh(Linux/macOS)和gui-uv.bat(Windows)。
检查点 2:环境就绪。Windows 双击gui-uv.bat,Linux/macOS 执行下面这行。脚本会检测并自动安装uv、拉依赖、建虚拟环境,第一次跑几分钟到十几分钟都正常。
./gui-uv.sh通过标准:终端走完安装流程,没有红色报错。
检查点 3:界面起来。通过标准:浏览器出现 7860 端口的 Gradio 界面,能看到 LoRA、Dreambooth、Finetune 等标签页。
检查点 4:出第一个模型。LoRA 标签页 → 加载预设 → 指定数据集目录(放你图片的文件夹)和基础模型 → 点开始训练。通过标准:控制台开始滚动输出 loss 值,训练结束后输出目录里出现.safetensors文件和预览图。想以后少手动选目录,可以把仓库里的config example.toml拷一份改名为config.toml,填上你的默认路径。

素材达标标准
仓库里test/img/10_darius kawasaki person/放了一组标准数据集:8 张 512x512 同风格插画,各配一个同名.txt,照着它对齐即可。
| 项目 | 达标 | 不达标 |
|---|---|---|
| 数量 | 10~20 张高质量图 | 3 张随手截图,或 300 张风格混杂的图 |
| 分辨率 | 主体清晰,统一为 512x512 这类方形尺寸 | 长条图、模糊图、边长低于 256px 的图 |
| 风格一致性 | 同一色调、笔触、光感,一眼能认出是一个系列 | 照片、水彩、3D 渲染混在一个文件夹里 |
| 描述文件 | 每张图配同名.txt,一句话说明主体和风格 | 完全没有.txt,或堆大量与画面无关的词 |

预设配置怎么选
LoRA 标签页有"加载预设"按钮,从presets/lora/挑 JSON 即可。按你的风格类型对号入座:
| 风格类型 | 推荐文件 | 只需改什么 |
|---|---|---|
| 首次训练 / 常规插画角色(SDXL 底模) | SDXL - LoRA AI_characters standard v1.0.json | max_train_epochs(训练轮数,先给 10~20)和输出模型名 |
| 图很少,只有 1~3 张 | SDXL - 1 image LoRA v1.0.json(LoKr + Prodigy 优化器,对小数据更宽容) | 触发词和输出模型名 |
| 底模是老的 SD1.5 | sd15 - EDG_LoraOptiSettings.json | max_resolution改成你图片的实际尺寸 |
| 想先粗练再精修 | 先SDXL - LoRA finetuning phase 1_v1.1.json,再跑phase 2_v1.1.json | 两阶段间检查预览图再决定继续 |
⚡ 翻车速查
| 症状 | 原因 | 30 秒修复 |
|---|---|---|
| 浏览器打不开、7860 端口无响应 | 端口被占或远程环境未开监听 | 浏览器手动访问http://localhost:7860;远程机启动时加--listen 0.0.0.0 --headless |
| 训练中途报 CUDA out of memory | 显存不够或分辨率设太高 | max_resolution降一档(如 1024,1024 改 768,768),batch 保持 1 |
| Linux 启动报 no module named tkinter | 系统 Python 缺 GUI 组件 | 改用uv方式(gui-uv.sh)重建环境,venv 里已包含所需依赖 |
| 训练完成但模型模糊、风格漂移 | 轮数太少或学习率偏高 | 换用更低学习率的预设重跑,轮数先减半再逐步加 |
| Tesla V100 上 GPU 利用率低 | V100 已知兼容性问题 | 按docs/troubleshooting_tesla_v100.md改环境变量再启动 |
今晚就能跑完的最小任务:挑你最喜欢的 5 张图,各写一行.txt描述,加载 AI_characters 预设把轮数改成 10,启动 LoRA 训练,睡前看一眼输出目录的预览图——方法对不对,第一晚就有答案。
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考