news 2026/9/18 1:58:49

kohya_ss Stable Diffusion LoRA 训练:5 张图跑出自己的风格模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
kohya_ss Stable Diffusion LoRA 训练:5 张图跑出自己的风格模型

kohya_ss Stable Diffusion LoRA 训练:5 张图跑出自己的风格模型

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

输入提示词点生成,出来的图带着和你自己作品一样的色调、光影和笔触——这就是训练完成后的第一次回报。kohya_ss 是带图形界面的 Stable Diffusion 训练工具,通过它的 Web 界面就能完成 LoRA(只微调少量参数、小而快的训练方式)和 Dreambooth(教会模型某个特定角色或物体的训练方式),全程不用碰命令行。

![Stable Diffusion 训练素材示例:512x512 蒸汽朋克风格角色图](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki.jpg?utm_source=gitcode_repo_files)

它能帮你做什么 / 不能帮你做什么

三个输入到输出的场景,帮你判断它是不是你要的东西:

  • 输入你拍的照片或你画的 10~20 张同风格图 + 一个基础模型(如 SDXL)→操作LoRA 标签页里加载一个预设、点开始训练 →输出一个几十 MB 的.safetensorsLoRA 模型文件,放进 WebUI / ComfyUI 就能按你的风格出图。
  • 输入某个特定角色或道具的若干张照片 →操作Dreambooth 标签页填触发词和配置 →输出一个完整微调后的模型,用触发词调用这个角色。
  • 输入一堆没写描述的照片 →操作tools/caption.py或界面里的标注功能 →输出每张图片配一个同名.txt描述文件。

它不能做的:不是日常出图软件。训练好的模型要拿到 WebUI / ComfyUI 里生成图片,kohya_ss 负责"造模型",训练中会出预览图但不适合当画板用。

🎯 最短路径跑通

四个检查点,每过一个就知道下一步没白干:

检查点 1:仓库完整。

git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss

通过标准:目录里能看到gui-uv.sh(Linux/macOS)和gui-uv.bat(Windows)。

检查点 2:环境就绪。Windows 双击gui-uv.bat,Linux/macOS 执行下面这行。脚本会检测并自动安装uv、拉依赖、建虚拟环境,第一次跑几分钟到十几分钟都正常。

./gui-uv.sh

通过标准:终端走完安装流程,没有红色报错。

检查点 3:界面起来。通过标准:浏览器出现 7860 端口的 Gradio 界面,能看到 LoRA、Dreambooth、Finetune 等标签页。

检查点 4:出第一个模型。LoRA 标签页 → 加载预设 → 指定数据集目录(放你图片的文件夹)和基础模型 → 点开始训练。通过标准:控制台开始滚动输出 loss 值,训练结束后输出目录里出现.safetensors文件和预览图。想以后少手动选目录,可以把仓库里的config example.toml拷一份改名为config.toml,填上你的默认路径。

![SDXL LoRA 训练数据集示例:同一角色不同构图的 512x512 插画](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki_5.jpg?utm_source=gitcode_repo_files)

素材达标标准

仓库里test/img/10_darius kawasaki person/放了一组标准数据集:8 张 512x512 同风格插画,各配一个同名.txt,照着它对齐即可。

项目达标不达标
数量10~20 张高质量图3 张随手截图,或 300 张风格混杂的图
分辨率主体清晰,统一为 512x512 这类方形尺寸长条图、模糊图、边长低于 256px 的图
风格一致性同一色调、笔触、光感,一眼能认出是一个系列照片、水彩、3D 渲染混在一个文件夹里
描述文件每张图配同名.txt,一句话说明主体和风格完全没有.txt,或堆大量与画面无关的词

![LoRA 训练风格一致性示例:同系列不同场景的角色插画](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki_3.jpg?utm_source=gitcode_repo_files)

预设配置怎么选

LoRA 标签页有"加载预设"按钮,从presets/lora/挑 JSON 即可。按你的风格类型对号入座:

风格类型推荐文件只需改什么
首次训练 / 常规插画角色(SDXL 底模)SDXL - LoRA AI_characters standard v1.0.jsonmax_train_epochs(训练轮数,先给 10~20)和输出模型名
图很少,只有 1~3 张SDXL - 1 image LoRA v1.0.json(LoKr + Prodigy 优化器,对小数据更宽容)触发词和输出模型名
底模是老的 SD1.5sd15 - EDG_LoraOptiSettings.jsonmax_resolution改成你图片的实际尺寸
想先粗练再精修SDXL - LoRA finetuning phase 1_v1.1.json,再跑phase 2_v1.1.json两阶段间检查预览图再决定继续

⚡ 翻车速查

症状原因30 秒修复
浏览器打不开、7860 端口无响应端口被占或远程环境未开监听浏览器手动访问http://localhost:7860;远程机启动时加--listen 0.0.0.0 --headless
训练中途报 CUDA out of memory显存不够或分辨率设太高max_resolution降一档(如 1024,1024 改 768,768),batch 保持 1
Linux 启动报 no module named tkinter系统 Python 缺 GUI 组件改用uv方式(gui-uv.sh)重建环境,venv 里已包含所需依赖
训练完成但模型模糊、风格漂移轮数太少或学习率偏高换用更低学习率的预设重跑,轮数先减半再逐步加
Tesla V100 上 GPU 利用率低V100 已知兼容性问题docs/troubleshooting_tesla_v100.md改环境变量再启动

今晚就能跑完的最小任务:挑你最喜欢的 5 张图,各写一行.txt描述,加载 AI_characters 预设把轮数改成 10,启动 LoRA 训练,睡前看一眼输出目录的预览图——方法对不对,第一晚就有答案。

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/18 1:58:32

SecureCRT中文乱码终极解决方案:UTF-8编码协同配置指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 1:57:33

客服语音机器人选 GPT-Live-1 前,先看 TaoToken 的 Token 消耗路径

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 1:55:14

为什么 ALTK-Evolve 的 GPT-4.1 在 AppWorld 耗 Token?TaoToken 换 Key 复跑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 1:54:27

Unity场景性能优化实战:用Simplyon从阴影到遮挡剔除稳住Pico 4帧率

做Unity场景优化这些年,我越来越确信一件事:大部分项目的渲染卡顿,不是显卡不行,而是场景里重复的、不合理的设置太多。尤其是光照、阴影、包围盒、遮挡剔除这些东西,Unity默认全开,项目一旦复杂起来&#…

作者头像 李华
网站建设 2026/9/18 1:53:41

LangGraph企业级AI Agent实战:状态管理、Checkpoint与高可用部署

1. 这不是又一个“Hello World”式LangGraph教程——它解决的是企业级AI Agent落地时真实卡点你搜“LangGraph 教程”,刷出来的大多是三步走:装包、跑个天气查询demo、贴段代码完事。但真正带团队在金融风控、电商客服、SaaS后台里搭AI Agent的人&#x…

作者头像 李华