尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Kohya_SS 实操指南:从十几张照片到训练出你的第一个 LoRA 模型
Kohya_SS 实操指南从十几张照片到训练出你的第一个 LoRA 模型【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss假设你手里有十几张同一角色的照片想让 AI 学会画它而不是每次都靠提示词碰运气。开源项目 Kohya_SS 就是为这件事而生的它是一个基于 Gradio 图形界面的扩散模型训练工具把 Kohya 的 SD 训练脚本包装成可视化操作支持 LoRA、DreamBooth、微调、Textual Inversion 等训练方式覆盖 Stable Diffusion 1.5/2.x、SDXL、SD3、Flux.1、Lumina、Anima、HunyuanImage 等主流基座模型。下面我们就以一个真实目标为主线——用 Kohya_SS 训练一个角色 LoRA——把环境、数据、训练、调参走一遍。三步把 Kohya_SS 跑起来整个安装只有装依赖和启动界面两件事仓库自带脚本处理完环境细节。第一步克隆代码git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss第二步按系统运行安装脚本它会自动创建虚拟环境并装好 PyTorch 等依赖# Linux / macOS bash setup.sh # Windows setup.bat第三步启动图形界面# Linux / macOS bash gui.sh # Windows gui.bat启动后浏览器会自动打开http://localhost:7860这就是 Kohya_SS 的 Gradio 操作界面如果端口冲突可以加--server_port 8080换一个端口。界面里的 LoRA、DreamBooth、Finetune 等标签页分别对应不同训练脚本比如 LoRA 标签页背后实际执行的是train_network.py。如果你希望每次启动时路径都自动填好可以把根目录的config example.toml复制为config.toml把模型目录、输出目录等默认路径写进去启动时会被自动加载。训练材料怎么准备图片目录 数据配置开始训练前先想清楚两件事模型要学什么和用什么描述它。Kohya_SS 要求训练图片放在带命名规范的目录里每张图旁边可以放一个同名.txt文件作为描述词caption告诉模型这张图里有什么。目录结构长这样dataset/ ├── 10_my_character/ # 前缀 10 表示每张图片训练时重复 10 次 │ ├── shot_01.jpg │ ├── shot_01.txt # 内容如1girl, red hair, blue dress │ ├── shot_02.jpg │ └── ... └── reg/ # 正则化图片可选防止过拟合几个要点值得说明图片数量LoRA 训练 10~30 张高质量图片通常够用图片格式支持.png、.jpg、.jpeg、.webp、.bmp一般不需要预先缩放。文件夹名的前缀数字如10_控制每张图的重复次数小数据集适当提高重复次数可以加强特征学习。caption 的作用写进.txt的内容发色、服装、姿势等会在训练中被剥离之后你用新提示词描述这些内容时模型只保留你没写进 caption 的特征——也就是角色本身。caption 越准确剥离得越干净。正则化图片reg/目录放一批同类别的通用图片帮助模型把角色特征和普通女孩区分开减少概念漂移。如果你要处理多组数据或精细控制分辨率、批大小可以额外写一个.toml数据配置文件然后在 GUI 里选择它。最小示例如下完整说明见官方文档[general] enable_bucket true # 按宽高比分桶混合不同比例的图片 [[datasets]] resolution 1024 # SDXL 建议不低于 1024 batch_size 1 [[datasets.subsets]] image_dir dataset/10_my_character class_tokens mychar # 标识符 类别第一次 LoRA 训练选模型、定参数、启动材料备好后我们进入 GUI 的LoRA标签页按四个步骤走。1. 选基础模型在Pretrained model name or path填入你的 SDXL 模型文件路径.safetensors格式。基础模型决定了 LoRA 的能力边界想学写实人像就选写实基座想学动漫角色就选动漫基座。2. 定关键参数参数建议值为什么这么设最大分辨率1024 × 1024SDXL 的标准训练分辨率低于它反而损失细节学习率4e-7Adafactor 优化器这是 SDXL LoRA 的常规值学习率太高会震荡太低则学不动优化器Adafactor比 AdamW 更省显存SDXL 场景推荐只训练 UNet勾选network_train_unet_onlySDXL 有两个文本编码器全开会引入不稳定因素训练步数 / 轮数从 1~3 个 epoch 起步图片少时轮次多了容易过拟合先少跑再调保存格式safetensors通用性强文件体积比 ckpt 小显存方面SDXL LoRA 训练建议 12GB 起步。3. 启动训练点击Start training后训练脚本在后台运行界面会输出日志日志目录里还有 TensorBoard 记录默认端口 6006可以看 loss 曲线。4. 看结果训练结束或每 N 步会在输出目录生成 LoRA 文件。把它放进 Stable Diffusion WebUI 等推理端加载用标识符提示词如mychar, 1girl出几张图和训练集对照脸部特征稳定、能换姿势换服装说明基本成功。怎么判断结果好坏以及异常信号训练过程主要盯两个地方loss 曲线和训练中的采样图。Loss 走势正常情况是前几百步快速下降随后缓慢趋稳。如果 loss 不降反升或剧烈抖动通常是学习率过高或 caption 写错了。采样图如果启用了训练中采样每隔几十个 step 看一次。如果采样图里角色特征在某个 step 之后开始模糊、背景出现训练集里的元素说明接近过拟合了——用save_every_n_epochs定期保存模型回挑最早达标的那一个。loss 骤降为 0 附近模型在背答案而不是学特征减少训练量。常用调节手段loss 降得太慢就适当提高学习率或增加 epoch出图总带训练集的服装背景就检查 caption 是否漏写了这些元素概念和提示词脱钩可以试试clip_skip或在数据配置里加caption_dropout_rate让模型学会忽略部分描述。进阶其他训练方式和高级功能除了 LoRAKohya_SS 还内置了几种路线这里各给一句话定位DreamBoothtrain_db.py不需要 caption用标识符 类别词训练特定角色可配正则化图片适合只有少张照片的场景。Finetune 全量微调fine_tune.py直接改基础模型权重学习容量最大但消耗也最大适合有大量数据时注入整体风格。Textual Inversion只训练一个新词对应的向量模型几乎不变适合给现有词表补充新概念。Masked loss 掩码损失用二值化掩码图指定只学哪些区域白色部分参与训练、黑色部分被忽略适合只学服装或配饰。模型工具LoRA 之间的合并merge、提取、尺寸转换resize等功能都在工具标签页里方便对多个 LoRA 做风格混合。三个最常见的坑坑一显存不足OOM。现象是训练刚启动就报 CUDA out of memory。解法按代价从小到大把train_batch_size降到 1 并用gradient_accumulation_steps累积梯度凑等效批大小开启cache_latents缓存潜变量调低最大分辨率SD1.5 用 512SDXL 尽量别低于 1024开启gradient_checkpointing用时间换显存。坑二过拟合。现象是 loss 降到极低出图高度雷同、细节崩坏、换不动服装。解法缩短训练步数、降低重复次数减小文件夹名前缀数字、加入正则化图片组、启用caption_dropout_rate并利用定期保存回挑早停模型。坑三生成不稳定、和提示词脱钩。现象是有时出角色有时不出特征时隐时现。解法先核对 caption 与图片是否一致错标签是最大元凶LoRA 权重别拉满从 0.6~0.8 试起CFG scale 用 5~7 的常规区间测试过高会饱和发糊。收尾继续深入的路径官方训练文档数据组织、分桶、采样图、各脚本参数的完整说明LoRA 预设配置一批社区分享的现成参数模板改路径即可直接用示例脚本批处理 caption、数据整理等 PowerShell 脚本参考从十几张照片到一个可复用的 LoRA整个流程就是目录规范 参数克制 早看早调。先跑通最小数据集再逐步加图片、调参数你会比看十篇参数表更快摸清自己的角色该怎么练。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

VoiceStudio 仓库架构全解:从根目录布局到测试体系的结构化导航

VoiceStudio 仓库架构全解:从根目录布局到测试体系的结构化导航

VoiceStudio 仓库架构全解:从根目录布局到测试体系的结构化导航 【免费下载链接】VoiceStudio VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook cr…

📅 2026/9/13 2:53:57
Excel曲线回归实战指南:零代码完成统计建模

Excel曲线回归实战指南:零代码完成统计建模

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/9/13 2:53:57
从复位向量到main:单片机启动流程全拆解

从复位向量到main:单片机启动流程全拆解

你有没有认真想过一个问题:一块单片机,焊好、上电,按下电源那一瞬间,程序自己就跑起来了。烧进去的main函数,好像根本没人叫它,它自己就“开工”了。但如果你把时间轴拉近,从“没电”到“main 函…

📅 2026/9/13 2:48:56
MORE NEWS

更多资讯

📰

DAB双有源桥Simulink闭环仿真与PI参数整定全攻略

最近好几个做车载充电、储能接口和直流微网的朋友都跑来问DAB的仿真怎么做,这个拓扑确实是眼下高频隔离型DCDC变换器里绕不开的热门方案。双有源桥(Dual Active Bridge)从90年代被提出来之后,一直没大火,这几年随着碳化…

📰

ComfyUI低显存优化与双系统兼容实战指南

1. 这个整合包到底解决了什么真实痛点?——从“装不上”到“跑得动”的底层逻辑ComfyUI本身是个极简的节点式图像生成框架,但它的“极简”只体现在UI上,背后却是一整套需要手动缝合的复杂生态:Python环境、CUDA版本、PyTorch编译选…

📰

STM32C5A3R串口打印配置详解:从CubeMX到printf重定向

这是STM32C5A3R开发笔记的第3篇。拿到板子、把工程模板建好、GPIO点灯跑通之后,我接下来做的事永远是同一个:配置串口打印。串口打印把芯片内部正在跑的状态实时搬到电脑上,printf 一行日志下去,程序走到哪个分支、变量变成什么、…

📰

ESP32-P4实战解析:AIoT芯片的向量指令、GPU与工程避坑指南

去年做一款带屏边缘AI设备的时候,我把市面上能拿来做AIoT的芯片认真列了一遍,最后真正让我停下来花时间研究的,是ESP32-P4这颗双核RISC-V芯片。它和过去那种靠“外挂”方案来补足智能语音和视觉能力的AIoT芯片不一样,直接在主控里…

📰

边缘计算在工业控制中的落地:Jetson Nano视觉检测实战

1. 为什么工业控制必须把计算放到“边上”传统工业控制系统大多是“集中式”的。PLC把数据采上来,送到中控室的服务器或者DCS系统里做运算,算完再下发指令。这套模式在产线规模不大、数据量可控的时候没什么问题,但一旦设备数量上百、传感器点…

📰

情感识别模型ONNX部署实战:CUDA多版本与GPU优化

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬