资讯详情

资讯详情

AMD 显卡跑 SD 训练到底行不行?ROCm + kohya_ss 三步跑通 LoRA,附完整调优路线

AMD 显卡跑 SD 训练到底行不行ROCm kohya_ss 三步跑通 LoRA附完整调优路线【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss用 AMD GPU 训练 Stable Diffusion 系模型是 ROCm 模型训练 kohya_ss 教程这条路线要解决的核心问题一套 Gradio 界面LoRA、DreamBooth、微调全都能配装完即用。先说结论能不能跑、适合谁一句话能跑而且仓库是官方内置了 ROCm 通道的不是社区魔改。硬件门槛Linux 系统 AMD GPURX 6000/7000 系列比如 RX 7900 XT 训练 LoRA 是主流玩法。显存 16GB 起步比较从容8GB 也能跑但得开省显存手段系统要求ROCm 驱动6.x Python 3.10~3.11装完用rocminfo能看到自己的卡就算过了适合谁有 AMD 卡、想练 LoRA/角色模型的新手追求性价比、不想多花钱买 N 卡的用户不太适合Windows 上只想双击跑的人ROCm 通道主要在 Linux 上打磨过判断标准很简单rocminfo列出你的 GPUtorch.version.hip有版本号后面所有事都是顺的。从 0 到跑通一次完整的部署实录这一节解决的问题只有一个把机器从装了系统变成能出训练界面。全程四步卡住的概率从大到小排列在后面。第一步装 ROCm 驱动先别急着装 Python 依赖驱动是一切的前提。用发行版官方源装 ROCm 6.x装完把用户加进video组并重新登录然后验证rocminfo | grep gfx能打印出类似gfx1100的 GPU 架构编号说明驱动识别成功。⚠️ 这一步卡住的人最多——查驱动版本、看dmesg里的 amdgpu 报错基本都出在这。第二步拉仓库、装依赖kohya_ss 的 ROCm 支持是内置的ROCm 依赖清单里锁了torch 2.7.1rocm6.3对应的 ROCm 版 PyTorch、torchvision、tensorflow-rocm、onnxruntime-rocm不需要自己拼索引源。git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss chmod x setup.sh ./setup.sh --use-rocm--use-rocm会让 setup.sh 走 ROCm 的 requirements其实不加也行——脚本会自动探测到rocminfo存在就切换但显式写出来更稳。装完 ROCm 环境配置这一步就收尾了。第三步验证 PyTorch 认出了卡依赖装完别直接开 GUI花 30 秒确认 PyTorch 用的是 ROCm 后端python -c import torch; print(torch.__version__, torch.version.hip, torch.cuda.is_available())三样都对才算过版本号带rocm、HIP 有值、True。这里torch.cuda.is_available()对 AMD 卡返回 True 是正常的——ROCm 走的还是 CUDA 兼容接口别被误导去怀疑装错了。第四步启动 GUI./gui.sh --use-rocm --inbrowser --server_port 7860浏览器弹出来的就是你熟悉的 kohya_ss 训练界面数据集配置、LoRA/DreamBooth/Textual Inversion 各自独立标签页参数都有中文本地化localizations/里有 zh-CN 包。远程 SSH 环境记得追加--headless不然文件选择对话框会把进程挂住这个坑写在安装文档里了。![AMD GPU 上 kohya_ss 训练数据集的样例图片ROCm 模型训练数据准备](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki.jpg?utm_sourcegitcode_repo_files)训练怎么配数据、参数与界面这节解决界面开了然后呢——先把数据摆对再解释两个最影响结果的参数。数据目录长这样LoRA 用标注方式时dataset/ ├── person_a/ # 学习目标.jpg 图片 同名 .txt 标注 │ ├── 01.jpg │ └── 01.txt └── regularization/ # 正则化图片防语言漂移可选图片建议不小于训练分辨率标注文件里写清画面里有什么。不会写标注的话界面里有 BLIP/WD14 自动打标页或者跑 tools/caption.py仓库 test/img/10_darius kawasaki person/ 就是一组现成的图片标注样例结构直接抄。两个白话参数训练文档里有全量说明这里只讲最关键的network_dimLoRA 的容量。数值越大能学的细节越多但越容易过拟合也越占显存。练单个角色 16~32 起步经验值练复杂画风再往上加learning_rate网络学习率通常比主模型低一个数量级。LoRA 网络 1e-4 量级、文本编码器降到 1e-5 量级是比较稳的组合示例值按 loss 曲线微调不想自己调presets/lora/ 里躺着一堆社区验证过的预设 JSON含 SDXL 各种优化器组合界面里直接加载改改维度就开训。跑得更快显存与速度调优AMD 卡上显存不够用比 N 卡更常见同级别显存普遍小一截出 OOM 时按下面顺序出手每步都有代价别全开梯度检查点重算换显存最优先开。代价是速度掉一些混合精度 fp16/bf16显存近乎减半必开。注意部分 RX 7000 系列 fp16 累加会不稳定bf16 更保险8bit 优化器优化器状态占显存的大头砍掉近半。对收敛精度影响很小经验值降分辨率 / batch1 梯度累积1024 跑不动就 768累积步数补回等效 batch一句话取舍前三个开满第四个留到最后——分辨率是出图质量的地基能保就保。config example.toml 里有这些开关的完整位置可对照。 翻车了怎么办高频故障速查三个最高频的坑现象→原因→动作照着查1. 驱动识别失败rocminfo查不到卡原因九成是用户没在 video 组、或者内核驱动和 ROCm 用户态版本不匹配。动作sudo usermod -aG video $USER后注销重登再dmesg | grep amdgpu看有没有 init 报错。2. 训练中途 OOM 崩溃原因batch 或分辨率超过显存上限。动作先按上一节的顺序降配训练前用free -h确认系统内存也够ROCm 吃 host 内存比 CUDA 猛一些属经验值。3. 卡没被官方支持、PyTorch 直接拒绝加载现象报错里出现不支持的 gfx 版本号。动作社区通行做法属经验值rocm-smi # 确认卡与显存 HSA_OVERRIDE_GFX_VERSION11.0.0 python -c import torch # 借用相近架构版本号重试4. 训练慢得离谱先确认rocm-smi里 GPU 利用率是不是真的打满了打不满多半是数据加载瓶颈开 latent 缓存cache_latents能救一波。再往上走多卡、容器化与学习路径单卡跑通之后方向有三个仓库里都有入口多卡并行kohya_ss 走 accelerateROCm 下同样生效多卡时设置HIP_VISIBLE_DEVICES指定用哪几张卡容器化仓库自带 Dockerfile 与 docker-compose.yamlROCm 镜像官方有现成的思路一致学习路径新手从 docs/LoRA/top_level.md 和 docs/train_README.md 切入 → 读 docs/LoRA/options.md 过一遍参数 → 再啃 test/config/dataset.toml 这类真实配置。想上 DeepSeek 级理解就看 kohya_gui/ 源码每个训练模式一个类结构非常清晰收尾AMD 卡练 SD 早已不是凑合能跑而是完整、能长期用的工作流驱动到 PyTorch 到界面一条线打通省下的预算拿去买更大的显存、攒更多的数据集这笔账对多数人是划算的。先把 ROCm 装好、rocminfo亮绿灯剩下的交给 kohya_ss 的界面和预设你的第一张 LoRA 离得不远。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →