ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

AMD显卡上训练kohya_ss:ROCm环境3步装好,显存调优与报错速查完整指南

AMD显卡上训练kohya_ss:ROCm环境3步装好,显存调优与报错速查完整指南 AMD显卡上训练kohya_ssROCm环境3步装好显存调优与报错速查完整指南【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss如果你用 AMD 显卡跑 kohya_ss 做模型微调LoRA、Dreambooth 这类在已有大模型上继续训练的操作大概率会先撞上两类麻烦一是装环境时装不上二是启动训练时直接报错甚至显存溢出。这篇文章按“先装好、再跑通、最后调顺”的顺序带你把流程走一遍所有版本号、命令、参数值都直接写死照着敲就行。装之前先核对这 4 项前提ROCm 是什么一句话AMD 官方出的 GPU 计算平台作用类似 CUDA只是服务 AMD 显卡。kohya_ss 对 AMD 的支持就是基于它实现的。动手之前先花两分钟确认下面的条件能省掉后面 80% 的排错时间操作系统Linux内核 5.4 以上推荐 Ubuntu 20.04 / 22.04 LTS。ROCm 驱动版本必须 6.3 及以上这是本项目依赖清单锁定的 ROCm 大版本。Python 版本3.11 和其他版本都能用但依赖包会按版本分开锁。以 TensorBoard 为例Python 3.11 用 2.14.1其他版本用 2.16.2tensorflow-rocm 对应是 2.14.0.6003.11和 2.16.2其他版本。⚠️onnxruntime-rocm1.21.0 不支持 Python 3.11如果你需要用到 ONNX 相关功能建议避开 3.11。这些版本约束都写死在 requirements_linux_rocm.txt 里不要手动改版本号。3 步装好从驱动到可训练环境第 1 步装 ROCm 驱动栈在 Ubuntu 终端执行装上 ROCm 的 HIP 运行库HIP 可以理解为 AMD 版的 CUDA 内核接口sudo apt update sudo apt install rocm-hip-sdk第 2 步把项目拉下来git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss第 3 步安装 AMD 专用依赖pip install -r requirements_linux_rocm.txt这一步会自动装好 ROCm 版的 PyTorch、TensorFlow 等训练框架和 ONNX 运行时文件最后一行的-r requirements.txt还会把 kohya_ss 的公共依赖一并带进来不需要单独再装一遍。依赖文件里这几个关键版本为什么不能动打开 requirements_linux_rocm.txt 看前几行就能明白它的门道第 2 行--extra-index-url https://download.pytorch.org/whl/rocm6.3告诉 pip 额外去 PyTorch 官方 ROCm 源找包因为 ROCm 版的 torch 在 PyPI 主站没有。第 3 行--find-links https://repo.radeon.com/rocm/manylinux/rocm-rel-6.4.1指向 AMD 官方的 ROCm 6.4.1 仓库这个链接已经预留为后续升级 ROCm 大版本做准备。第 5-6 行锁死核心版本torch2.7.1rocm6.3和torchvision0.22.1rocm6.3。简单说这个文件存在的意义就是解决“AMD 显卡的软件包散落在多个专用源、PyPI 上找不到”的问题。你只需要执行上面那一条 pip 命令源解析它自己会处理。显存不够怎么办按顺序动这 3 个参数显存溢出OOM是 AMD 卡训练时最常见的运行时问题。不要一上来就换小数据集按下面的顺序逐个加每个都加一句解释加--fp16让训练用半精度浮点跑显存占用大约直接减半这是性价比最高的一档。加--gradient_checkpointing梯度检查点用重新计算换显存速度会慢一点但能明显降低峰值占用。调 batch_size批大小一次同时处理几张图以 RX 7900 XTX 为例先从batch_size4起步能跑再根据剩余显存往上调或往下调找到一个既不满溢又能喂饱显卡的值。训练参数怎么填可以参考仓库里的示例配置 config example.toml 和官方说明 docs/train_README.md带界面的用户也可以走 GUI入口在 kohya_gui/。报错速查表你看到的现象真正的原因处理办法训练中途显存溢出OOMbatch_size 配大了降 batch_size同时加--gradient_checkpointing和--fp16TensorFlow 相关组件加载失败Python 版本和锁定的包版本对不上严格按 requirements_linux_rocm.txt 第 8-11 行的版本约束安装不要手动升/降级启动时提示hipErrorNoBinaryForGpuROCm 驱动版本和 torch 编译目标不匹配升级/重装到 6.3 的 ROCm 驱动栈即第 1 步的 rocm-hip-sdk保持与torch2.7.1rocm6.3对应装好之后接着做什么先跑一次最小的 LoRA 训练把链路验证通再上正式数据集之后留意 requirements_linux_rocm.txt 的版本更新ROCm 大版本升级如 6.4.x 正式切换都会体现在这里跟着文件升就行。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表