
如何用 10 分钟语音数据训练 RVC 变声模型Retrieval-based-Voice-Conversion-WebUI 完整教程【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想让自己的歌声变成目标音色或者把一段干声换成另一个人的声线但手里只有 10 分钟左右的录音、显卡也不算新这篇文章帮你在普通电脑上跑通 Retrieval-based-Voice-Conversion-WebUI下称 RVC从装依赖、下预训练模型到一键训练出自己的变声模型再到调推理参数和排查常见报错每一步都讲清楚。训练前的两项准备语音数据与显卡要求先说结论数据推荐 10~50 分钟显卡显存 4GB 起步即可。语音数据音质高、底噪低是关键时长宁精勿滥。5~10 分钟的高质量、音色有特色的录音也能出可用模型1 分钟以下的数据基本不建议尝试。数据存放路径里不要出现空格、括号或中文这一点能提前避开后面一类报错。显卡N 卡走 CUDAA 卡/I 卡走 DirectMLLinux 下 A 卡还支持 ROCm各有一份对应的依赖清单requirements-dml.txt、requirements-amd.txt、requirements-ipex.txt。显存 4GB 以下如 1060 3G基本无法训练4GB 还能跑。如何安装依赖并下载预训练模型这一节完成两件事把代码和依赖装好把 RVC 需要的预训练权重放进assets目录。克隆仓库并安装依赖。以 N 卡为例先确认 Python 版本大于 3.8git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt第一条命令把项目代码拉下来第二条装 PyTorch第三条安装项目其余依赖。A 卡/I 卡把最后一条换成requirements-dml.txt即可。 2. 安装 ffmpegRVC 内部靠它读写音频Ubuntu/Debian 执行sudo apt install ffmpegMacOS 用 Homebrew 安装Windows 用户把 ffmpeg 可执行文件放到项目根目录。 3. 下载预训练权重放到指定位置仓库的tools文件夹里有现成的下载脚本可用assets/hubert/hubert_base.pt特征提取模型assets/pretrained底模用于训练起点assets/uvr5_weights人声伴奏分离模型想用 v2 底模的话再补一个assets/pretrained_v2可选下载rmvpe.pt音高提取模型放到项目根目录用于推理时提取人声音高比传统算法更快且资源占用更小。第一次启动 RVC WebUI 与界面导览启动只需一条命令在项目根目录执行python infer-web.py浏览器打开后你会用到这几个选项卡按工作流顺序记即可选项卡用途数据集获取UVR5 人声伴奏分离先把录音里的背景音乐去掉音频预处理自动切分长音频、归一化响度为训练做准备一键训练 / 训练模型 / 训练特征索引指定实验名和数据目录训练模型并建立特征索引模型推理单条变声实时试听效果批量推理整文件夹批量转换ckpt处理模型融合、提取小模型另外如果你用的是 Windows 整合包RVC-beta 解压后直接双击go-web.bat也能启动同样的界面MacOS 则执行sh ./run.sh。一键训练完整流程从人声分离到生成索引这一节走通原始录音 → 可用模型的完整链路全程在网页上点按钮不用写代码。去背景音乐可选在数据集获取选项卡用 UVR5 分离人声适合训练集里有伴奏混入的情况。预处理在音频预处理选项卡指定原始音频文件夹自动完成切分约 4 秒一段和响度归一化。一键训练在训练选项卡填好实验名数据都会落到logs/实验名/下、勾选是否带音高要唱歌就勾选、指定音频文件夹点一键训练。它会依次执行提取音高、提取 HuBERT 特征、训练模型、训练特征索引index 文件就是检索用的特征库用于推理时防音色泄漏。试听训练完成后在模型推理选项卡选择刚训好的音色需要时先点刷新拖入一条音频即可变声。训练轮数total_epoch怎么定训练集底噪大、音质一般时 20~30 轮就够调太高反而带不动音质高、时长多时可以放到 200 轮。RVC 高频报错排查手册以下按现象 → 原因 → 解决组织覆盖新手最常卡住的几处。现象ffmpeg error / utf8 error原因大概率不是 ffmpeg 本身的问题而是音频路径带空格、括号或训练集路径含中文。 解决把音频移动到纯英文、无空格的路径下再处理。现象一键训练显示Training is done.但结尾没有 added 开头的索引文件且紧跟一段报错原因训练其实已成功紧邻的报错是假象索引步骤可能因训练集过大、内存吃紧而卡住。 解决单独再点一次训练特征索引。现象CUDA out of memory原因显存不够4GB 显存跑大 batch 也会中招。 解决训练时把 batch size 调小推理时可在configs/config.py末尾调小 x_pad、x_query 等参数。现象训练完成后推理列表里看不到新音色原因音色列表没刷新或训练中途实际报错。 解决先点刷新音色仍没有则检查控制台输出和logs/实验名/下的日志。现象WebUI 弹出 Expecting value: line 1 column 1 (char 0)原因系统开着局域网/全局代理本地服务请求被代理拦截。 解决关闭代理后重启 WebUI。现象训练中途报 tensor 尺寸不匹配如 17280 对 0原因wavs16k 目录里混入了个别异常小、无效的音频文件。 解决找出体积明显偏小的文件删掉重新点训练模型因为流程中断训练完记得补点训练特征索引。更完整的问答可以查仓库自带的 中文 FAQ。推理参数与模型分享index rate 和 60MB 模型文件最后是日常使用中最常被问的两件事。index rate索引比例是什么它控制变声时目标音色和你输入的音色之间的平衡。调到 1 时理论上完全不会出现推理源音色泄漏听起来像另一个人的声音里混进了你自己的音色但音质会向训练集靠拢调到 0 则完全不启用检索保护。训练集质量高、时长够长时这个参数不那么敏感。分享模型用哪个文件logs/实验名/下几百 MB 的 pth 是训练存档不能直接拿去推理真正用来分享的是weights/下 60MB 左右的 pth 文件再配合added_xxx.index索引一起给对方即可。 到这里从 10 分钟录音到能用的变声模型就算走通了。想深入训练细节可以看 训练技巧文档 和 FAQ遇到本文没覆盖的问题可以去项目社区的讨论区提问或直接提 issue 反馈。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考