ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

30分钟跑通RVC WebUI:10分钟录音训练出你的第一个语音克隆模型

30分钟跑通RVC WebUI:10分钟录音训练出你的第一个语音克隆模型 30分钟跑通RVC WebUI10分钟录音训练出你的第一个语音克隆模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI当你只有10分钟的目标人声录音却想让视频、直播或游戏语音都换成那个音色RVC WebUI 语音克隆是目前门槛最低的开源方案。不用会写代码4G显存的显卡就能训练纯CPU也能跑推理。跟到文末30分钟内你手里会有一个能直接用的变声模型。它能帮你做什么配音与旁白批量换声自己录好一段素材批量推理选项卡能把整个文件夹的音频一次处理完支持导出 wav、mp3、m4a 等格式。直播实时变声单独运行实时变声程序端到端延迟约170msWindows 下接 ASIO 声卡可以压到90ms左右对话不卡拍。人声伴奏分离内置 UVR5能把歌曲里的人声单独剥离出来从现有录音里备出干净的训练数据。零音色泄漏用 top1 检索替换输入源特征你输入的人声不会串进输出小数据可训练10分钟低底噪录音就能得到可用模型硬件要求低4G 显存的入门显卡也能训练一键训练数据切分、特征提取、模型训练、索引训练自动串起来多语言界面内置多语言界面文件支持中、英、日、韩等语言跑通全流程语音克隆模型训练的4步整个流程就四步装环境、放模型、一键训练、转换试听。按顺序来基本不会绕路。准备 Python 3.12 环境并安装依赖做什么克隆项目按你的硬件装对应依赖。为什么项目基于 Python 3.12 x64CUDA 和 CPU 的依赖清单不同装错文件后面全报错。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirments_cpu_py312.txt有 NVIDIA 显卡的话把依赖文件换成 cu118 版本RTX 50 系用 cu128 版本。装完后你应看到pip 安装走完且没有报错。环境跑通之后程序本身还不能训练还差一批预训练底模。把预训练模型放进 assets 目录做什么按 README 里下载模型一节的命令执行几条下载把 hubert、rmvpe 和 pretrained 底模放进assets/。为什么训练全程依赖这些底模缺一个点训练就会立刻报错。这一步就是照 README 抄命令不用改任何参数。放好后你应看到assets/下出现了hubert_base、rmvpe、pretrained等文件夹。模型齐了可以真正开始训练了。启动 WebUI 并一键训练做什么启动网页界面在训练选项卡填入实验名和训练文件夹路径点一键训练。为什么一键训练会自动串起数据切分、F0 与 HuBERT 特征提取、模型训练、索引训练四段新手不用逐点手动。python webui.py总训练轮数total_epoch默认值是 20建议录音带底噪就保持 20~30高音质长录音建议改到 100~200原因是底模音质带不动差数据、但好数据值得多训。音高提取算法选默认的rmvpe就行。启动后你应看到浏览器自动打开 7865 端口的界面被占用会自动顺延端口训练选项卡逐阶段显示进度完成后推理音色下拉框里多出一个和实验名同名的模型。模型出来了最后一步是听效果。单次推理转换第一遍做什么切到模型推理选项卡选中刚训的模型上传一段自己的说话音频点转换。为什么先用单文件验证比直接批量处理省时间不满意可以马上调参数重来。上传后把index_rate检索特征占比滑块保持默认 0.75建议先别动原因是它决定音色相似度和自然度的平衡默认值就是中间态听感不像那个人再往上调。变调数值填 0 表示不升降调。转换后你应看到输出区出现一段可以播放、也可以下载的音频音色已经换成目标音色。调好这几个参数体验翻倍这几个参数是我调了几轮之后确认真正影响听感的按优先级排。index_rate检索特征占比适用场景变声结果里混进了你输入说话人的音色听起来串味。推荐值0.75单次推理默认值。为什么这么设它管的就是音色泄漏。调满 1输出只用训练集音色不泄漏但音质会被拖到训练集水平调成 0 则完全没有保护。0.75 是音色相似度和自然度的中间值。音高提取算法pm / rmvpe / fcpe适用场景唱歌时音高跟踪不准、声音忽高忽低或出现哑音。推荐值rmvpe默认值。为什么这么设速度快、资源占用小且能解决哑音问题。pm最快适合只求速度的批量处理fcpe精度最高但只在推理阶段可选。protect清辅音与呼吸保护适用场景高音或激烈演唱段落出现电音撕裂。推荐值0.33默认值。为什么这么设拉满 0.5 等于关闭保护调低会加大保护力度但调太低会削弱索引效果建议每次只动 0.05 小步试。使用场景音高算法index_ratetotal_epoch实时变声rmvpe0.7520高保真歌声克隆rmvpe0.5100~200批量快速处理pm120~30遇到这些情况不用慌浏览器提示 Connection Error现象页面一直连不上控制台窗口还在。最可能原因你把真正运行程序的黑色控制台窗口关了这个很正常不是网络问题。解决步骤重新运行程序Windows 下双击 go-webui.bat或重新执行启动命令再刷浏览器即可。页面弹出 Expecting value: line 1 column 1 (char 0)现象WebUI 直接弹出一个 JSON 解析错误。最可能原因局域网代理或全局代理拦截了请求包括服务端代理比如学术加速设置的 http_proxy。解决步骤关掉系统代理后重试如果用了学术加速先 unset 掉再打开页面。训练时报 Cuda out of memory现象训练中途崩掉日志里写着显存不足。最可能原因显存低于 4G4G 以下基本没法训练这是硬件上限不是你的操作问题。解决步骤先把 batch_size 调小重试如果是推理阶段爆显存可以调小 config.py 结尾的 x_pad、x_query 等几个填充参数。训练结束但没有索引文件现象日志显示训练完成却找不到 added 开头的索引文件。最可能原因训练集太大把加索引的步骤卡住了如果紧跟着有报错那大概率是假错误可以忽略。解决步骤回到训练选项卡再点一次训练特征索引索引就会补出来。收个尾如果你手里有一段十几分钟的录音想让它变成能配音、能直播、能实时变声的声音这个工具值得花半小时走一遍流程。整条链路是固定的模型放对位置、文件夹指对路径剩下的就是等它跑完。下一步建议先按默认配置把一键训练和单次推理完整跑一遍听完转换结果之后再回推理页单独调index_rate这是最快建立手感的方式。想查更多坑的完整清单看仓库自带的常见问题解答本文这一节的问题基本都能在那里找到对应条目。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表