ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

10分钟音频训AI变声模型:RVC语音转换上手教程

10分钟音频训AI变声模型:RVC语音转换上手教程 10分钟音频训AI变声模型RVC语音转换上手教程【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想做AI变声大多数人卡在第一关听说要囤几十小时录音配环境又是一大堆坑。用RVC语音转换可以绕开这些——十来分钟低底噪的人声就能训出一个可用的音色模型。RVC是开源的变声框架基于VITS自带网页界面上传音频、挑个音色、点一下转换就能拿到变声结果还能实时变声、分离人声。RVC三步装好环境第一步确认Python版本大于3.8用python --version查一下版本不够就先升级。第二步按显卡类型装依赖pip install torch torchvision torchaudio pip install -r requirements.txtN卡按上面两条装即可A卡或I卡把第二行换成pip install -r requirements-dml.txtMacOS用户直接跑sh ./run.sh它会自动建虚拟环境并装好依赖。第三步下载预训练模型python tools/download_models.pytools/download_models.py 会一次拉齐hubert_base.pt、rmvpe.pt、v1和v2预训练权重以及UVR5分离权重全部放进assets目录。另外还需要FFmpegUbuntu/Debian用sudo apt install ffmpegmacOS用brew install ffmpeg。5分钟听到第一个RVC变声效果环境装完一条命令启动python infer-web.pyWindows用户也可以直接双击 go-web.bat效果一样。浏览器打开界面后在推理区上传一段音频选一个现成音色点转换并下载试听——你的第一个RVC变声结果就出来了。第一次不一定要用自己训练的模型仓库里带的预训练音色就能出效果生成的wav可以直接在浏览器里听不满意就换音色再来一遍。先跑起来、拿到声音后面的调参都不慌。RVC为什么这么省事底模基于VITS推理时每一步都会从训练集的参考特征库里挑出最接近的一条替换掉输入带来的特征。这样音色只跟训练集走输入音频里原来的声线不会漏出来。数据门槛同样低。官方建议准备10到50分钟的低底噪语音普通显卡也能在可接受的时间内训完小数据量下轮次很快几分钟就能出第一版模型素材底噪大的话可以先把人声分离出来再用。平台覆盖也全N卡、A卡、I卡Windows、Linux、macOS都有对应依赖方案训练和推理共用同一套网页界面不用学两套命令。模型融合、UVR5人声分离、实时变声这些功能都内置在同一个仓库里不用另找工具拼。RVC变声训练10分钟音频训出自己的音色音频准备是关键时长10分钟以上底噪要低尽量同一种录音环境内容上覆盖不同的音调和语速训出来的音色更稳。带伴奏的素材建议先过人声分离再拿去切段。训练在WebUI里走一键流程自动切分、提取特征、训练、建索引一路走完卡住时看控制台日志定位即可。总轮数total_epoch按素材质量调音质一般给20~30轮音质好且时长足可以放到200左右推理细节参数可以看 configs/config.py。想调新音色就用融合在ckpt处理选项卡里用ckpt-merge按比例混合两个模型能得到介于两者之间的新声线。RVC实时变声与UVR5人声分离实时变声Windows下双击 go-realtime-gui.bat 进入实时界面麦克风或音频文件都能当输入。常规配置下端到端延迟约170ms换成ASIO输入输出设备后能压到90ms左右具体要看硬件驱动的支持情况。数字看着紧张实际说话基本听不出等待。人声分离RVC内置UVR5模型能把一首歌拆成人声和伴奏给翻唱、配音备素材很合适。界面里可切换不同分离模型、调参数分离出来的人声正好能喂给变声训练。RVC安装教程与训练常见问题问训练特别慢或提示CUDA out of memory答大概率是显存不够把batch size调小再试。4G以下显存的显卡训练比较吃力可以顺便检查驱动和CUDA配置。问训完了音色列表里没有训练集的音色答先点刷新音色还没有的话翻logs目录下对应实验的日志看有没有报错。训练集音质差也会让效果不明显换低底噪素材重训。问WebUI打不开报Connection Error答多半是控制台黑窗口被关掉了重新跑启动命令即可。如果弹的是Expecting value报错把系统的局域网或全局代理关掉再试。更多细节比如一键训练后没生成索引都整理在官方常见问题 docs/cn/faq.md 里。到这里RVC变声就齐了剩下交给你的素材和手感。项目以MIT协议开源许可细节见 LICENSE欢迎提Issue或按 CONTRIBUTING.md 提交PR参与开发。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表