ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Retrieval-based-Voice-Conversion-WebUI 完整指南:零基础跑通 AI 实时变声

Retrieval-based-Voice-Conversion-WebUI 完整指南:零基础跑通 AI 实时变声 Retrieval-based-Voice-Conversion-WebUI 完整指南零基础跑通 AI 实时变声【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI项目定位与核心能力Retrieval-based-Voice-Conversion-WebUI社区里通称 RVC是一个开源 AI 变声工具基于 VITS 语音合成框架提供网页界面完成语音转换模型的训练、推理和实时变声。它解决的核心问题是用不超过 10 分钟的干净人声数据就能训练出可用的音色转换模型而且普通消费级显卡也能快速训完。它最突出的两个能力一是通过 top1 检索替换源特征来杜绝音色泄漏二是对话级延迟的实时变声——Windows 下端到端延迟可以做到 170ms配合 ASIO 声卡甚至能压到 90ms。3 条命令启动 Web 变声界面环境要求Python 3.8 以上推荐 3.8~3.10、已安装 ffmpeg、有 NVIDIA/AMD/Intel 显卡之一A 卡、I 卡也支持见下文。克隆代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI先安装 PyTorch已安装可跳过再装其余依赖pip install torch torchvision torchaudio pip install -r requirements.txt安装 ffmpeg处理音频离不开它Ubuntu/Debiansudo apt install ffmpegmacOSbrew install ffmpeg也可以直接跑仓库自带的sh ./run.sh它会自动建虚拟环境装依赖Windows把ffmpeg.exe和ffprobe.exe放到项目根目录即可装完依赖后启动 Web 界面浏览器会自动打开 http://localhost:7865 python infer-web.py不同显卡选不同依赖清单N 卡用requirements.txtA 卡/I 卡用requirements-dml.txtA 卡 ROCmLinux用requirements-amd.txtI 卡 IPEXLinux用requirements-ipex.txt。习惯 Poetry 的话也可以用poetry install代替 pip。关键文件导览启动入口——你每天打交道的主要是这三个infer-web.py 是主程序负责训练和推理两个 Web 界面打开浏览器看到的所有选项卡UVR5 人声分离、音频切片、特征提取、模型训练、推理都在这一个文件里。go-web.bat/go-web-dml.bat是 Windows 下的一键启动脚本前者给 N 卡用后者给 A 卡/I 卡用本质就是调infer-web.py并指定端口 7897。go-realtime-gui.bat/go-realtime-gui-dml.bat启动实时变声 GUI对应gui_v1.py这是录音时实时变音用的独立窗口不是网页。模型与资源目录——为什么它最重要assets/ 存放所有预训练模型hubert_base.pt语音特征提取器、pretrained/和pretrained_v2/底模、uvr5_weights/人声分离模型、rmvpe/音高提取模型。界面能不能正常加载就看这个目录齐不齐首次使用必须按 docs/cn/ 文档里的清单补齐tools/下有现成的下载脚本。辅助工具tools/里有一批命令行工具infer_cli.py批量转音频、download_models.py下载模型、export_onnx.py导出 ONNX 给手机端用进阶玩家常去翻这里。configs/是推理配置采样率、音高、设备参数等configs/config.json记录实时变声界面的各项参数一般用界面改不需要手动编辑。docs/提供中/英/日/韩/法/德等 7 种语言的 README、FAQ 和训练技巧遇到问题先查这里。i18n/负责界面多语言翻译LICENSE是 MIT 协议。目录全景Retrieval-based-Voice-Conversion-WebUI/ ├── infer-web.py # 训练/推理 Web 入口 ├── gui_v1.py # 实时变声 GUI 入口 ├── go-web.bat / go-realtime-gui.bat # Windows 一键启动 ├── run.sh # macOS/Linux 环境初始化 ├── requirements.txt # N 卡依赖清单 ├── configs/ # 推理配置JSON config.py ├── assets/ # 预训练模型与权重 ├── infer/ │ ├── lib/ # 核心推理库F0 提取、VITS 模型 │ ├── modules/ # 训练、UVR5、实时变声模块 ├── tools/ # 批量推理、模型下载、ONNX 导出 ├── docs/ # 多语言文档与 FAQ ├── i18n/ # 界面多语言 └── api_240604.py # API 服务入口常见坑缺预训练模型报错assets 目录下的hubert_base.pt、rmvpe.pt等不是随仓库带的必须手动下载并放到指定路径否则界面一加载模型就报错。端口占用默认监听 7865 端口被占用时加--port参数换个端口如python infer-web.py --port 8080。显存不够训练和推理都吃显存4GB 以下显卡建议关掉半精度选项或降低 batch size具体可以看 docs/cn/faq.md。跑通之后打开浏览器访问 http://localhost:7865 按界面上 UVR5 分离 → 切片 → 提取特征 → 训练的向导流程走一遍你的第一个 AI 变声模型就能出炉了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表