ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

GPT-SoVITS 少样本声音克隆版本选型指南:v1/v2/v3/v4/v2Pro 六版本一文讲清

GPT-SoVITS 少样本声音克隆版本选型指南:v1/v2/v3/v4/v2Pro 六版本一文讲清 GPT-SoVITS 少样本声音克隆版本选型指南v1/v2/v3/v4/v2Pro 六版本一文讲清【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个用 1 分钟人声就能克隆专属音色的少样本 TTS语音合成项目但它先后推出了 v1、v2、v3、v4、v2Pro、v2ProPlus 六个版本GPT-SoVITS 版本选型成了新手最常卡住的一步。这篇指南先把结论摆在你面前再解释每一代为什么长这样帮你一次选对。先说结论按场景对号入座你的场景直接选一句话理由低配机器、刚接触声音克隆v2显存门槛最低教程和共享模型最多只在乎音质上限v4原生 48kHz 输出且修掉了 v3 的金属音训练集是手机录音、带底噪v2 或 v2Pro低质量语料上表现反而更好v3/v4 不行直播、实时 TTS 等低延迟需求v2ProPlus4090 上实测 RTF 约 0.014还支持流式推理如果你不想细看下文记住这一句没有特殊情况选 v2ProPlus。三个技术代际各讲三件事轻量入门代v1 与 v2 合并看相对上一代的关键变化v2 把预训练语料从约 2k 小时扩到 5k 小时新增韩语和粤语v1 只有中、英、日重写了文本前端中英混读和多音字更准对低质量参考音频也更宽容。适合谁显存紧张的老显卡、想先跑通1 分钟克隆声音流程的人。v2 的社区生态最成熟绝大多数第三方教程基于它。代价输出 32kHz 音频音质上限不如 v3/v4v1 已停止投入新特性只是 v2 的前身。音质优先代v3 与 v4 合并看相对上一代的关键变化v3 是架构级升级——少样本甚至零样本的音色相似度明显提升GPT 重复、漏字更少并新增了 LoRA 训练微调显存约 8GB全量微调约 14GB开梯度检查点可压到约 12GB。v4 则是对 v3 的定向修复解决非整数倍上采样导致的金属音并把原生输出从 24kHz 提到 48kHz作者自己把 v4 定义为 v3 的直接替代。适合谁显卡 ≥12GB、追求相似度与情感表达的人。代价两点。一是显存门槛高于 v2 一代二是训练集平均音质较低时效果不佳且合成音色更偏向参考音频本身而不是整个训练集的风格。v3 的 24kHz 原生输出部分人会觉得偏闷项目内置了 24k→48k 音频超分见 tools/audio_sr.py来缓解但 v4 直接根治。性能新代v2Pro 与 v2ProPlus 合并看相对上一代的关键变化音质超过 v4硬件成本和推理速度回到 v2 水平。v2ProPlus 的 RTF推理耗时/音频时长实测4060Ti 约 0.028、4090 约 0.014合成 1400 词约 4 分钟只需 3.36 秒。适合谁直播、实时 TTS、对延迟敏感的场景它也保留了 v1/v2 同族的特性即对平均音质一般的训练集更友好。代价比 v2 略占显存音色风格属于 v2 家族贴合训练集整体如果你依赖 v3/v4 那种贴参考音频的效果需要心理预期上的切换。流式推理入口在 GPT_SoVITS/stream_v2pro.py。一张表横向对比五个版本维度v1v2v3v4v2Pro / Plus语种支持中/英/日韩/粤同 v2同 v2同 v2输出采样率32kHz32kHz24kHz可超分48kHz32kHz显存门槛低低高LoRA 约 8GB 起高中比 v2 略高音色跟随对象训练集整体训练集整体偏参考音频偏参考音频训练集整体低质量语料容忍度尚可较好不推荐不推荐较好预训练权重目录s2G488k.pthgsv-v2final-pretrained/s2Gv3.pthgsv-v4-pretrained/v2Pro/训练入口也按代际分开v1/v2 走 GPT_SoVITS/s2_train.pyv3/v4 走 GPT_SoVITS/s2_train_v3.pyLoRA 训练见 GPT_SoVITS/s2_train_v3_lora.py服务端部署时 v3/v4 可用 GPT_SoVITS/export_torch_script_v3v4.py 导出 TorchScript。避坑清单坑点—原因—对策v2 训的模型放到 v4 上跑不了原因GPT/SoVITS 权重按版本分目录存放SoVITS_weights、_v2、_v3、_v4、_v2Pro、_v2ProPlus映射逻辑见 config.py互不通用。 对策换版本就重新训练底模预训练权重可以复用不用重下全部资产。8GB 显存做 v3 全量训练直接爆显存原因全量微调约需 14GB。 对策走 LoRA 路线官方支持 8GB 显存完成这是 v3 系列对低显存声音克隆选型最友好的入口。v3 听感比 v4 闷原因v3 原生只出 24kHz高频信息被砍掉。 对策能升 v4 就升短期可用项目内置的 24k→48k 超分过渡。分不清下载的预训练权重属于哪个版本原因文件名没有版本号前缀。 对策对照上表最后一行或看推理默认配置 GPT_SoVITS/TTS_infer_pack/TTS.py推理参数模板在 GPT_SoVITS/configs/tts_infer.yaml。默认推荐与切换提醒默认推荐直接上 v2ProPlus——音质超 v4、速度回到 v2 水平除非你的训练集音质很高且显卡 ≥12GB那选 v4或者机器实在紧张那选 v2。最后提醒一个容易翻车的点各版本模型文件隔离存放跨版本不通用切换版本意味着重新训练而 v1 需要显式启动python webui.py v1不带参数进入的默认是 v2 及以上版本入口是 webui.py。各代完整演进细节可查阅官方文档 docs/cn/README.md。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表