ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

VoiceCraft 上手指南:3 秒参考音频完成零样本语音克隆、语音编辑与 TTS

VoiceCraft 上手指南:3 秒参考音频完成零样本语音克隆、语音编辑与 TTS VoiceCraft 上手指南3 秒参考音频完成零样本语音克隆、语音编辑与 TTS【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraftVoiceCraft 是一个开源的零样本语音编辑与文本转语音TTS项目用 3 秒参考音频克隆一个未见过的声音也能对任意录音做替换一个词、插入一句话、删除一段话这三种操作。新手可以直接在 Colab 在线试用有 GPU 的开发者可以用 Docker 在本地跑起来。这篇文章带你走通从运行、原理到调参的完整路径并说清楚它的边界条件。先跑起来三种方式从在线到本地Colab零安装官方 notebook 内置完整示例适合先试用看效果Docker 镜像一键启动带齐依赖的 Jupyter 环境适合本地没有 Python 环境的人Windows 用start-jupyter.bat本地 conda自己装依赖最灵活适合二次开发和训练微调。有 Docker 的话三条命令拿到官方示例git clone https://gitcode.com/GitHub_Trending/vo/VoiceCraft cd VoiceCraft docker build --tag voicecraft . ./start-jupyter.sh启动后在浏览器打开docker logs jupyter里显示的地址逐个 cell 跑 inference_tts.ipynb 即可。它到底能做什么三种模式看一个真实编辑例子核心思路是token infilling令牌填充先用 codec 把音频压缩成离散 token 序列1 秒音频约 50 个 token共 4 层码本然后填空——像完形填空一样模型根据上下文补出你想改的那部分内容的 token。gradio_app.py 界面提供三种模式零样本 TTS所谓零样本指模型训练时从没听过这个人的声音。它取参考音频前 3.6 秒当声纹样本用这个音色朗读任意文本语音编辑在原音频上框定一段、给出新文本支持替换词、插入句、删除短语。仓库根目录的 RealEdit.txt 是项目附带的真实编辑测试集每条都是真实录音里的改词记录例如把 dropped in on that calligraphy class 改成 stopped by that calligraphy class只动两个词长文本 TTS文本按句切分逐句生成某一句不满意可以单独重跑。demo/ 目录自带 3 段参考音频示例可直接拿来测试。十分钟看懂原理音频怎么变成音素和 token理解代码只需跟住这条数据流文本侧data/tokenizer.py 用 espeak 把文本转成音素序列音素是发音的最小单位如英文 phone 拆成 /f/ 和 /oʊn/ 两个音频侧Encodec 编码器4 码本 × 2048 码、56M 参数把 16kHz 音频变成 token主模型models/voicecraft.py 是 16 层 Transformerd_model2048推理时编辑走inference()TTS 走inference_tts()采样参数直接暴露给你。项目更新日志明确写了采样从 topp1 换成 topk40 后编辑和 TTS 效果都明显改善。不确定就别动默认值。调参数4 个真正影响输出的开关跑 tts_demo.py 不带参数就是官方示例换成自己的音频只需改两个参数python3 tts_demo.py -m giga330M_TTSEnhanced \ -oa ./demo/pam.wav -tt 你要合成的文本实用调参建议均来自项目注释cut_off_sec参考音频秒数默认 3.6官方注释说 3 秒通常够3~6 秒更好sample_batch_size模型一次生成多个候选、取最短的一条出现长静音或异常拖音就调大stop_repetition压制重复的静音 token生成里有长静音就从 3 降到 2 或 1kvcache设 0 省显存但更慢830M 模型 OOM 就换 330M。知道边界16 秒上限与另外几件事长度限制prompt 生成音频总长不能超过 16 秒因为训练数据丢弃了更长的句子长内容必须靠长文本模式逐句处理转录准确性是前提编辑时原始转写必须和音频对得上可以自行提供也可让界面用 WhisperX 自动转写官方原话说得很直白——转写不准会直接导致 TTS 或编辑出错语言训练数据是英文 Gigaspeech有声书、播客、网络视频in the wild 指的是它容忍真实环境的嘈杂录音其他语言需要自己备数据微调许可代码 CC BY-NC-SA 4.0权重 Coqui Public Model License 1.0.0商用权重有限制微调脚本在 z_scripts/ 目录官方建议用 AdamW若数据引入新音素需扩大音素表并单独处理 text_embedding 的加载。想先看效果就打开 Colab 里的 inference_tts.ipynb 用默认 demo 音频跑一遍如果打算把它用进实际产品先把 16 秒上限和许可这两条确认清楚它们会直接决定你的方案怎么设计。【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表