
三大基准深度解读Raon-OpenTTS-1B凭什么以1.78% WER登顶零样本TTS榜单【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1BRaon-OpenTTS-1B 是一款完全开源开放权重 开放数据的 10 亿参数零样本 TTS文字转语音模型。它在三大基准中以 1.78% 的 WER词错误率和 0.749 的说话人相似度领跑开源阵营性能比肩用数百万小时私有数据训练的闭源 SOTA。本文带你逐张榜单拆解并讲清它凭什么这么强。一、30秒入门什么是零样本 TTS一句话理解给几秒钟的参考人声模型就能立刻用这个人的音色朗读任意文本无需任何训练。零样本声音克隆模型从参考音频中直接学会目标音色换个句子照样说得像WER词错误率合成语音念错的词占比越低越好相当于朗读准确率考试SIM说话人相似度生成语音与参考语音的音色接近度越高越好。这两个指标一起回答核心问题读得准不准像不像那个人二、Seed-TTS-Eval1.78% WER开源模型第一 Seed-TTS-Eval 是目前公认的零样本 TTS 标准考卷。关键成绩如下完整数据见 README.md模型参数量WER越低越好SIM越高越好人类参考-2.140.734Qwen3-TTS1.7B1.460.715Raon-OpenTTS-1B1.0B1.780.749VoxCPM0.5B1.980.730F5-TTS0.3B2.040.671Raon-OpenTTS-0.3B0.3B1.950.687三个看点WER 1.78% 位列全部开源数据模型第一仅次于 Qwen3-TTS1.46%明显领先 F5-TTS 同门2.04%与 VoxCPM1.98%SIM 0.749 超越所有开源模型仅与闭源标杆 Seed-TTS0.762相差一线小一号的 0.3B 版本也有 1.95% WER说明这套开放数据的质量足够稳定。三、CV3-Eval难例集 3.92% WER4项指标拿下3个第一 CV3-Eval 更刁钻——它的 CV3-Hard-EN 子集专门用高难度内容给模型上压力模型CV3-EN WERHard-EN WERHard SIMHard DNSMOSRaon-OpenTTS-1B3.926.150.7753.85Qwen3-TTS4.527.890.6663.87VoxCPM5.246.440.6703.78CosyVoice 34.9610.770.7403.98CosyVoice 26.2710.280.7103.95难例集 WER6.15% 全场第一比 CosyVoice 310.77%低 43%音色相似度 0.775大幅领先第二名 0.740感知质量 DNSMOS 3.85 与头部模型基本持平。越难的题分数越高——这就是登顶的底气。四、Raon-OpenTTS-Eval嘈杂环境 2.81%综合最稳 这是 KRAFTON 自建的真实世界压力测试覆盖 Clean / Noisy / Wild / Expressive 四大声学场景12 个数据集、6000 组参考音频文本配对专治参考音频带噪音、带情绪这类棘手情况模型Clean WERNoisy WERWild WERExpr. WER综合 WER综合 SIMRaon-OpenTTS-1B1.443.515.612.772.810.695CosyVoice 32.533.698.315.494.430.647VoxCPM2.243.4243.832.669.480.642Qwen3-TTS3.384.6079.145.8117.590.626F5-TTS2.173.82136.033.4625.080.542重点看 Wild野外/无控制一列F5-TTS 的 WER 飙到 136%而 Raon-OpenTTS-1B 稳在 5.61%。12 个分项中拿下 9 项第一——这是跨声学条件稳健最硬的证据。五、凭什么这么强三个核心原因 510K 小时开放训练数据训练自 Raon-OpenTTS-Core 数据集从 615K 小时、11 个英文语音数据集的 Pool 中用 DNSMOS 音质 WER VAD 三重排名筛选而来。吃得好是第一前提。F5-TTS 的 DiT 架构1B 参数的 Diffusion Transformer扩散 Transformer 流匹配核心超参如 dim1408、depth28、heads24 等记录在 config.yaml 中在零样本语音合成上效率出色。大规模训练48 张 NVIDIA B200 GPU、520K 更新步数、AdamW 优化器峰值学习率 1e-4、50K 步预热、线性衰减对应的权重文件即 model_520000.pt520K 步检查点。六、模型文件速览 文件说明model_520000.pt1B 参数模型权重520K 步检查点config.yaml模型架构与音频参数16kHz、80 通道 mel 谱、HiFi-GAN 声码器vocab.txt文本分词器词表README.md项目说明、听觉演示与完整基准数据⚠️许可提醒模型以 CC BY-NC 4.0 协议发布仅限非商业用途。七、总结 ✅准确率Seed-TTS-Eval WER 1.78%开源模型第一克隆度三大基准综合 SIM 第一CV3-Hard 音色相似度 0.775 大幅领先鲁棒性Raon-OpenTTS-Eval 综合 WER 2.81%嘈杂/野外环境依然第一全开放权重与 510K 小时训练数据均公开可复现 TTS 研究。如果你正在找一个拿来就能用的零样本语音合成方案Raon-OpenTTS-1B 是当下最稳的开源选择之一。【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考