
这项由字节跳动ByteDance与浙江大学联合开展的研究以arXiv预印本形式发布于2026年8月3日论文编号为arXiv:2608.02023v1研究方向归属于音频与语音处理领域eess.AS有兴趣深入了解的读者可通过该编号查阅完整论文。考虑这样一个场景你是一名动画制作人手里有一个刚创作出来的角色——一个傲娇的冰雪女王。这个角色从未真实存在过没有任何录音但你需要让她开口说话声音要冷冽、低沉、带着一股审视感而且背景还得有风声和水滴声烘托出古典庭院的氛围。过去你需要召集配音演员、音效师、混音师分头工作最后再费力地把所有音轨拼合在一起还要祈祷音效的时机、响度和语气能恰好吻合。现在字节跳动的研究团队提出了一套新方案用一段自然语言描述把这一切都说清楚让一个AI模型从零开始直接输出一段完整的、带着庭院风声和水声的冰雪女王独白音频。这个模型叫做SwanTale。SwanTale的诞生背景正是当下AI配音技术的一道深刻缺口。现有的语音克隆系统虽然已经相当成熟——只需几秒钟的参考录音就能让AI模仿该说话人的声线——但这套路径有一个先天限制你得先有一段真实录音才能开始。对于动画、游戏、短剧、广告这类创作场景而言很多时候你面对的是一个从未存在过的角色根本没有录音可以参考。与此同时即便是那些支持用文字指令描述声音风格的现有系统它们几乎清一色只能生成纯粹的说话声环境音效和背景音乐必须由另外的管线单独生成最后再由人工拼接而人工拼接带来的时机偏差、响度不协调、音场感不一致等问题往往让最终效果大打折扣。SwanTale要解决的正是这道多重障碍构成的难题而它选择的方式是把所有事情交给同一个模型统一完成——同一时刻、同一个生成过程说话声、背景音效、环境音场一起出来。一、一份详细的剧本说明书SwanData-Caption数据工程任何AI系统的能力边界都由它所见过的训练数据决定。SwanTale面临的第一个挑战就是现有的语音数据集根本没办法告诉模型这段话应该出现在一个古典庭院里背景有风声和水滴声说话人是个冷漠的年轻女性台词本身要带着审视的语气。普通的语音数据集只有录音和文字转录最多加个说话人标签远远达不到这种精细程度。研究团队因此构建了一套名为SwanData-Caption的数据处理流程可以理解为一套把普通录音资料转化成精细剧本说明书的工厂。这套工厂分四道主要工序。第一道工序叫做覆盖设计核心任务是保证训练素材足够多样。团队从内部的短剧、动画、广告、播客等媒体风格音频中抽取了大量真实素材涵盖了各种说话人密度、录音环境、角色风格和声场条件。然而单靠真实素材有一个问题有些罕见类型的声音现实中出现得太少模型见得太少自然就学不好。为此团队额外合成了三类补充数据老年人语音因为现有数据集里老年说话人严重不足、超短话语从单个词到简短句子覆盖了大量实际应用中常见的极短语音场景、以及发音挑战性文本主要是中文的多音字、专有名词、品牌名、中英混用句子——这类文本对人类听众极为敏感但现有数据的标注往往不准确。这三类合成数据各10万条由一个专门针对发音精度调校的语音合成教师模型生成并通过pypinyin工具对中文注音进行专项处理以确保合成出来的目标发音确实正确。第二道工序叫SwanData-Speech预处理负责把原始媒体音频梳理成干净的、可供标注的语音片段。具体做法是先用Ultimate Vocal Remover工具把人声和背景声分离用分离出的干净人声做说话人区分、语音识别和时间对齐同时保留含有完整环境声场和音效的原始音频供后续标注使用。说话人区分采用3D-Speaker工具箱语音识别用了Seed-ASR 2.0并用SenseVoice做二次发音核验。值得一提的是团队在标点处理上做了一个刻意的设计选择不信任ASR工具输出的标点因为ASR的标点是根据语义预测的不反映实际停顿而他们希望最终标注里的标点既要符合语义比如感叹号、问号又要和实际停顿位置一致因此把由AI加标点和用时间对齐结果校正标点这两步分开执行。第三道工序是标注也是整套流程里最核心的一环。团队用Seed2.0 Lite这个大语言模型作为自动标注引擎输入是目标音频加上去掉标点的语音识别文本输出是一个结构化的三段式说明。第一段叫Environment环境描述场景地点、声场特征、录音空间、混响、背景音乐以及任何持续性的背景音效比如咖啡馆里稳定的人声嘈杂和厨房声响。第二段叫Speakers说话人列出所有实际出声的角色每个角色的描述包括感知性别、年龄范围、角色身份如果从声音和台词能判断、稳定音色、咬字习惯、响度倾向、语速、口音和惯常风格。第三段叫Content内容是一个按时间顺序排列的台词加音效描述字段——说话内容用speaker标签包裹本地音效用Audio标签包裹标签之间的文字描述则记录了这段话里的情绪变化、音量变化、停顿、强调、犹豫或打断。为了让标注出来的说话人风格描述足够丰富、真实、有区分度团队专门设计了一个风格-人设库针对动画、短剧/影视剧、广告/数字人三类媒体分别制定了不同的描述规范动画允许使用元气少女、克制的成熟男声这类角色化的声音原型短剧和影视剧则允许借助台词内容来判断角色身份广告和数字人则强调主播类型、声音风格类别和稳定的产品推介式语气。这个库的作用是给标注模型一个软先验防止它只会输出年轻女性声音清亮这类贫乏、千篇一律的描述而是能写出年轻女性重生女主沉静音调偏低语气冷冽这样有区分度的人设。第四道工序是数据精炼分为波形过滤、标注规范化和人工审核三个子步骤。波形过滤使用DNSMOS、SQUIM等客观指标对语音片段做质量筛选PESQ分数低于2.0、STOI低于0.85、SI-SDR低于0、MOS低于2.5的片段直接剔除。标注规范化由一个叫SwanVerifier的轻量级模型来检查性别和年龄标签与实际波形是否吻合并用时间对齐数据校正标点。人工审核环节标注员会核查转录准确性、标注质量、音频质量以及一个更主观的维度——表现力。表现力的评分方式采用组内最佳/最差比较法在一个受控组内抽取四段候选音频让标注员选出最有表现力和最缺乏表现力的各一段不要求对每段给出绝对分数。这种方法比传统的MOS评分每段打1-5分更省力、更可靠因为标注员只需做相对判断不需要在脑子里维护一个全局的分数标准。最终整套流程积累了约7000万条带标注的音频记录。二、模型的声音翻译机SwanVAE音频编码器在介绍SwanTale如何生成音频之前有必要先解释一个背后的技术基础。AI生成音频并不是直接在波形层面工作的——波形每秒有48000个采样点直接处理这么细的粒度计算量大得离谱而且太多细节会干扰模型学习高层次的规律。研究团队设计了一个专门的中间层叫做SwanVAE可以理解为一台声音翻译机它把原始波形翻译成一种更紧凑、更容易被AI理解的声音语言生成过程中的AI只需要操控这种声音语言最后再翻译回波形。SwanVAE把48kHz的单声道音频压缩成每秒25帧、每帧96维的连续向量序列也就是说每40毫秒的音频由一个96维的数字向量来表示。从原始波形到这种压缩表示信息量压缩了约1920倍但研究团队通过精心设计确保了关键的声音特征——音色、音调、节奏、音场感——在这个过程中得到保留。SwanVAE的设计遵循一个编码器保持局部性、解码器承担合成复杂性的不对称原则。编码器端保持轻量、局部每个压缩帧只看周围约0.95秒的波形不跨越太大的时间范围这样可以保证压缩出来的表示稳定、可预测不会因为远处发生的事情而产生干扰。解码器端则配备了一个较重的基于Transformer的变换重采样模块负责从压缩表示重建出高质量波形它可以在相邻帧之间共享上下文处理相位连续性和高频细节。在训练SwanVAE时团队使用了多种监督信号。一方面是传统的重建损失多分辨率复数STFT损失、多频段Mel损失、帧能量损失以及对抗训练多周期判别器、多分辨率判别器、多频段复数STFT判别器三套判别器共同监督确保重建出来的波形听起来真实、细节丰富。另一方面团队还引入了几个对齐辅助目标专门针对压缩向量的分布做整形防止相邻帧之间出现剧烈跳变——因为压缩向量如果变化过于突兀后续的生成模型就很难学会怎么预测它。这些辅助目标包括在压缩向量上跑一个轻量流匹配模型检验当前分布是否容易被流模型预测、用因果预测器预测未来帧鼓励压缩向量的变化规律可预期、以及用多尺度色度分布、频带能量分布等声学特征作为读出目标鼓励压缩向量保留音调和频谱结构信息。所有判别器和辅助预测器在训练结束后全部丢弃推理时只保留编码器和解码器。在横向对比实验中SwanVAE在语音领域的PESQ和MCD指标上优于所有基线在歌唱声领域的PESQ、STOI、MCD上均排名第一在通用音效和音乐领域的ViSQOL指标上也表现最好。换句话说同一个SwanVAE模型——不做任何针对特定领域的微调——能够同时高质量地编解码人声、歌声、音效和音乐这正是后续全模态统一生成的基础。三、统一生成引擎让模型同时理解是谁说和在哪说在SwanVAE提供了高质量的压缩表示之后SwanTale的主干生成模型负责在这个压缩空间里完成实际的生成工作。主干模型采用的是一种叫做流匹配扩散TransformerFlow-matching DiT的架构非自回归生成也就是说它不像写文章那样一个字一个字地往后生成而是同时考虑整段音频从一团随机噪声出发逐步把噪声雕刻成目标音频的压缩表示。这种方式天然避免了逐帧生成中容易出现的重复或漂移问题也更容易保持长段音频中的整体一致性。SwanTale需要同时支持两类任务一类是指令生成instruct只给文字描述没有任何参考录音模型从头创造声音另一类是零样本生成zero-shot给一段参考录音加上台词内容模型克隆参考录音的声线来合成新内容。这两类任务的输入方式不同但研究团队用一套统一的架构同时处理两者两类任务共享同一套文本编码路径区别只在于指令生成时用完整的三段式标注环境说话人内容来驾驭所有声音属性而零样本生成时只用内容标注声线信息改由参考音频提供。文字条件的注入分两条路径。第一条是标注路径用一个Qwen家族的8B文本编码器理解完整标注输出的特征向量通过交叉注意力注入到所有生成Transformer层同时附加一组标签嵌入用来区分文字内容、本地音效描述、环境信息等不同字段给模型提供声学先验。第二条是台词路径将台词文本用CosyVoice 2.0分词器转化为词片段标记经过轻量文本编码器处理后通过时间插值对齐到音频压缩序列的时间轴上与带噪压缩序列拼接输入。说话人轮换标签从结构化标签如、中提取与台词嵌入对齐后注入台词路径。在文字条件之上团队还引入了两个专门的增强机制。第一个叫做奖励条件质量控制。数据处理阶段记录了每段语音的STOI、PESQ、SI-SDR、MOS四个质量分数这些分数被转化成一段质量描述文字比如speech clarity high; noise level high; signal naturalness high; listening quality high附加在完整标注的最前面同时生成一个质量标志low/normal/high/unknown注入模型的全局条件流。训练时这个标志有一定概率被替换成unknown用于无分类器引导推理时则永远设为high相当于永远告诉模型请按最高质量生成。这种做法的巧妙之处在于质量偏低的训练数据不需要丢弃它们以低质量条件标注的形式继续参与训练让模型理解什么是低质量、什么是高质量推理时只需要把条件设为高质量就能引导模型朝好的方向生成不需要任何强化学习或奖励模型。第二个叫做Engram记忆条件来自一篇研究LLM稀疏记忆的工作。在实际标注里很多短语是高频固定搭配比如充满活力的女孩或者火车汽笛声这些短语的含义是稳定的、模式化的纯靠注意力机制去每次重新理解它们既低效又占用了模型处理长程规划的带宽。Engram层的原理类似于一个短语词典它把标注文字的2-gram和3-gram相邻2个或3个词的窗口哈希到多组查找表里把查出来的记忆向量通过一个内容自适应的门控残差更新注入到标注嵌入中。门控的初始偏置设为负值意味着训练开始时记忆路径几乎关闭随着训练推进模型逐渐学会对结构化短语更多依赖记忆、对自由表述的文字更多依赖注意力实现了两种理解机制的自然分工。四、专家分工合作Unified MoE模块一个生成模型要同时处理男声、女声、老人、孩子、背景自然音、短促音效、歌声和音乐这些内容的声学结构差异极大——人声需要精确的词汇对齐和稳定的身份感环境音需要平稳持续本地音效需要尖锐短促歌声需要准确的音高轮廓音乐需要和声结构。如果用完全相同的一套网络权重同等处理所有这些内容不同类型的声学模式就会抢占同一批参数互相干扰。研究团队的解决方案是在生成Transformer的每隔一层替换成一个统一专家混合层Unified MoE让模型能够根据当前处理的是哪种音频内容动态调用不同的专科处理器。Unified MoE内部有三类专家任务共享专家Task-shared experts在整个音频样本范围内激活用来编码任务级别的稳定先验——比如指令生成任务和零样本任务在如何响应标注描述上有根本性的不同路由音频专家Routed audio experts在每一帧独立路由专门处理说话人切换、重叠语音、表现力变化、本地音效、复杂背景纹理等需要精细处理的帧空专家Null experts不做任何变换相当于跳过键让稳定背景段或近静音段不浪费额外计算。路由机制采用了动态Top-P策略而非固定每帧激活K个专家的Top-K策略不同帧所需的专家数量是可变的系统根据累积概率阈值动态决定激活多少专家。这个阈值本身会随扩散过程的时间步变化早期时间步噪声较多需要建立全局结构激活更多专家后期时间步细节打磨阶段激活较少专家计算量随之自适应调整。训练初期使用Gumbel-Softmax加噪的方式鼓励路由多样性温度逐步退火后路由变得确定性更强不同专家各自形成功能分工。辅助损失包括路由logit的z-loss防止logit爆炸稳定路由和空专家概率惩罚防止路由始终走空专家导致音频路由分支完全不激活。SwanBench-Caption的消融实验印证了Unified MoE的价值去掉Unified MoE之后指令准确度从3.39跌到3.02声学质量从4.31跌到4.09整体表现力从3.82跌到3.56三项指标全面下滑。把标注编码器从8B扩展到32B后指令准确度进一步提升到3.70说明标注理解能力的天花板仍有提升空间。五、循序渐进的训练课程学习即便有了精良的数据和架构训练一个要同时处理这么多任务的模型依然充满风险——一旦在早期阶段把所有任务同时推进模型很可能什么都学不好。研究团队采用了课程学习的策略把训练分成四个由简到繁的阶段每个阶段有明确的学习目标。第一阶段是零样本基础模型训练。在SwanVAE的压缩空间里先用单说话人数据和多说话人对话数据两说话人拼接训练一个纯粹的语音克隆模型参考录音以50%的概率随机丢弃让模型同时学会有参考时克隆声线和无参考时自由生成两种模式。这一步的目标是让模型先建立起稳定的语音生成先验再去接受更复杂的控制信号。第二阶段是在干净语音数据上做密集标注适配此时Unified MoE层还没有启用模型以密集全参数激活的形式学习从标注到语音的映射先把基础的性别、年龄、情绪等属性控制学稳同时把合成的老年语音、超短语音、发音挑战数据掺入训练补齐覆盖缺口。第三阶段引入完整的SwanData-Caption语料同时激活Unified MoE层让模型接触到语音之外的环境音效、本地音效和更广泛的说话人风格。密集阶段学到的参数初始化了专家共享路径路由专家则从头开始学习各自的特化功能。第四阶段用前面数据精炼步骤筛选出的高表现力、高质量子集做监督微调把模型的输出品质拉到更高水准为后续的奖励引导强化训练做铺垫。六、奖励引导的矫正训练GRPO后训练监督训练的四个阶段结束后模型已经具备了相当宽泛的能力但在一些高频出错点上仍然不够稳定主要包括三类问题发音错误尤其是中文多音字和品牌名、生成不稳定边界能量过大、波形异常、以及指令中描述的说话人属性与实际生成不一致。研究团队选择用Flow-GRPO基于流匹配的组相对策略优化来针对性地矫正这三类问题。这里的核心思路是对同一个条件输入一次性采样8条候选音频用多个客观评分函数打分取相对排名而非绝对分数作为优化信号。用相对排名而非绝对分数的好处在于不同提示词的难度差异极大绝对分数放在一起没有可比性但同一条提示词下的8个候选之间的相对优劣是稳定可信的。奖励函数覆盖了五类信号音素准确率奖励检验音素序列中的替换、删除、插入错误、音素长度一致性奖励专门针对删除和插入错误、标点感知停顿奖励检查停顿是否出现在标点位置且时长合理、音频边界能量奖励惩罚开头和结尾能量过大、波形质量奖励惩罚削波、异常峰值、高频伪影。第六个奖励根据任务类型切换指令生成任务用SwanVerifier预测性别和年龄检查是否与标注一致零样本生成任务改用ECAPA-TDNN说话人编码器计算生成音频与参考录音的说话人相似度。此外还有一个乘法发音门控如果某候选的发音错误过于严重整体奖励会被一个小于1的系数整体打折确保发音准确性不被其他维度的得分稀释。为了防止针对单说话人语音的后训练把模型之前学会的多说话人和音效能力遗忘掉团队采用了两道保护机制。一是冻结一份监督微调阶段结束时的参考策略每次策略更新都通过KL散度惩罚项约束与参考策略的偏离程度。二是在每个GRPO更新块之后额外插入一批来自原始多说话人和含音效数据的监督重放批次用标准流匹配损失做一遍前向更新让模型在接受针对性矫正的同时不断被提醒多说话人和音效任务依然重要。七、实验验证各评测任务的成绩研究团队在三类任务上进行了系统评估。零样本语音生成任务使用SwanBench-Speech评测集包含单人独白和双人对话两个场景考察音色一致性、混响一致性、音质保真度、内容准确率、韵律连贯性以及表现力两个维度。SwanTale在两个场景下的音色一致性均排名第一独白0.95对话0.94在表现力的两个子维度表现丰富度和表现层次感上也均排名第一对话场景的韵律连贯性同样第一。对比之前的SwanVoice基础模型SwanTale在独白场景下把内容错误率从0.172降到0.086表现丰富度从3.81提升到3.90表现层次感从3.62提升到3.70改进幅度明显。值得注意的是音质保真度和内容准确率方面FishSpeech独白场景和SoulX-Podcast对话场景仍优于SwanTale说明在这两项指标上仍有改进空间。指令生成任务使用InstructTTSEval评测集包含12项明确声学属性控制APS、自由风格描述DSD、角色扮演RP三个子任务分中英文报告。SwanTale在中文APS86.1上排名第一在英文APS上与最强基线并列第一84.2在中文DSD上排名第二80.1。英文DSD和两个语言的RP任务是相对薄弱环节研究团队分析认为RP任务需要把职业、角色原型或场景映射到可识别的发声风格现有标注数据中覆盖的长尾角色类型还不够丰富是未来需要重点改进的方向。声学质量和表现力的综合评估在SwanBench-Scene评测集上进行180条指令涵盖广告、短剧、通用场景三类由五名专业标注员从整体表现力、韵律自然度、音频饱满度、场景契合度四个维度打分。SwanTale在三个场景下的总体MOS均排名第一广告3.88、短剧4.45、通用场景4.34综合4.22四个子维度也全面领先。在音频编解码层面SwanVAE在语音PESQ4.1683和MCD0.9638上优于所有基线在歌唱声PESQ、STOI、MCD上均排名第一在通用音效ViSQOL4.1269上也是最优在音乐ViSQOL4.2623上仅次于EnCodec。用同一个未做领域微调的检查点覆盖这四类音频并在其中多类上排名第一或第二印证了SwanVAE设计上的跨模态通用性。说到底SwanTale这套系统做到的事情从整体上看有点像一个全能录音棚总监——它不仅能克隆任何你提供的声音还能凭空创造一个从未存在过的声音同时把说话声、背景音效、环境音场打包在一起用同一个生成过程输出。背后的支撑是一套从数据工程到模型架构到训练策略都经过系统设计的技术栈SwanData-Caption提供了精细的多层次标注数据SwanVAE打造了跨模态通用的声音压缩表示Engram记忆和奖励条件质量控制增强了标注理解和质量引导Unified MoE让模型为不同声学内容动态分配计算资源课程学习保证了从简到繁的稳健习得GRPO后训练针对性地修复了高频错误。当然研究团队在结论部分也坦诚地列出了目前仍未解决的难题复杂背景音乐的生成尤其是需要随情绪变化在音乐类型之间切换的情景依然困难超过两分钟的含音效长形式指令生成仍然有挑战精准的本地风格控制——包括指定说话人的连续情绪变化、强调节奏的精确控制、停顿和音效的时机——在数据标注和模型设计两端都有待突破。此外团队也提到把音频生成与音频编辑修改已有音频里的内容、声线或情绪统一在一个框架内是一个值得期待的未来方向。对于关心AI语音技术的普通人来说这意味着在不远的将来游戏里的每一个NPC、短剧里的每一个配角、广告里的每一种声调风格或许都可以从一句话描述直接生成不再需要漫长的配音流程。而对于对技术细节感兴趣的读者完整的技术细节、消融实验数据和更多讨论都可以通过论文编号arXiv:2608.02023v1查阅。QAQ1SwanTale和普通语音克隆技术有什么区别A普通语音克隆必须有参考录音才能工作只能复制已有声音且通常只输出纯人声不含背景音效。SwanTale既能在没有任何参考录音的情况下凭文字描述创造全新声音也能进行传统的声音克隆同时能把语音、背景环境音和本地音效统一生成在一段音频里不需要后期拼接。Q2SwanTale在哪些场景下效果最好、哪些还有明显不足ASwanTale在指令控制的声音属性性别、年龄、音色等和表现力方面表现最突出在广告、短剧、通用场景下的综合声学质量评测里排名第一。相对薄弱的方向是根据职业或角色原型推断声音风格即角色扮演类指令以及内容准确率和音质保真度——在这两项上FishSpeech等专门优化的系统仍优于SwanTale。Q3SwanData-Caption里的表现力是怎么衡量的ASwanData-Caption采用组内最佳/最差比较法评估表现力在一个受控组内抽取四段候选音频让标注员选出最有表现力和最缺乏表现力的各一段不要求打绝对分数。这比传统的MOS打分每段1-5分更可靠因为标注员只需在同组内做相对比较不需要维护一个全局一致的绝对评分标准减少了个人标准差异导致的评分偏差。