# SwanTale：面向指令与零样本任务的统一多说话人语音与音频生成

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-03 08:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmse4jxrl0d1gro2ewjdbr7n3
- 原文链接：https://arxiv.org/abs/2608.02023

## 精选理由

通过 SwanData-Caption 数据管线和统一模型，让内容创作者能够以自然语言描述生成定制声音，并复用参考音频，减少了动画、游戏等场景中音频合成的碎片化。

## AI 摘要

SwanTale 提出统一的多说话人语音与音频生成模型，同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案，通过清洗、合成覆盖与多级标注解决数据稀缺问题，并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示，SwanTale 在多项零样本与指令指标上领先，并在两项任务的表达力评分中均取得最佳成绩。

## 正文

摘要

语音与音频生成在动画配音、有声剧、电影、广告、游戏、播客和短视频制作中常常不可或缺。在这些场景中，创作者可能需要在没有参考录音的情况下设计声音，用自然语言控制说话人风格，通过环境和音效支持声学场景，并在之后复用所设计的声音。因此，支持面向指令（instruct）和零样本（zero-shot）任务的多说话人语音与音频生成至关重要。指令任务需要环境、说话人风格和细粒度内容的描述，而零样本任务则使用参考音频以及相同的细粒度内容。我们从数据和模型两方面着手解决这些任务。首先，我们提出SwanData-Caption，它对原始语音和音频数据进行清洗，增加有针对性的合成覆盖，并标注多样且准确的多层级描述。然后，我们提出SwanTale，一个支持零样本和指令任务的多说话人表现力语音与音频生成模型。我们引入SwanVAE以支持高质量的多音频模态生成。接着，我们采用奖励条件质量控制（reward-conditioned quality control）和Engram条件化（Engram conditioning），并结合统一MoE（Unified MoE）进行多任务和多音频模态建模。此外，我们使用课程学习和GRPO后训练，让模型逐步学习并强化其能力。实验结果表明，SwanTale在多项关键零样本和指令指标上领先，在这两类任务中都取得了最佳表现力得分，并支持涉及多说话人语音和音频的复杂指令生成。

1 引言

近期，文本转语音（TTS）系统在零样本语音合成方面取得了显著进展。仅凭一段简短的参考音频片段，这些系统就能根据参考音色合成生动的新内容 [chen2024f5, du2024cosyvoice, shen2023naturalspeech, jiang2024mega, huang2022generspeech]。这一能力使得当所需音色已存在于某段录音中时，说话人音色克隆和多说话人语音生成变得切实可行 [zhang2024covomix, ju2025mooncast, zhu2025zipvoice, li2026swanvoice, xie2025fireredtts, zhang2025conan]。然而，媒体创作往往始于相反的情况。在动画配音、广播剧、电影、广告、游戏、播客和短视频制作中，目标说话人可能根本没有参考录音。创作者需要从零开始设计一个音色，指定角色应如何演绎某句台词，并将该台词置于一个会改变表演感知效果的声学场景中；之后，这个设计好的音色可能会通过零样本合成被复用。因此，适用于此类工作流程的现代 TTS 系统应同时支持基于参考音频的零样本任务，以及由自然语言描述控制的指令任务。

在经典的零样本语音合成任务中，输入是语音内容与参考音频的配对。参考音频提供说话人身份。除了语音内容以及（对话任务中的）说话人轮次标签外，近期系统越来越多地使用局部风格描述来控制情感和语速 [chen2026flexivoice, du2025cosyvoice]。相比之下，在指令式语音合成任务中，输入仅是一条文本描述，该描述可能涵盖环境、说话人风格以及细粒度内容。其中，环境包括场景类型、声场或录音空间线索，以及持续的背景音效 [huang2023make, zhu2025asaudio, pan2025spatialeval]。说话人风格不仅包括性别和年龄，还包括人物设定、角色、音色、惯用风格及其他稳定的嗓音特征。细粒度内容涵盖额外局部风格描述中的信息，也可描述局部音效 [zhou2025indextts2, zhang2024tcsinger, guo2025techsinger]。现有的指令式TTS系统已能控制说话人年龄、性别、情感和语速等维度 [lacombe2024parlertts, huang2025instructttseval, chen2026flexivoice, ren2026ovinstructtts, hu2026voicesculptor]。然而，它们中的大多数仍然只生成语音。对于需要环境和局部音效的场景，如果这些成分由下游音频管线生成，那么即使每个成分单独看来都合理，它们的时序、响度、混响和声学质感也可能与语音脱节。现有设计还常常将说话人控制简化为分解后的属性标签，而创作者可能希望用自然语言的人物描述直接映射到某个声音上。最后，现有的指令式TTS系统通常并未设计为在同一模型中保留零样本能力。因此，在同一模型中同时支持长篇幅多说话人零样本生成，以及具备环境、说话人人物设定、细粒度内容和音效的高表现力指令式语音生成，仍然是一个有待解决的问题。

总体而言，该任务面临三大主要挑战。（1）数据稀缺。零样本TTS可以依赖公开语音语料库[zen2019libritts, chen2021gigaspeech, kang2024libriheavy, shi2020aishell, panayotov2015librispeech]，但指令任务所需的多样化、高质量字幕数据要求更丰富的音频覆盖范围和更细致的字幕标注。收集富有表现力的语音数据以及干净的音频数据成本高昂[yang2024realman, zhang2025isdrama, guo2025mrsaudio]，而标注多层级自然语言字幕同样代价不菲[xu2024secap, zhang2024gtsinger, guo2025stars]。（2）任务兼容性。指令样本通过自然语言字幕描述说话人风格，而零样本样本则从参考音频中获取说话人风格。与此同时，两个任务都需要共享细粒度的内容字幕。联合训练必须在保留共享语音建模的同时，防止两条条件路径相互削弱[qwen2026qwen3tts, zhang2025tcsinger]。（3）多音频模态复杂性。我们的任务旨在单个波形中生成富有表现力的语音、通用音频、偶尔的歌声和音乐，同时保持可懂度和说话人身份[yang2023uniaudio, liu2025unimoeaudio, lei2026swansphere]。这些组成部分具有不同的时间结构：语音需要词汇对齐和稳定的身份特征，环境音频应保持稳定，局部音效是瞬态的，而歌声和音乐则需要保持音准[zhang2024stylesinger, li2024robust, zhang2025versatile]。

为了获得如此细粒度的字幕数据，我们构建了SwanData-Caption，这是一个将多样化的以语音为中心的媒体音频转换为多层级、多风格字幕的流水线。其覆盖设计阶段将内部数据与有针对性的合成子集相结合，因此特殊风格（如发音具有挑战性的文本）不会被留待偶然覆盖。SwanData-Speech预处理阶段为每条字幕提供可靠的语音片段和带说话人属性的文本锚点。随后，字幕标注阶段对环境、说话人和细粒度内容字段进行标注，而风格-角色库则极大地丰富了说话人风格的描述和特征。最后，为提高数据质量，数据精炼阶段使用波形过滤和字幕审核来筛选并打磨高质量、富有表现力且标注准确的数据。

在建模方面，我们提出了SwanTale，一个支持零样本和指令任务的多说话人表现力TTS及音频生成模型。为处理多音频模态生成，我们设计了SwanVAE，其架构在降低DiT先验学习负担的同时提升了重建质量。在基于流的Transformer中，我们应用了奖励条件质量控制，该控制无需强化学习即可将推理条件设定为最高质量，并应用了Engram条件化。为支持两种任务并提升跨音频模态的兼容性，我们设计了带有任务路由器和音频路由器的统一MoE。我们还采用课程学习，从零样本能力过渡到字幕条件生成，再到全混合训练和表现力丰富的高质量监督微调。最后，GRPO后训练提升了发音准确性、生成稳定性以及字幕条件下的说话人属性控制。

在实验部分，我们在SwanBench-Speech [pan2026swanbench]上评估了零样本独白和对话TTS。我们还在InstructTTSEval [huang2025instructttseval]上评估了指令跟随能力，并在SwanBench-Scene上评估了声学质量。我们还构建了SwanBench-Caption，用于支持包含对话语音和音频的异构指令生成。实验结果表明，SwanTale在多项关键的零样本和指令指标上领先，在两个任务中都取得了最佳的表现力得分，并支持涉及多说话人语音和音频的复杂指令生成。

2 数据流水线：SwanData-Caption

SwanTale是基于细粒度字幕而非仅基于转写文本进行训练的。对于复杂的多说话人语音和音频数据，基本的语音转写和说话人轮次是不够的；模型还需要多级别的字幕标注 [kim2019audiocaps]。图1总结了我们的数据处理流水线。以下各小节对应相同的四个模块：覆盖设计、SwanData-Speech预处理、字幕标注和数据精炼。当前的混合数据集包含约7000万条字幕记录。

图1：四阶段SwanData-Caption数据处理流水线概览，包括覆盖设计、SwanData-Speech预处理、字幕标注和数据精炼。

2.1 覆盖设计

媒体风格覆盖。SwanData-Caption基于内部、真实世界、以语音为中心且具有媒体风格的数据构建，涵盖语音、音效和背景音乐。图1展示了该覆盖设计的代表性示例，如短剧、广告和动画。该覆盖范围涵盖不同的说话人密度、录音条件、角色风格、场景位置、声场条件、持续背景效果、细粒度表达变化和局部音效。这种设计支持在必须同时建模语音和场景音频的场景中实现富有表现力的语音生成。

定向合成覆盖。仅依赖真实语料库会使许多稀有场景代表性不足。借鉴 SwanVoice [li2026swanvoice] 的做法，我们引入了三个定向合成子集。我们采用一个音素感知的 TTS 教师模型 [jiang2025megatts] 来生成这些子集，以保证发音准确性，每个子集包含 10 万条话语。(1) 老年人语音：由于现有语音数据集中老年人语音的代表性仍然不足 [chen2025seniortalk]，我们扩充了有限的老年人说话人数据，以提高模型在人口年龄维度上的覆盖度。平均时长约为 10 秒。(2) 中英文短句：这些话语涵盖从单词、人名到标准短句，平均时长为 1.5 秒。许多真实世界的 TTS 应用需要亚秒级的语音内容，该子集增强了模型在此类条件下的稳定性。(3) 高难度发音目标：这些主要是包含多音字、专有名词、品牌名、英文插入语以及中英混说短语的中文文本。对于这些对发音敏感的示例，模型面对的目标文本保持不变，而教师模型的输入则加入发音提示，以确保合成波形反映预期的读法。我们使用 pypinyin [mozillazg2023pypinyin] 处理这些数据。总体而言，人类听者对多音字和品牌名的错误高度敏感，但模型遇到的此类示例很少，且现有标注往往不准确；因此，这一针对性扩充至关重要。平均时长约为 10 秒。

2.2 SwanData-Speech 预处理

此阶段复用 SwanData-Speech 主干 [li2026swanvoice] 来处理以语音为中心的片段，而非纯音频片段。其作用是准备干净的语音片段和可靠的文本锚点。

分离。对于混合媒体音频，我们首先使用 Ultimate Vocal Remover [ultimatevocalremovergui] 分离人声和残余背景流。人声流用于更高质量的说话人分离、转写和对齐。我们保留原始音频，其中包含环境声场和字幕生成所需的本地音效。

说话人分离。说话人分离使用 3D-Speaker 工具包 [chen20253d] 执行，该工具包结合了 VAD、CAM++ 嵌入向量 [wang2023campp] 和聚类算法。对于单说话人数据，我们保留 1 到 60 秒之间的片段。对于多说话人数据，我们允许最长 120 秒的片段，并在可能的情况下要求至少包含两次说话人轮换。说话人分离模型的准确性有限，因此我们仅将其用于粗略的数据分段；真正的说话人区分交由后续的字幕标注完成。

自动语音识别（ASR）使用 Seed-ASR 2.0 [byteplus2026seedasr2] 应用于人声流。我们还使用 SenseVoice ASR [an2024funaudiollm] 进行额外的基于 ASR 的发音检查。具体来说，我们不信任这些 ASR 工具输出的标点符号，因为它们的标点更多依赖于语义而非实际的停顿。

对齐。SwanAligner [li2026swanvoice] 将 ASR 转写文本与人声流对齐，并存储停顿证据供后续后处理使用。该模块与强制对齐和词级时间戳系统相关 [rastorgueva2023nemo, bain2023whisperx, hu2025word]。具体来说，我们让后续的字幕标注根据语义提供合适的标点符号，例如感叹号和问号，然后使用对齐器的结果进行修正，而不是让对齐器从一开始就把所有标点都转换为固定的逗号和句号。

2.3 SwanData-Caption 字幕标注

为了为可控音频生成提供结构化监督，我们开发了 SwanData-Caption，这是一个自动标注流水线，可将原始音频和 ASR 转写文本转换为统一的、细粒度的字幕。

标注输入。我们使用 Seed2.0 Lite [bytedanceseed2026seed2] 作为字幕标注器。标注器接收目标音频、去除标点后的转写文本以及一条标注提示词。在转写文本中，来自多个说话人的 ASR 输出可能会被拼接在一起，因此模型需要完成说话人分割、句子切分，并添加语义上恰当的标点。标注提示词为模型规定了严格的输出格式和行为要求，并为每个待标注数据集提供了量身定制的示例。我们的约束条件包括，例如：说话人 ID 必须连续，Content 中的每个说话人片段必须与 Speakers 中的条目一一对应，并且说话人标签内的 ASR 文本必须保留原始语言。

风格-人设库。我们发现，在没有足够示例的情况下，模型生成的说话人风格极为贫乏，缺乏合理的人设信息，且往往只依赖少数几个孤立的示例。因此，我们设计了一个风格-人设库，作为标注过程中的软先验。具体而言，我们为三个具有强风格先验的媒体类别分别构建了风格矩阵：动画、短剧与影视剧、以及广告/数字人内容。这些矩阵规定了场景触发条件、稳定说话人描述符的优先排序，以及稳定说话人画像与瞬时局部表达之间的边界。动画采用配音风格基线，带有角色化的声音原型；短剧与影视剧允许剧情支撑的角色身份和戏剧化表达；广告/数字人内容则强调人设类型、声音风格类别、音色以及稳定的产品推销式表达。该库不会引入音频中听不到的标签；相反，它引导标注器在 Speakers 字段中描述稳定的说话人特征，而将瞬时的情绪或强调留给 Content 字段。精简后的风格矩阵见附录 6。对于普通数据，我们省略这些风格矩阵，以避免引入无依据的属性。

每条标题包含表 1 中所述的三个字段。场景地点、声场印象、录音空间、混响以及持续存在的背景声或音效归入 Environment（环境）。Speakers（说话人）仅收录实际开口说话的对象，并对其详细的说话风格进行描述。细粒度的局部风格描述（如情绪）以及局部音效写入 Content（内容）。Content 字段同时支持零样本和指令式 TTS。示例标题如下：

Environment：{一处古朴庭院内景，氛围安静；远处隐约可闻<Audio>风声与屋檐滴水声</Audio>。} Speakers：{说话人 1：年轻女性，重生女主，语气沉稳，音调偏低，声线清冷。} Content：{说话人 1 以冰冷而审视的语气开口：<S1>你欠我的，我要你亲手一口一口吐出来还给我！</S1>}。

媒体内容 · 前往原文查看

表 1：标题标注体系中所用的输出字段定义。

字段 描述

Environment 场景级环境与录音背景，包括地点或场所描述、声场印象、房间或录音空间线索、麦克风特性、混响、背景音乐、人群嘈杂声、交通声、风声、雨声、电流嗡鸣、键盘敲击声、电器噪声、远处脚步声，或其他作为场景底衬的持续背景声或音效。

Speakers 实际开口说话对象的清单。每位说话人按可感知的性别、年龄段、从发声方式中可听出的身份或角色、稳定的音色、吐字清晰度、响度倾向、语速、口音、习惯性风格以及稳定的情绪倾向来描述。

Content 按时间顺序排列的内容字段，以及细粒度的局部风格描述。语音由 <S1> 和 </S1> 等说话人标签包裹；局部音效由 <Audio> 和 </Audio> 包裹。细粒度的局部风格——包括情绪、音量、语速、停顿、强调、迟疑、打断、语码转换以及邻近音效语境的变化——在带标签的片段周围加以描述。

2.4 数据精炼

波形滤波。为了按声学质量筛选语音样本，我们仅对语音数据应用以下波形级标准。候选语音片段首先使用 DNSMOS [reddy2021dnsmos] 以及 torchaudio-SQUIM [kumar2023torchaudiosquim] 的无参考估计进行评分，其中包括与 STOI 和 PESQ 相关的分数 [zezario2020stoi, rix2001pesq]。在默认滤波配置中，如果 PESQ 低于 2.0、STOI 低于 0.85、SI-SDR 低于 0，或 MOS 低于 2.5，则移除该语音样本。时长滤波器将保留的语音片段控制在 1 到 120 秒之间，保留的语音集平均时长约为 10 秒。

字幕规范化会检查说话人特征、标点符号和字幕有效性。SwanVerifier 是一个轻量级的、基于波形的属性模型，详见附录 7，它根据语音流检查性别和年龄段标签，并标记不一致的说话人描述以便移除。标点符号仅对口语内容进行规范化。我们使用 SwanAligner 的对齐数据来规范停顿标记和明显的边界标点。如果原始标点符合停顿要求，我们予以保留；否则，我们将其替换或移除。这样，标注者标注的特殊标点（如感叹号和问号）得以保留，而不是将所有标点都转换为句号和逗号。字幕有效性检查会移除非法的说话人索引、不匹配的说话人片段、缺失的必填字段、未使用的说话人描述，或在去除标点后与转写文本不一致的局部文本。

人工核验。人工审核员负责检查转写准确性、字幕质量、音频质量和表现力。他们纠正 ASR 错误、说话人归属错误、遗漏的本地音效、不准确的环境描述，以及对不可听信息过度解读的字幕。此外，他们还检查客观指标常常遗漏的失败模式，例如人群泄漏、分离伪影，以及密集对话中的说话人混淆。同时，他们还会标注音频质量问题，如背景噪声、吐字不清、严重的词语省略、不自然的口音、电子伪影和可闻的剪辑痕迹。

表现力通过分组式最优–最差比较进行审核。在每个匹配组和任务类型内，我们抽取四个有效候选样本，要求标注者选出表现力最强和最弱的各一个，评判标准包括自然度、情感强度、韵律变化和语境适配性。与 MOS 相比，该方案不要求标注者在不同说话人、内容和任务之间维持全局一致的绝对评分标准。标注者只需在受控组内判断相对极端值，从而减少尺度偏差和校准噪声。与成对 A/B 测试相比，我们的最优–最差比较方法在标注效率上要高得多 [kiritchenko2017bestworst]。

3 方法：SwanTale

本节介绍 SwanTale。我们首先描述 SwanVAE，即 48 kHz 波形-潜变量自编码器。随后介绍基于流的 Transformer，包括内容、字幕、说话人轮次、Engram 条件注入，以及奖励条件化的质量控制。接下来介绍用于多音频模态零样本和指令任务的 Unified MoE，随后是课程训练、GRPO 后训练和推理流程。

图 2：SwanTale 总览。图 (a) 展示 SwanTale 的架构，图 (b) 展示 Unified MoE。在 (a) 中，零样本路径提供参考音频，而两个任务共享文本和字幕。在 (b) 中，任务路由器在样本级别选择专家，而音频路由器在帧级别对音频专家和空专家应用 Top- 路由。

3.1 SwanVAE

SwanTale 在 SwanVAE 产生的连续声学潜变量上运行。设计这一潜空间需要在重建保真度、表征紧凑性以及下游流模型的可学习性之间取得三方平衡。较低的潜变量速率会缩短用于长时生成所使用的序列，但这也要求每个潜变量帧携带更多声学信息。编码精细的波形细节可以改善重建效果，但由此产生的潜变量分布可能变得更难让流模型预测。SwanVAE 将 48 kHz 单声道音频表示为 25 Hz 下的 96 维潜变量。编码路径采用局部抗混叠卷积编码器和高斯 VAE 瓶颈，大部分波形合成能力被放置在解码器侧的 Transformer 重采样块中，该模块改编自 SAME [parker2026same]。SwanVAE 有意被限制为仅进行局部声学建模，更长距离的序列建模由下游 DiT 处理。图 3 总结了 SwanVAE 的架构以及用于塑造其后验均值的仅训练目标。

图 3：SwanVAE 概览。(a) 抗混叠卷积编码器、高斯变分瓶颈和局部 Transformer 解码器。(b) 通过流匹配和因果潜变量预测实现生成对齐。(c) 能量、多尺度色度以及多频段能量读数，并带有波形派生目标。解码器接收后验样本，而对齐目标在 SwanVAE 训练阶段仅作用于后验均值，在推理时不进入下游生成器。

3.1.1 架构

解码器。解码器采用 SAME [parker2026same] 中引入的解码器侧 Transformer 重采样块（TRB）。每个潜变量向量被投影到解码器宽度，并与六个可学习的输出 token 交错排列。一个局部双向 Transformer 处理合并后的序列，之后每个输出 token 被投影为一个 320 样本的波形片段。与一个潜变量帧相关联的六个输出片段覆盖样本，即 40 毫秒的音频。自注意力在投影之前将相邻的潜变量 token 与输出 token 耦合，因此相邻的波形片段在共享上下文中被重建，尽管在训练和推理期间它们在最终波形输出处无重叠地拼接在一起。

这种不对称分配反映了每条路径的角色。编码器决定了 SwanTale 所看到的潜变量目标的时间支撑和统计特性，因此每个降采样阶段都保留显式的低通操作，且编码上下文保持局部性。一旦潜变量序列形成，解码器可以混合相邻帧，并将更多容量用于波形合成。其局部上下文支持相位连续性、片段边界、瞬态结构和高频细节。

感受野设计。我们刻意保持 SwanVAE 的时间上下文有界。卷积编码器将每个潜变量与局部波形邻域绑定，而解码器使用局部注意力来协调相邻片段之间的波形细节。在当前配置下，编码器覆盖约 0.95 秒的波形，端到端的理论依赖跨度约为 3.23 秒。下游 DiT 随后在整个潜变量序列上运行，以建模超出该局部声学上下文、跨越完整生成序列的依赖关系。

3.1.2 重建与对抗训练

我们在从训练录音中随机采样的固定时长波形片段上训练 SwanVAE。这使得模型能够接触到长录音的不同局部区域，同时保持训练上下文与 SwanVAE 的局部角色一致。与 EnCodec [defossez2022encodec] 中使用的即时源混合类似，我们随机混合成对的片段，并将混合结果同时用作编码器输入和重建目标。这覆盖了重叠的声学源，我们还观察到在潜在插值下解码过渡更加平滑。

SwanVAE 从重参数化的后验样本中重建每个训练波形。重建损失结合了多分辨率复数 STFT 损失、多分辨率多频段 Mel 损失和逐帧能量损失，总结为以下目标函数：

(1)

复数 STFT 损失在多个时频分辨率上比较频谱幅度和相位。多频段 Mel 损失在不同频率范围和分析窗口上提供频谱包络监督，而 则在 40 毫秒潜在网格上匹配逐帧对数能量。我们使用 KL 惩罚将后验正则化到单位高斯分布，采用 。

精细的波形结构在这些回归损失下仍然约束不足。因此，我们训练了三个判别器家族：多周期判别器（MPD）[kong2020hifi]、多分辨率判别器（MRD）[jang2021univnet] 和多频段复数 STFT 判别器（MBCSD）[kumar2023dac]。MPD 对周期性波形模式敏感，而 MRD 在多个 STFT 分辨率下评估时频结构。MBCSD 作用于复数 STFT 的实部和虚部。在每个分辨率下，它将频率轴划分为固定频段，并用独立的卷积堆栈处理每个频段。这提供了在训练期间覆盖高达 24 kHz 频谱的频段特定判别路径。

设 表示判别器家族。在训练期间，我们使用以下波形目标函数优化生成器：

(2)

其中控制着每个判别器族对对抗性贡献的大小。特征匹配是基于它们对真实音频和重建音频的中间激活计算得出的。所有判别器在训练结束后都会被丢弃，因此在推理时不会给 SwanVAE 解码带来任何额外成本。

3.1.3 潜在对齐目标

波形目标约束了重建信号，但在后验均值中声学信息的排列方式上仍留有相当大的自由度。在 25 Hz 的潜在采样率下，精细的波形细节可能通过相邻帧之间的急剧变化来承载，这增加了下游流模型的负担。关于图像和视频自编码器的相关研究也表明，过高的高频潜在成分与更困难的扩散建模相关 [skorokhodov2025diffusability]。因此，SwanVAE 在训练期间将几种弱对齐目标应用于后验均值，作为辅助引导。

生成对齐。遵循 SAME [parker2026same] 的方法，我们使用标准的流匹配目标在潜在序列上联合训练一个轻量级的无条件预测器。该预测器以其完整的训练损失进行优化，而从该目标传递到编码器的梯度则被单独缩放并保持较小。这提供了一个直接信号，表明当前的潜在分布能被流网络建模的难易程度，同时又不允许辅助预测器主导波形重建。

我们还训练了一个因果预测器，用于根据前文上下文估计未来的潜在补丁（latent patches）。未来预测在语音表示学习中已得到充分验证 [oord2018representation, chung2019apc]，而潜在域预测编码也已被用于消除神经语音编解码器中的时间冗余 [jiang2023latent]。在 SwanVAE 中，该预测器直接作用于连续的均值后验补丁，并且只向编码器提供微弱的来自目标端的梯度。因此，预测残差衡量的是无法从近期历史中推断出的局部潜在演化部分。与固定的时间差分惩罚相比，学习得到的预测器能够适应局部可预测的变化，同时抑制突变和缺乏结构的剧烈变化。我们保持编码器端梯度较小，以便在联合 SwanVAE 训练过程中，全局潜在几何结构仍主要由重建损失和 KL 正则化主导。

语义与声学读出器。遵循 SAME [parker2026same] 中的语义回归目标，轻量级回归器从每个潜在帧预测八度特定的多尺度色度分布。此处，语义对齐指的是局部音频上下文中具有感知意义的结构，包括以潜在帧尺度表示的音高类别与和声组织。

另外两个读出器从每个潜在帧预测归一化帧能量以及各频带间的相对能量分布。为了增加有效带宽的变化，我们偶尔会将 48 kHz 的训练片段降采样到较低的采样率，再重新采样回 48 kHz。这样既保持了波形接口不变，又让编码器接触到具有不同可用频谱范围的信号。多频带能量读出器促使潜在表示保留这些差异。例如，由 24 kHz 音频派生出的 48 kHz 录音通常在 12 kHz 以上几乎没有能量。由于频带能量目标在各频带间进行了归一化，它描述的是频谱分配情况，与整体响度无关。

重建解码器持续接收重参数化后的样本，而对齐目标则作用于后验均值。训练完成后，SwanTale 使用全局归一化的后验均值作为其确定性的声学目标。所有辅助预测器和读出头均被丢弃。

3.2 基于流的 Transformer

继 SwanVoice [li2026swanvoice] 之后，SwanTale 训练了一个以流匹配为骨干的非因果扩散 Transformer，以避免自回归系统中常见的重复和其他不稳定问题，同时保留局部音频效果和环境声景的完整性。具体而言，SwanTale 将两个任务的输入映射到潜在音频轨迹上，如图 2(a) 所示。对于这两个任务，零样本样本使用内容描述来控制局部风格，并使用参考音频来控制全局声学信息；而指令样本则使用完整描述来控制所有信息。去噪器是非因果的，因为这些控制在整个音频序列中相互交互。为实现这一接口，SwanTale 结合了描述、文本和说话人条件以实现语义对齐，奖励条件质量控制以实现全局声学偏好，Engram 条件以处理重复出现的描述模式，以及流匹配 DiT 骨干以实现条件生成。

通用指令生成系统通常使用共享分词器对描述和文本进行编码，并依赖语言模型骨干（通常继承自具有强语言理解能力的预训练大语言模型 [yang2025qwen3]）来进行指令理解和生成 [zhang2025mimoaudio, qwen2026qwen3tts]。由于 SwanTale 使用 DiT 骨干，我们需要在不过度增加模型负担的情况下，保持词汇准确性并增强描述理解能力。因此，条件堆栈将描述级控制与文本对齐分离开来。

字幕分支使用 Qwen 系列文本编码器 [bai2023qwen] 来理解字幕并将其编码为嵌入向量，这些嵌入向量通过交叉注意力注入到所有 DiT 层中。此外，我们还添加了一组与字幕嵌入长度对齐的标签嵌入。不同的嵌入用于区分语音内容、局部音效描述、环境信息和其他描述，从而提供声学先验信息并减轻交叉注意力的学习负担。

语音内容使用 CosyVoice 2.0 分词器 [du2024cosyvoice] 进行分词，生成的 token 由轻量级 Transformer 文本编码器处理。与 SwanVoice [li2026swanvoice] 中采用的填充 token 扩展不同，SwanTale 通过将文本编码器隐藏状态插值到音频潜变量时间线上，再与加噪潜变量流拼接，从而对该分支进行长度归一化。这使得即使边界文本比潜变量序列更长，也能正常进行训练和生成。说话人轮次嵌入源自结构化说话人标签，与文本嵌入对齐，并注入到文本路径中。

奖励条件质量控制。在预处理阶段，SwanData-Caption 为第 2 节中描述的 STOI、PESQ、SI-SDR 和 MOS 相关指标标注质量分数。数据流水线会过滤掉极低质量的样本，但剩余数据仍涵盖不同的质量水平，而我们希望生成的语音尽可能高质量。因此，我们添加了显式的质量字幕和质量标志，使模型能够识别数据质量并将其用作可控信号。当四个分数均可用时，SwanTale 会将它们转换为简短的质量字幕，并在内容字段之前将其附加到全局字幕中。具体来说，实现的质量字幕模板为：

质量：语音清晰度 { STOI 等级 }；噪声水平 { SI-SDR 等级 }；信号自然度 { PESQ 等级 }；听感质量 { MOS 等级 }。

质量分数也会映射到质量标志中。在训练期间，该标志可以在 dropout 下被未知值替换，以支持无分类器引导；在推理时，我们使用高质量字幕和标志，将生成偏向更清晰、更自然的语音。

这使得 SwanTale 成为一种奖励条件策略 [kumar2019rewardconditioned]。四个波形质量分数作为奖励，作为条件的一部分提供，而不是被优化对抗，因此模型学习每个质量级别在声学上是如何实现的；在推理时，奖励被固定为其最大值，生成始终以最高质量被请求。与显式优化质量奖励相比，这不需要 rollout、不需要循环中的奖励模型，也不需要额外的采样。它还使每个保留的样本对训练都有用：中等质量的数据仍然有助于覆盖说话人、场景和音效，其质量级别被标记而不是丢弃，从而在整个数据混合中保留其贡献。

Engram 条件化。在真实字幕中，许多模式在样本间重复出现，具有稳定且独特的含义，例如“一个充满活力的女孩”这样的人设描述，或“火车汽笛声”这样的常见音效。纯注意力可以学习这些模式，但它还必须处理长距离的声学规划。为了减轻这一负担，并使固定的字幕模式即使在长字幕中也能被识别，SwanTale 在字幕分支中添加了一个 Engram 记忆层 [cheng2026conditionalmemory]。Engram 将固定模式识别与更广泛的声学规划分开，而无需引入另一个完整的语言编码器。具体来说，在字幕编码器输出被投影后，它也会被 Engram 处理，并作为记忆更新加回去。由此产生的字幕表示随后被用作交叉注意力上下文。

对于字幕 token 序列和顺序集，以位置 为中心的 -gram 窗口为

(3)

原始公式使用后缀窗口，因为自回归主干无法看到其右侧上下文；这里的字幕分支是非因果的，因此我们改用居中窗口。记忆模块将每个窗口哈希到各头专属的表中，并拼接所有检索到的槽位：

（4）

我们设定 。在读出前进行拼接，使得单对投影能够对各阶进行相互权衡，而不是强制每个阶贡献相等。给定投影后的字幕嵌入 ，SwanTale 通过门控残差更新注入该记忆：

（5）

此处， 为模型维度。门控由两个分支实例化，它们共享表 和 ，同时保持各自的 ，其门控输出取平均。可学习的偏置初始化为负值，因此记忆路径在训练初期几乎关闭，随后逐渐打开。点积使门控在每条字幕内具有内容依赖性，使模型能够对结构化标记更强烈地使用 Engram，而对自由形式的自然语言使用较弱。通过这种方式，记忆成为字幕条件堆栈的一部分，并增强模型对固定模式短语的理解。

Flow-matching DiT 主干。SwanTale 基于非因果 flow-matching DiT 架构 [li2026swanvoice] 构建，并有三处新增：Engram 增强的字幕交叉注意力、奖励条件质量控制，以及 Unified MoE 前馈层。每个块包含潜时间线上的自注意力、Engram 增强字幕 token 上的交叉注意力，以及 Unified MoE 前馈分支。时间步嵌入通过 AdaLN-Zero 适配器 [peebles2023scalable] 调制各块，并使用 RMSNorm 以保障深层 Transformer 的稳定优化 [zhang2019root]。质量标志嵌入被添加到与时间步嵌入相同的全局条件流中。

SwanTale 使用单一主干进行联合指令训练和零样本训练。设 表示任务类型， 表示由冻结的 SwanVAE 生成的目标潜序列。两个任务仅在各自的字幕输入和上下文掩码上有所不同：

（6）

这里有一个上下文掩码：指令样本没有提示词上下文，因此将整个潜变量序列作为生成目标；而零样本样本则使用提示帧作为参考上下文，仅生成剩余帧。参照近期非自回归语音生成系统 [lipman2022flow, chen2024f5] 的做法，我们对高斯噪声和时间进行采样，然后仅对任务特定的生成区域添加噪声：

(7)

DiT 接收噪声潜变量、上下文潜变量以及一个学习得到的上下文掩码嵌入，该嵌入用于区分生成帧与参考帧。它基于内容 token、文本描述、说话人轮次以及任务特定的参考上下文来预测速度场：

(8)

训练损失是任务特定生成区域上的掩码均方误差：

(9)

在此公式下，指令样本在整个潜变量轨迹上提供完整的文本描述监督，而零样本样本则提供内容文本描述监督，参考音频不参与损失计算但作为上下文可用。因此，相同的速度参数化和目标函数能够训练出一个统一的骨干网络，同时支持指令跟随生成和提示词条件下的零样本生成。

3.3 统一 MoE

SwanTale 在单一网络内同时处理指令任务和零样本任务，覆盖多说话人表现力语音、通用音频、偶发歌声以及音乐。语音区域必须在建模说话人相关表现力的同时保持内容、韵律和说话人连续性。通用音频涵盖两种形态：环境声形成平滑且持续的结构，而局部音效则是瞬态的，需要锐利的局部声学塑形。歌声增加了持续的基频轮廓，音乐则承载旋律与和声的规律性而不含词汇内容。用相同的密集前馈参数处理所有这些类型，会迫使这些异质声学模式竞争同一组共享权重。

因此，我们在基于流的 Transformer 中引入了 Unified MoE，这是一个由标题条件控制的动态容量稀疏前馈模块，如图 2(b) 所示。它根据生成任务、当前声学状态和扩散时间动态分配模型容量，为复杂区域提供专门的变换，同时控制整体计算量。Unified MoE 建立在稀疏专家 Transformer [fedus2022switch, zoph2022stmoe]、DeepSeek 风格的专家专业化 [dai2024deepseekmoe] 以及无辅助损失的路由偏置 [wang2024auxiliarylossfree] 之上。其路由机制在两个层级上运行。任务路由器选择样本级共享专家，为指令生成和零样本生成捕获稳定的先验知识，而音频路由器则对每个潜在帧的隐藏状态应用动态 Top- 路由，以建模帧级声学变化。音频路由器接收的隐藏状态已经通过了自注意力和标题交叉注意力，因此包含了来自标题、文本流、说话人轮次和参考音频的信息。

专家布局。每隔一个 DiT 前馈层就被替换为动态 Top- MoE-FFN 层。稀疏层之间保留的稠密层提供了稳定的共享路径，而插入的 MoE 层则为异构声学模式增加了容量。每个 MoE-FFN 在每个稀疏层中都包含路由音频专家、任务共享专家和空专家。

这三类专家在不同的粒度层级上运作。任务共享专家编码的是在整个样本中保持稳定的先验信息：指令生成更强调对提示词的遵循以及多个音频事件的组合，而零样本生成则更依赖于提示词与说话人的保持。路由音频专家为说话人变化、重叠语音、表现力变化、局部音效和复杂背景纹理提供基于输入的帧级专业化处理。空专家则充当跳跃路径，不进行额外的前馈变换，从而减少对稳定背景、接近静音区域以及其他无需帧级专业化处理的帧的计算量。

设 表示任务类型。任务路由器选择一组共享专家，该组专家在每个样本的所有稀疏层和帧中重复使用。共享分支定义为

(10)

该任务路由分支注入样本级任务先验，而音频路由分支则旨在对潜在序列上的帧级声学变化进行建模。

潜在与时间条件音频路由。在扩散时间 下，设 表示第 个 DiT 块中帧 在自注意力和标题交叉注意力之后的隐藏状态。DiT 时间嵌入被线性投影并添加到对应的帧表示中：

(11)

音频路由器根据 计算基础路由器 logits：

(12)

其中 将帧表示投影到路由音频专家和空专家的候选空间中。然后我们按如下方式计算专家选择 logits：

(13)

其中 是路由专家的负载校正偏置，在空专家维度上为零。专家集合由 确定，而所选集合内的组合权重则根据 [wang2024auxiliarylossfree] 计算。

对于路由专家 ，设 表示其在路由专家中最近的非空分配比例，目标平均负载为 。我们使用以下连续且裁剪的偏置更新：

(14)

过载专家的选择分数会被降低，而未充分利用的专家则会获得更高的分数。如果某一层没有产生非空分配，则其路由偏置保持不变。

时间感知的专家预算。所需的专家计算量会随扩散时间而变化。不同的去噪阶段对全局结构、说话人与事件排布、音色以及局部声学细节的侧重程度各不相同。我们从时间嵌入中预测一个学习得到的时间相关预算：

（15）

该预算联合控制 Top- 阈值、空专家偏置以及专家容量：

（16）

（17）

（18）

该向量在空专家维度上取值，在路由专家维度上为零。较大的 会产生更高的累积概率阈值、更弱的空路由偏好以及更大的专家容量。较小的 则减少额外的专家变换，并在同一去噪阶段将更多计算转向任务共享路径和空路径。

基于退火 Gumbel 混合的动态 Top- 路由。各帧所需的专家数量差异很大。稳定的背景和接近静音的区域通常只需要很少的额外变换，而说话人切换、环境声场以及叠加的全局音频事件则可能受益于多个专家。固定 Top- 路由为每一帧分配相同数量的专家，无法适应这种变化。因此，统一 MoE 采用动态 Top- 路由。

在训练期间，我们首先为所有路由音频专家和空专家采样 Gumbel 噪声：

（19）

随后，根据偏置调整后的选择 logits 计算 Gumbel-Softmax 选择分布：

（20）

对于每一帧，候选专家按 降序排列，选择累积概率达到 的最小前缀作为 。

Gumbel 温度在优化步骤 上逐步退火：

（21）

遵循 Gumbel-Softmax 退火策略 [jang2016categorical]，训练初期较高的温度会产生更平滑的路由分布，并鼓励在更多专家组合上进行探索。随着温度逐渐降低，分布变得更加尖锐，专家逐渐形成各自明确的分工，从而避免在优化早期过早集中于单一专家。

使用相同的 Gumbel 扰动，混合权重由基础路由器 logits 计算得出，然后在所选专家集合上重新归一化：

（22）

在推理时，Gumbel 噪声被移除。确定性选择分布为

（23）

候选专家根据 排序，累计概率达到 的最小前缀被选为 。对应的混合权重为

（24）

我们在训练时使用 ，在推理时使用 ，下文统一记为 。令

（25）

表示所选的路由音频专家。音频分支的输出为

（26）

当 时，路由音频分支产生零输出：

（27）

空专家参与所选专家上的归一化，但不产生前馈输出。当空专家与路由音频专家同时被选中时，分配给空专家的概率质量会降低音频分支变换的幅度。如果只选中空专家，则该帧跳过路由音频分支，同时保留任务共享分支和 DiT 块的原始残差路径。

最终的 MoE-FFN 输出将共享分支与路由音频分支按如下方式组合：

（28）

该输出通过 DiT 块的原始残差连接与输入相结合。

容量与辅助目标。专家容量限制了每个路由专家在一个批次内接收的分配数量。如果没有容量控制，大量帧可能集中在单个专家上，从而增加峰值内存使用并削弱功能特化。

令 表示在容量截断之前由 Top- 路由产生的非空帧-专家分配总数。每个路由专家的容量为

（29）

如果某个专家接收的分配数量超过其容量，则仅保留混合权重最大的分配，其余分配作为溢出被丢弃。如果当前层中的所有帧都只选择了空专家，则 ，路由专家调度和容量截断被跳过。训练期间还会进一步应用专家丢弃，以减少对固定专家组合的依赖。

同时，我们使用轻量级辅助目标来应对路由器 logits 不稳定和空路由坍缩问题：

（30）

在训练过程中，路由器 z-loss 直接应用于基础路由器 logits：

(31)

这限制了路由器 logits 的幅度并提升了数值稳定性 [zoph2022stmoe]。空专家惩罚项是基础路由分布分配给空专家的平均概率质量，用于防止被路由的音频分支在整个训练过程中保持不活跃状态。

SwanTale 的完整训练目标定义如下：

(32)

其中 在训练早期被线性退火至一个较小的非零下限。更强的初始辅助信号在训练早期稳定了路由过程，而后续的专业化则由流匹配目标驱动。

总体而言，Unified MoE 结合了任务级共享路径、帧级动态专家路由以及扩散时间感知的计算预算，在统一模型内为异构语音和场景音频提供自适应能力，而无需对每个声学区域施加相同的固定计算量。

3.4 课程学习

在训练 SwanTale 基础模型时，我们采用 SwanVoice 作为零样本基础阶段的参考设计。模型首先从单说话人和多说话人零样本数据中学习说话人条件语音生成，然后适配到基于文本描述的条件指令生成。这一顺序很重要，因为文本描述条件引入了更长的上下文、文本描述的说话人属性、环境描述以及局部音频效果。在语音先验足够稳定之前引入所有这些条件，会使对齐和条件建模都变得更加困难 [bengio2009curriculum]。

1) 零样本基座模型训练。在第一阶段，我们在 SwanVAE 潜空间中训练一个零样本基座模型。训练方案遵循 SwanVoice 预训练设置，面向单说话人和多说话人语音，仅使用转写文本和可选的参考音频作为条件。这保留了零样本推理所需的参考音频通路，同时又不让生成完全依赖于参考信号。我们首先在内部单说话人零样本数据上进行训练。随后引入包含一至四位说话人的拼接语音，以及真实的一至四位说话人对话数据，并启用说话人轮次编码以发展多说话人对话生成能力。在整个阶段中，参考音频以 50% 的概率被丢弃，使模型同时接触参考条件生成和无参考生成两种模式。

2) 基于干净语音的密集描述适配。接下来，我们在带有丰富且可靠属性标注的干净语音数据上训练一个密集 SwanTale 模型。在此阶段，统一 MoE 层被替换为标准密集前馈层。目标是先教会模型理解简单指令（如性别、年龄和情绪），再引入稀疏路由。具有一致说话人级和话语级属性的干净双语语音，使模型能够从转写条件过渡到描述条件，同时保持可懂度、说话人身份和对齐质量。我们还加入了第 2 节中描述的目标合成子集，在全量描述混合数据训练之前，提升对老年说话人、短话语和发音挑战场景的覆盖。在此阶段，每个样本以 70% 的概率作为指令任务训练，以 30% 的概率作为零样本任务训练。

3) 全量字幕混合训练。在稠密模型习得稳定的字幕条件语音生成能力后，我们将训练数据扩展至第 2 节所述的全量 SwanData-Caption 语料库，并在基于流的 Transformer 架构中引入 Unified MoE。该阶段让模型接触语音、环境音频、局部音效以及更广泛的说话人角色。稠密参数初始化共享变换路径，而路由专家则在全量数据混合中学习针对说话人变化、环境以及全局和局部音效的专门变换。

4) 高表现力、高质量 SFT。全量字幕混合提供了广泛的覆盖范围，但大规模混合数据集也包含许多质量中等或表现力有限的样本。因此，我们继续在数据精炼阶段筛选出的高表现力、高质量子集上进行监督微调。该子集中的样本必须同时满足自动波形质量阈值，以及第 2 节所述的基于分组最优–最劣比较的人工偏好审核。由此得到的更窄数据分布，在奖励引导的后训练之前进一步提升了表现力生成能力。

使用稠密前馈层学习字幕锚定，可避免 Unified MoE 必须同时发现条件接口和专家专业化的问题。在获得广泛的多模态覆盖之后，最终的 SFT 仅改变数据侧重，从而允许在 GRPO 之前，在表现力强、质量高的样本上精炼相同的条件和路由结构。因此，该课程将条件对齐、容量扩展和以质量为重点的精炼划分为不同的优化阶段。

3.5 奖励引导的 GRPO 后训练

监督阶段赋予了 SwanTale 广泛的指令遵循和零样本能力，但在发音准确性、生成稳定性以及基于文本描述的音色属性控制方面仍存在反复出现的错误。因此，我们针对这三个目标应用了奖励引导的后训练。后训练数据集包含广告、影视和动画制作中遇到的困难单说话人语音案例，并同时覆盖指令遵循和零样本两种条件。多说话人和含音频的样本通过监督锚点回放（supervised anchor replay）予以保留，而非在针对性后训练期间为其分配不可靠的奖励。

为何选择 GRPO 而非 NFT。DiffusionNFT [zheng2025diffusionnft] 通过将终端奖励映射为前向加噪过程中的正回归目标和隐式负回归目标，提供了一种高效、免似然的奖励优化替代方案。然而，它并未定义 rollout 转移似然或 PPO 风格的似然比。我们则寻求具有逐转移裁剪更新和对策略漂移显式约束的随机轨迹探索。因此，我们使用 Flow-GRPO [liu2025flowgrpo]，在后训练 rollout 期间将确定性流 ODE 转换为保持边际的 SDE，用于每条采样轨迹。

任务特定奖励设计。我们采用组相对策略优化（GRPO）[shao2024deepseekmath]。奖励难度随目标文本和条件的不同而差异显著，因此来自不同提示词的绝对分数不具备直接可比性。GRPO 则在同一条件下采样多个候选样本，并在无需额外价值模型的情况下优化其相对质量。

两个任务共享五项语音侧奖励。音素准确率奖励（phone_core）对识别出的音调序列中的替换、删除和插入错误进行惩罚，而音素时长一致性奖励（phone_len）则专门针对删除和插入错误：

(33)

其中 、 和 分别是替换、删除和插入的次数， 是音素长度。标点感知停顿奖励（pause_punct）用于检查短标点和长标点之后是否在其预期时长范围内出现停顿。音频边界能量奖励（edge_rms）用于惩罚波形首尾 0.2 秒内相对于整个波形过高的 RMS 能量。波形质量奖励（quality）用于惩罚削波、异常峰值、过高的边界能量以及高频伪影。

最终的控制奖励取决于具体任务。对于指令（instruct）任务，SwanVerifier 会根据生成的语音预测年龄和性别，属性奖励则衡量预测结果与完整描述（附录 7）中相应属性的一致性。对于零样本生成，说话人身份由参考音频而非人口统计文本提供；因此，我们将属性奖励替换为说话人相似度，

(34)

其中 是一个冻结的基于 WavLM 的 ECAPA-TDNN 说话人编码器 [chen2022wavlm, desplanques2020ecapa]。所有奖励项在聚合前均校准至 。设 表示任务类型，并选择适用于任务 的奖励项。候选 的总奖励计算如下：

(35)

其中 是一个乘法发音门控，用于降低存在严重发音错误的样本的权重。因此，指令任务和零样本任务共享相同的发音奖励和稳定性奖励，仅在统一的聚合规则下切换说话人控制奖励。

随机流策略。原始采样器遵循确定性 ODE ，其转移分布在初始噪声固定后是退化的。遵循 Flow-GRPO 及其 TTS 适配 [wang2026flowttsgrpo]，我们构建了一个保持边际分布的 SDE

(36)

其中 是维纳过程。在我们的噪声到数据约定 下，修正流（rectified-flow）得分估计和扩散调度定义如下：

(37)

两个端点被截断到最近的内部积分时间以保证数值稳定性。对于连续时间 ，Euler–Maruyama 方法给出高斯转移策略

(38)

其中 。噪声和转移似然仅应用于生成的潜变量区域；参考帧在整个 rollout 过程中保持固定，以实现零样本生成。

分组相对策略优化。对于条件 ，我们使用冻结的行为策略快照，以独立的 SDE 噪声实现来采样轨迹，从而在相同的条件输入下生成一个候选组。然后，我们对每条轨迹生成的最终波形进行评分，并在组内对所得奖励进行归一化，以获得分组相对优势：

(39)

在 rollout 过程中，我们存储每个生成区域的转移及其行为策略对数概率 。当前策略使用相同的 SDE 核重新计算 。高斯对数概率在有效的潜变量元素上取平均，而非求和。求和的对数似然会随生成元素的数量而缩放，因此每个元素的微小差异 就会使 移动十个数量级并使裁剪范围饱和；而逐元素均值可使 保持在 1 附近，并使单个 在不同话语长度之间具有可比性。在 的条件下，裁剪后的目标函数为

(40)

我们直接使用 和 ，并将其共享给轨迹 中的所有转移。 比较的是两条策略在相同记录转移上的表现，而非在裁剪策略更新期间基于重新加噪样本构建的去噪替代项。

能力保持。针对单一说话人的后训练不应抹去在全混合 SFT 阶段学到的多说话人和音频能力。我们采用两项保障措施。首先，冻结的 SFT 参考策略约束每一个 GRPO 转移。由于当前策略与参考策略共享相同的转移方差，它们的 KL 散度具有如下闭式形式：

(41)

这里，对有效潜在元素取平均，与转移对数概率的归一化方式相匹配，从而确保跨话语长度的可迁移性。其次，每个 GRPO 更新块之后都跟随从原始多说话人和含音频 SFT 混合数据中抽取的监督锚定步骤。这些锚定批次使用标准的前向加噪路径和原始的掩码流匹配目标，而非 SDE rollout。行为策略仅在两个更新块都完成后、下一轮 rollout 之前进行刷新。这两个块分别最小化以下目标：

(42)

参考项限制了奖励样本上的策略漂移，而锚定回放则保留了奖励模型覆盖范围之外的能力，包括说话人切换、环境音、音乐和局部音频效果。

3.6 推理流程

SwanTale 对指令生成和零样本生成使用统一的推理流程。对于指令生成，模型接收完整描述文本，并生成完整的潜在序列。对于零样本生成，模型接收包含内容文本和参考音频的内容描述；参考帧构成潜在提示，模型生成未掩码区域。在两种情况下，文本和描述都通过上述条件模块进行编码，说话人轮次标签由<S{id}>标签构建。生成区域以高斯噪声初始化，而零样本设置中的提示帧保持固定作为参考上下文。随后，SwanTale 在任务特定的生成区域上求解流 ODE，并使用 SwanVAE 对生成的潜在轨迹进行解码。

内容和说话人轮次条件决定了每个轮次说什么以及哪个说话人处于活跃状态，而描述、参考和质量条件则控制其余声学属性。单一的引导尺度会将这两组约束耦合在一起。因此，我们使用两阶段分解式无分类器引导（CFG）规则 [ho2022classifierfree]。去噪器在空条件、文本与说话人轮次条件以及任务特定的完整条件下分别进行评估。引导速度为：

(43)

其中引导内容与说话者轮次的一致性，并加入任务特定的完整条件。对于指令生成，完整条件包含完整描述文本和质量标志。对于零样本生成，它包含内容描述文本，并在整个条件化推理轨迹中提供参考上下文。对于这两个任务，三项评估构成一个嵌套的条件层级。从空预测出发，第一层增量控制内容和说话者轮次，第二层增量则在文本条件预测的基础上添加剩余的声学条件。因此，这两个增量分别进行缩放，而无需在指令生成与零样本生成之间改变推理规则。

条件强度和数值分辨率在流轨迹上不必保持均匀[feng2026rectifying]。早期步骤从噪声中建立粗略的语音结构和文本-说话者对齐，而后期步骤则细化局部声学细节。因此，我们采用随时间步变化的引导退火，通过设置 来实现，其中 和 分别是文本或完整条件分支的基础引导权重。这样可以在早期施加更强的条件引导，在接近数据端点时施加较弱的引导。另外，摇摆采样[chen2024f5]将均匀积分网格扭曲为 ，将更多欧拉步分配给轨迹的早期部分。

4 实验

4.1 实现细节

我们在 32 块 A100 GPU 上训练 SwanVAE，使用了约 10 万小时的内部音频数据，涵盖语音、歌唱声、通用音频和音乐。训练采用固定的 3.84 秒波形片段，从较长的录音中随机裁剪，对于较短的录音则按需重复。25% 的裁剪片段应用了波形混合。1% 的裁剪片段通过将其降采样到 8 至 44.1 kHz 的若干标准采样率之一，再重采样回 48 kHz，从而应用有效带宽增强。该模型将 48 kHz 单声道波形转换为 25 Hz 下的 96 维连续潜变量。在训练 SwanTale 之前，SwanVAE 被冻结。全局归一化的后验均值被用作声学训练目标，而生成的潜变量则被反归一化并传递给冻结的解码器以进行波形合成。SwanVAE 包含 4.07 亿个参数，其中编码器 5170 万、变分瓶颈 30 万、解码器 3.55 亿；仅用于训练的判别器和辅助头不计入这些数字。所有 SwanTale 实验均使用最终 96 维模型的 20 万步检查点。

所有有监督的 SwanTale 训练阶段均在 64 块 A100 GPU 上进行。第一阶段按照 SwanVoice 风格的预训练方式，在 2300 万小时单说话人数据和 170 万小时双说话人数据上训练一个 20 亿激活参数的零样本基础模型。随后，我们在 7000 万条干净、属性丰富的语音样本上进行密集字幕适配，训练 2 万步。在此阶段，我们采用 Qwen3.0-Instruct-8B [yang2025qwen3] 作为字幕编码器。接下来，我们在 1000 万条 SwanData-Caption 样本上训练 Unified MoE 全混合模型，训练 1 万步。在字幕混合训练期间，参考音频以 70% 的概率被丢弃，因此训练过程中同时覆盖了无参考指令生成和带参考条件的零样本生成。最终的有监督微调阶段使用包含 100 万条样本、具有高表现力和高质量的子集，训练 4000 步。我们使用 AdamW [loshchilov2019decoupled]，并设置相应超参数。峰值学习率为给定值，最小学习率为给定值。GRPO 后训练使用 8 块 GPU，训练 10 个 epoch。

推理阶段，我们采用第 3 节中两阶段分解的 CFG 规则，分别对文本/说话人分支和全条件分支设置引导权重。同时，我们在所有报告的实验中均使用了第 3 节中所述的随时间步变化的引导退火策略。

4.2 评估指标

SwanVAE。我们在四个音频域上评估重建效果：语音、歌声、通用音频和音乐。每个域包含 1,000 个片段，分别取自 VCTK [yamagishi2019vctk]（语音）、GTSinger [zhang2024gtsinger]（歌声）、FSD50K [fonseca2021fsd50k]（通用音频）以及 MUSDB18-HQ 测试集 [stoter2018sisec]（音乐）。总计 4,000 个评估片段。对于 GTSinger，我们在中文和英文子集上分别计算各项指标，并以等权重对两个分数取平均。我们排除了与训练数据重叠的任何片段。语音和歌声共享发声与音系结构，因此我们对这两个域使用相同的指标集：PESQ [rix2001pesq]、STOI [taal2011algorithm]、Mel 倒谱失真（MCD）[kubichek1993mcd] 和 ViSQOL [chinen2020visqol]。对于通用音频和音乐，我们报告 ViSQOL 和对数谱距离（LSD）[gray1976distance]。

零样本任务。SwanBench-Speech [pan2026swanbench] 提供了与参考音频配对的独白和对话测试用例。音色一致性（Timbre Consistency）的计算方式为：从滑动窗口中提取的 WavLM-TDCNN 说话人嵌入向量 [chen2022wavlm] 之间的平均两两余弦相似度；对于对话，我们分别计算每个说话人的得分，然后对各个说话人的得分取平均。混响一致性（Reverb Consistency）定义为窗口级 SRMR 得分 [falk2010srmr] 的标准差。声音保真度（Sound Fidelity）使用无参考的 SQUIM-PESQ 指标 [kumar2023torchaudiosquim] 进行衡量。内容错误率（Content Error）是中文 CER 和英文 WER 的未加权平均值，在求平均之前先将百分比转换为小数。SpeechJudge [zhang2026speechjudge] 基于停顿、语速和整体韵律一致性来评估韵律连贯性（Prosodic Coherence）。两个表现力指标均由 Gemini 3 Pro [pan2026swanbench, googledeepmind2025gemini3pro] 进行评分。表现力丰富度（Expressive Richness）评估情感共鸣、角色塑造和叙事能力。表现力层次（Expressive Hierarchy）则从整体上评估情感变化、声音动态和场景适配度。

指令任务。InstructTTSEval [huang2025instructttseval] 提供了以自然语言指定说话人属性和表达方式的语音提示词。声学参数指定（APS）测试对 12 个显式声学属性的直接控制。描述性风格指令（DSD）使用对说话风格的自由形式描述。角色扮演（RP）要求模型根据给定的角色或场景推断出合适的嗓音风格。对于这三项任务，我们均报告由自动评判模型 Gemini 2.5 Pro [googledeepmind2025gemini25pro] 计算得出的官方指令遵循准确率。

我们还构建了 SwanBench-Scene 来评估声学质量，这是 InstructTTSEval 未覆盖的部分。它包含 180 条指令式 TTS 指令：60 条广告指令、60 条漫画剧指令和 60 条通用场景指令。标注者从四个维度进行评分：整体表现力、韵律自然度、音频饱满度和场景适配度。每个维度采用 1–5 分制。每个条目由五位专业标注者进行评估。平均 MOS 分按四个维度得分的算术平均值计算。

针对基于指令的硬核语音和音频生成任务，我们构建了 SwanBench-Caption，这是一个聚焦型评估集，包含 64 个案例，涵盖环境音效和局部音效、歌声、背景音乐、多语言语音以及多说话人对话。自动评判模型 gemini-3.5-flash [googledeepmind2026gemini35flash] 从三个维度给出 1 到 5 分的评分。指令准确度衡量生成的音频是否正确实现了所要求的内容、说话人轮次和声音事件。声学质量评估清晰度、自然度和伪影情况。整体表现力评估情感传达、动态变化和场景层面的生动度。

4.3 基线模型

SwanVAE。我们将 SwanVAE 与神经音频编解码器和连续音频自编码器进行比较。为了保持编解码器比较在不同领域间的一致性，我们在全部四个测试集上评估了 DAC [kumar2023dac]、48-kHz 的 EnCodec 模型 [defossez2022encodec] 和 WavTokenizer Large Unify [ji2024wavtokenizer]。随后，我们根据各连续自编码器的预期数据领域将其加入比较。对于语音和歌声，这些模型包括 VoxCPM2 AudioVAE V2 [zhou2026voxcpm2] 和 MegaTTS 3 WaveVAE [jiang2025megatts]。对于通用音频和音乐，我们纳入了 Stable Audio Open 1.0 [evans2025stable] 和 SAME-L [parker2026same]，后者是 Stable Audio 3 [evans2026stable] 中使用的大型 SAME 自编码器。ACE-Step Music-DCAE [gong2025ace] 被纳入用于音乐领域。

零样本任务。我们与带参考音频的开源语音生成系统进行比较。独白基线包括 CosyVoice-2 [du2024cosyvoice]、CosyVoice-3 [du2025cosyvoice]、FishSpeech [fishaudio2024fishspeech]、F5TTS [chen2024f5]、GLM-TTS [cui2025glmtts]、IndexTTS-2 [zhou2025indextts2]、MegaTTS-3 [jiang2025megatts]、SparkTTS [wang2025spark]、VibeVoice [peng2025vibevoice]、ZipVoice [zhu2025zipvoice] 和 SwanVoice [li2026swanvoice]。对话基线包括 FireRedTTS-2 [xie2025fireredtts]、MoonCast [ju2025mooncast]、MOSS-TTSD [mosi_moss_ttsd_2026]、SoulX-Podcast [xie2025soulx]、VibeVoice [peng2025vibevoice]、ZipVoice-Dialog [zhu2025zipvoice] 和 SwanVoice [li2026swanvoice]。

指令任务。我们与具有代表性的开源指令跟随 TTS 系统进行比较：Parler-TTS-large [lyth2024natural]、VoxInstruct [zhou2024voxinstruct]、VoiceSculptor [hu2026voicesculptor]、MiMo-Audio-7B-Instruct [zhang2025mimoaudio]、Qwen3-TTS-12Hz-1.7B-VD [qwen2026qwen3tts]、MOSS-VoiceGenerator [huang2026mossvoicegenerator] 和 VoxCPM2 [zhou2026voxcpm2]。在 SwanBench-Scene 上，我们额外加入了 Seedance 2.0 [teamseedance2026seedance2]，使用相同的输入指令，并从其输出中提取音频部分进行评估。

4.4 SwanVAE 评估

我们报告 SwanVAE 及基线的潜变量配置和重建质量。表 2 总结了各系统的采样率、原生潜变量帧率、潜变量大小和标称速率。表 3 和表 4 报告了上述四个测试集上的重建质量。

媒体内容 · 前往原文查看

表 2：所评估音频自编码器和编解码器的潜变量配置。帧率指下游拼接之前的原生编码器输出。对于连续表示，标称速率假设每个标量为 16 比特（FP16 或 BF16）；对于离散表示，仅计算码本索引，不包括熵编码和辅助信息。

模型 表示方式 采样率 帧率 每帧潜变量 标称码率 ACE-Step Music-DCAE [gong2025ace] 连续 44.1 kHz 10.77 Hz 128 个标量 22.05 kbps VoxCPM2 AudioVAE V2 [zhou2026voxcpm2] 连续 kHz 25 Hz 64 个标量 25.60 kbps Stable Audio Open 1.0 [evans2025stable] 连续 44.1 kHz 21.53 Hz 64 个标量 22.05 kbps SAME-L [parker2026same] 连续 44.1 kHz 10.77 Hz 256 个标量 44.10 kbps MegaTTS 3 WaveVAE [jiang2025megatts] 连续 24 kHz 25 Hz 32 个标量 12.80 kbps DAC [kumar2023dac] RVQ 44.1 kHz 86.13 Hz -bit 索引 7.75 kbps EnCodec [defossez2022encodec] RVQ 48 kHz 150 Hz -bit 索引 24.00 kbps WavTokenizer Large Unify [ji2024wavtokenizer] VQ 24 kHz 40 Hz -bit 索引 0.48 kbps SwanVAE（我们的） 连续 48 kHz 25 Hz 96 个标量 38.40 kbps

SwanVAE 在 25 Hz 下生成 96 维连续潜变量，每个潜变量步长为 40 毫秒。按照表 2 中的 16 位约定，这对应 38.40 kbps 的标称码率；同样的 25 Hz 序列被用作 SwanTale 的声学表示。以下表格在相同协议下，对上述所有音频域在该设置下的重建质量进行评估。

媒体内容 · 前往原文查看

表 3：语音和歌声测试集上的重建质量。加粗和下划线值分别表示各域内对比系统中的最佳和第二佳结果。

模型 PESQ STOI MCD ViSQOL

语音

DAC [kumar2023dac] 4.1178 0.9693 1.1963 4.1585

EnCodec [defossez2022encodec] 3.1872 0.9297 1.5147 3.5035

WavTokenizer Large Unify [ji2024wavtokenizer] 2.1423 0.8428 2.9393 2.3787

VoxCPM2 AudioVAE V2 [zhou2026voxcpm2] 3.9987 0.9690 1.2222 4.0340

MegaTTS 3 WaveVAE [jiang2025megatts] 3.5968 0.9507 1.5130 4.2348

SwanVAE（我们的） 4.1683 0.9680 0.9638 4.1248

歌声

DAC [kumar2023dac] 3.7872 0.8627 1.9293 3.6681

EnCodec [defossez2022encodec] 2.6464 0.8166 2.2392 3.3841

WavTokenizer Large Unify [ji2024wavtokenizer] 1.9226 0.6613 5.1885 1.6018

VoxCPM2 AudioVAE V2 [zhou2026voxcpm2] 3.7088 0.8838 1.9335 3.6734

MegaTTS 3 WaveVAE [jiang2025megatts] 3.5727 0.8620 2.0310 4.0013

SwanVAE（我们的） 3.9821 0.9001 1.5661 3.7085

在语音方面，SwanVAE 取得了最佳的 PESQ 和 MCD 分数，同时在 STOI 和 ViSQOL 上接近最强基线模型。在歌声方面，它在 PESQ、STOI 和 MCD 上排名第一，在 ViSQOL 上排名第二。MCD 结果在两个领域保持一致，这表明尽管两个语音领域的潜在帧率较低，25-Hz 表示仍能很好地保留声学频谱结构。

媒体内容 · 前往原文查看

表 4：通用音频和音乐测试集上的重建质量。粗体和下划线值分别表示各领域内对比系统中的最佳和第二佳结果。

通用音频

模型 ViSQOL LSD

DAC [kumar2023dac] 4.0198 0.9589

EnCodec [defossez2022encodec] 4.1140 0.9761

WavTokenizer Large Unify [ji2024wavtokenizer] 2.8595 1.0967

Stable Audio Open 1.0 [evans2025stable] 4.0355 0.9358

SAME-L [parker2026same] 3.7541 1.0372

SwanVAE（我们的） 4.1269 0.9455

音乐

模型 ViSQOL LSD

DAC [kumar2023dac] 4.1534 0.9196

EnCodec [defossez2022encodec] 4.2976 0.9000

WavTokenizer Large Unify [ji2024wavtokenizer] 2.6968 1.0612

Stable Audio Open 1.0 [evans2025stable] 4.1357 0.9236

SAME-L [parker2026same] 4.0267 0.9210

ACE-Step Music-DCAE [gong2025ace] 4.1756 0.9019

SwanVAE（我们的） 4.2623 0.9172

在通用音频上，SwanVAE 取得了最高的 ViSQOL 分数和第二低的 LSD 分数，仅次于 Stable Audio Open 1.0。在音乐上，EnCodec 在两个指标上均领先，而 SwanVAE 在 ViSQOL 上排名第二，在 LSD 上排名第三。所有四个领域均使用同一个 SwanVAE 检查点，未进行领域特定的模型选择。

4.5 零样本评估

媒体内容 · 前往原文查看

表 5：SwanBench-Speech 上的零样本独白和对话 TTS 结果。除 Content Error 保留三位小数外，所有分数均保留两位小数。粗体和下划线值分别表示各设置内对比系统中的最佳和第二佳结果。

模型 音色 混响 声音保真度 内容错误 SpeechJudge 丰富度 层次感 独白 CosyVoice-2 [du2024cosyvoice] 0.93 2.37 3.58 0.106 2.81 2.02 2.59 CosyVoice-3 [du2025cosyvoice] 0.93 2.73 3.80 0.077 3.26 2.64 2.47 FishSpeech [fishaudio2024fishspeech] 0.93 2.00 4.09 0.066 3.77 2.37 2.90 F5TTS [chen2024f5] 0.92 2.12 2.60 0.085 2.87 2.77 2.97 GLM-TTS [cui2025glmtts] 0.94 1.64 3.90 0.074 3.28 1.57 2.39 IndexTTS-2 [zhou2025indextts2] 0.93 1.77 2.78 0.077 3.63 3.32 2.94 MegaTTS-3 [jiang2025megatts] 0.93 2.07 3.52 0.072 3.22 2.40 3.01 SparkTTS [wang2025spark] 0.92 2.04 3.53 0.314 2.35 2.23 2.22 VibeVoice [peng2025vibevoice] 0.92 2.45 3.47 0.092 3.75 3.42 3.06 ZipVoice [zhu2025zipvoice] 0.89 2.10 3.53 0.213 2.97 2.11 2.05 SwanVoice [li2026swanvoice] 0.93 2.06 3.60 0.172 3.56 3.81 3.62 SwanTale（我们的） 0.95 1.83 3.95 0.086 3.75 3.90 3.70 对话 FireRedTTS-2 [xie2025fireredtts] 0.91 3.54 2.54 0.148 2.93 2.52 2.65 MoonCast [ju2025mooncast] 0.90 3.29 2.60 0.284 2.93 2.42 2.54 MOSS-TTSD [mosi_moss_ttsd_2026] 0.89 3.52 2.83 0.227 2.57 3.04 2.86 SoulX-Podcast [xie2025soulx] 0.92 3.23 3.98 0.101 3.89 2.80 3.15 VibeVoice [peng2025vibevoice] 0.89 2.09 2.75 0.204 3.00 3.09 2.83 ZipVoice-Dialog [zhu2025zipvoice] 0.90 3.49 2.48 0.116 3.46 2.88 2.93 SwanVoice [li2026swanvoice] 0.92 3.02 3.77 0.145 3.70 3.62 3.71 SwanTale（我们的） 0.94 3.21 3.73 0.120 3.92 3.66 3.85

表 5 报告了 SwanBench-Speech 在独白和双人对话零样本 TTS 上的结果。SwanTale 在两种设置下的音色一致性、表达丰富度和表达层次感方面均排名第一，并在对话设置下的 SpeechJudge 上排名第一。这表明添加并过滤表达性数据对模型有益。然而，对比结果也揭示了在内容准确性和音频质量方面仍有改进空间。在独白设置中，FishSpeech 实现了更低的内容错误和更高的声音保真度；在对话设置中，SoulX-Podcast 在所比较的系统中在声音保真度和内容错误方面表现最佳。

此外，SwanTale 始终优于 SwanVoice。在单人独白零样本设定下，SwanTale 将音色一致性提升至 0.95，将内容错误率降至 0.086，并将 SpeechJudge、表现力丰富度和表现力层次分别提升至 3.75、3.90 和 3.70。在双说话人对话零样本设定下，同样的五项指标分别提升至 0.94、0.120、3.92、3.66 和 3.85。这些提升得益于完整的训练方案：除了添加高表现力数据外，我们还使用基于 ASR 的发音检查来筛选用于预训练和监督微调（SFT）的数据，同时基于奖励的质量控制和 GRPO 进一步提升了生成质量。

4.6 指令跟随评估

媒体内容 · 前往原文查看

表 6：InstructTTSEval 上的指令跟随 TTS 结果。除 SwanTale 外，所有模型的结果均取自 VoxCPM2 论文 [zhou2026voxcpm2]。加粗和下划线数值分别表示最佳和次佳结果。

模型 中文（ZH） 英文（EN）

APS DSD RP APS DSD RP

Parler-TTS-large [lyth2024natural] – – – 60.0 45.9 31.2

VoxInstruct [zhou2024voxinstruct] 47.5 52.3 42.6 54.9 57.0 39.3

VoiceSculptor [hu2026voicesculptor] 75.7 64.7 61.5 – – –

MiMo-Audio-7B-Instruct [zhang2025mimoaudio] 75.7 74.3 61.5 80.6 77.6 59.5

Qwen3-TTS-12Hz-1.7B-VD [qwen2026qwen3tts] 85.2 81.1 65.1 82.9 82.4 68.4

MOSS-VoiceGenerator [huang2026mossvoicegenerator] 78.0 80.0 74.0 68.2 82.0 68.7

VoxCPM2 [zhou2026voxcpm2] 85.2 71.5 60.8 84.2 83.2 71.4

SwanTale（我们的模型） 86.1 80.1 64.1 84.2 79.2 63.6

媒体内容 · 前往原文查看

表 7：SwanBench-Scene 上的结果。平均 MOS 是其他四项指标的算术平均值。加粗和下划线数值分别表示最佳和次佳结果。

模型 平均MOS 总体 表现 韵律自然度 音频饱满度 场景适配度 广告 MOSS-VoiceGenerator [huang2026mossvoicegenerator] 3.13 2.89 3.10 3.75 2.76 MiMo-Audio-7B-Instruct [zhang2025mimoaudio] 3.13 2.96 3.17 3.49 2.89 Seedance 2.0 [teamseedance2026seedance2] 3.38 3.25 3.34 3.73 3.22 Qwen3-TTS-12Hz-1.7B-VD [qwen2026qwen3tts] 3.71 3.62 3.73 4.12 3.38 SwanTale（我们的模型） 3.88 3.76 3.82 4.21 3.73 动漫剧 MiMo-Audio-7B-Instruct 3.23 3.06 3.24 3.72 2.89 MOSS-VoiceGenerator 4.06 3.94 4.11 4.33 3.87 Qwen3-TTS-12Hz-1.7B-VD 4.35 4.20 4.35 4.63 4.21 Seedance 2.0 4.35 4.30 4.42 4.45 4.23 SwanTale（我们的模型） 4.45 4.36 4.47 4.60 4.36 通用场景 MiMo-Audio-7B-Instruct 3.28 3.17 3.39 3.49 3.05 MOSS-VoiceGenerator 3.62 3.42 3.65 4.10 3.29 Seedance 2.0 4.14 4.11 4.18 4.23 4.05 Qwen3-TTS-12Hz-1.7B-VD 4.22 4.05 4.18 4.59 4.04 SwanTale（我们的模型） 4.34 4.24 4.30 4.60 4.21 总体 MiMo-Audio-7B-Instruct 3.19 3.04 3.24 3.55 2.93 MOSS-VoiceGenerator 3.48 3.29 3.49 3.98 3.17 Seedance 2.0 3.86 3.78 3.87 4.07 3.73 Qwen3-TTS-12Hz-1.7B-VD 4.09 3.96 4.09 4.45 3.88 SwanTale（我们的模型） 4.22 4.12 4.20 4.47 4.10

InstructTTSEval。如表 6 所示，SwanTale 在显式声学控制上表现最强，在中文描述式指令上表现优异。它在中文 APS 上排名第一（86.1），在英文 APS 上并列第一（84.2），在中文 DSD 上排名第二（80.1）。APS 和 DSD 与我们的字幕数据中使用的详细声学和说话风格描述高度吻合。同时，SwanTale 在每项任务中的中文和英文得分都很接近，显示出跨语言的均衡表现。在跨系统比较中，英文 DSD 的竞争力较弱：多个基线模型从中文到英文有显著提升，而 SwanTale 保持在相近水平。RP 在两种语言中也是短板。它要求模型将职业、角色原型或场景映射为可辨识的声音表演。我们的字幕标注和当前的风格矩阵可能未覆盖足够多的长尾角色模仿风格，限制了对未见角色和场景的泛化能力。因此，提升 RP 需要在实际指令场景中扩展字幕和风格矩阵对角色、职业、角色原型和情境的覆盖范围。

SwanBench-Scene。表 7 总结了 SwanBench-Scene 的结果。SwanTale 在总体平均 MOS（4.22）以及整体表现力（4.12）、韵律自然度（4.20）、音频饱满度（4.47）和场景适配度（4.10）方面均取得最高分。它还在广告（3.88）、漫画剧（4.45）和通用场景（4.34）中获得了最高的平均 MOS。在所有评估系统中，它唯一排名第二的维度得分是漫画剧中的音频饱满度（4.60）。

媒体内容 · 前往原文查看

表 8：SwanBench-Caption 上的结果。所有指标均由 gemini-3.5-flash 按 1–5 分制评分；分数越高越好。32B CE 将默认的 Qwen3.0-Instruct-8B 字幕编码器替换为 Qwen3.0-Instruct-32B [yang2025qwen3]。

设置 指令准确度 声学质量 整体表现力

SwanTale（无 MoE） 3.02 4.09 3.56

SwanTale 3.39 4.31 3.82

SwanTale（使用 32B CE） 3.70 4.34 3.98

SwanBench-Caption。表 8 报告了在 SwanBench-Caption 上的消融实验结果。移除统一 MoE 后，指令准确率从 3.39 降至 3.02，声学质量从 4.31 降至 4.09，整体表现力从 3.82 降至 3.56。三项指标均出现下降，表明统一 MoE 有助于指令实现、声学质量和表现力的提升。将字幕编码器从 8B 扩展到 32B 后，三项分数进一步提升至 3.70、4.34 和 3.98，其中指令准确率的提升幅度最大。

总体而言，三项指令评估展现出互补的优势。SwanTale 在 APS 上领先，并在中文 DSD 上表现强劲，而英文 DSD 和 RP 的竞争力相对较弱。SwanBench-Scene 在多种场景下展现出较高的感知质量，SwanBench-Caption 的消融实验则表明，统一 MoE 和更大的字幕编码器容量在复杂语音与音频指令上带来了增益。

5 结论

本工作提出了 SwanTale，一个面向多说话人语音与音频生成的统一模型，覆盖指令跟随和零样本任务。SwanData-Caption 通过针对性的数据覆盖、语音感知预处理、多层级字幕标注和质量过滤，提供了所需的监督信号。SwanTale 结合了 SwanVAE（一种基于流的 Transformer 架构，具备奖励条件质量控制和 Engram 条件机制）以及统一 MoE，配合课程学习和 GRPO 后训练，逐步将统一生成器适配到字幕和参考音频两种条件模式下。由此得到的模型能够根据自然语言描述设计说话人音色，通过参考音频复用这些音色，并在单一波形中通过统一的生成过程联合生成语音、环境和局部音效。

实验表明，SwanTale 在多项关键零样本和指令跟随指标上处于领先地位。它在零样本和指令任务中均取得了最佳的表现力分数，并支持在同一模型内进行涉及多说话人语音和音频的复杂指令生成。

指令生成和零样本生成目前仍面临若干挑战。首先，复杂的背景音乐生成依然困难，尤其是当音乐需要随不同情绪变化类型或进行过渡时。其次，长篇幅的指令生成仍具挑战性，特别是超过两分钟、包含音效且涉及多个说话人的复杂场景。第三，精确的局部风格控制仍然困难，包括指定说话人的连续情绪变化、对重音和说话节奏的准确控制，以及恰到好处的停顿和音效，这些都对数据标注和模型设计提出了挑战。在生成之外，对现有音频的语音内容、说话人身份和情绪进行编辑是另一个重要问题[pan2026audioediting]。因此，在统一框架内实现音频生成与编辑一体化的模型，是未来研究的一个明确方向。

参考文献

6 字幕风格矩阵

范围说明。以下矩阵浓缩了第 2 节中介绍的三类媒体族的标注指南：动画；短剧与影视剧；广告与数字人内容。源指南具有层级结构：动画从宏观受众和题材趋势细化到角色层面的声音原型，而剧集则通过台词和演绎证据来细化角色身份。广告与数字人标注则将人设和声音风格候选与表现力及行业特定的说话策略相结合。这些矩阵为遵循强烈媒体惯例的片段提供软先验，不用于普通数据。

标注流程。标注人员首先依据场景触发词选择适用的矩阵。只列出实际发声的说话人，按首次发声顺序排列。每条说话人条目以感知性别和年龄段开头，并补充三到五个稳定、可区分的特征：在言语或表达方式支持下的人物角色或身份、稳定的音色，以及习惯性的表达方式。矩阵为这些特征提供候选描述。情绪、语速、音量、停顿、强调、犹豫以及局部音频效果在话语层面的变化，按时间顺序记录在“内容”字段中。每个保留的描述符都必须有录音中相应时间位置的可听证据支撑。

媒体内容 · 前往原文查看

表9：动画风格字幕的浓缩风格矩阵。

维度 浓缩规则

典型触发词 动画、卡通、动漫、配音、角色扮演人声，以及其他遵循角色配音惯例的表达方式的片段。

稳定说话人画像 按顺序描述感知性别、大致年龄、在有用时补充可听的声音原型、稳定音色，以及习惯性表达方式。诸如充满活力的主角、克制沉稳的成熟说话人、或喜剧配角声线等原型，需要有清晰的声音表演证据支撑。

局部表达 在按时间顺序的“内容”字段中记录夸张反应、突发的情绪转变、包袱节奏、喊叫、笑声、犹豫，以及语速、音量或情绪唤起程度的变化。

声学证据 将描述锚定在习惯性音高范围、明亮度、气声感、能量、起音力度、停顿，以及克制或夸张的程度等线索上。

代表性区分 动作导向的片段偏好更大的音量动态、更快的语速和更强的爆发力；爱情题材偏好更细腻的情绪控制、气声和停顿；悬疑题材偏好克制、清晰的表达；历史或宫廷场景偏好正式的措辞和沉稳的表达。

媒体内容 · 前往原文查看

表10：短剧及影视剧风格字幕的浓缩风格矩阵。

维度 浓缩规则

典型触发词 短剧、微短剧、竖屏剧、剧本化短视频、网剧、电影、电视剧，以及其他以对话为主的编排类媒体。

稳定说话人画像 描述感知到的性别、大致年龄，以及由口语对话或发声方式所支撑的角色或社会身份、稳定的音色和习惯性的表达方式。

局部表达 在按时间顺序排列的“内容”字段中，记录打断、冲突、情绪升级、反转、恳求、威胁、命令、犹豫，以及由关系驱动的节奏、响度或语调变化。

声学证据 使用可听见的属性来描述表达方式，例如语速、吐字清晰度、戏剧化着色、有控制的停顿、冷漠、讨好式的表达，以及强度的突然变化。角色身份需要有对话或角色证据来支撑。

代表性区分 示例包括秘书式表达（语速快、清晰、正式）、警卫式表达（平稳、简洁、有力）、谄媚或太监式表达（声音尖细、句尾上扬、措辞恭敬）。

媒体内容 · 前往原文查看

表11：广告与数字人风格字幕的浓缩风格矩阵。

方面 浓缩规则

典型触发条件 广告、商业配音、数字人内容、直播带货、产品推荐、产品种草、营销话术，以及脚本化的促销旁白。

稳定的说话人画像 描述感知到的性别、大致年龄、由言语功能支撑的人物类型、声音风格类别、音色，以及习惯性的产品推销表达方式。主持人、产品推荐人、讲师或服务人员等人设标签需要有口语内容或表达方式的证据来支撑。

局部表达 在按时间顺序排列的“内容”字段中，记录卖点强调、紧迫感、价格或折扣强调、行动号召、提问钩子、建立信任的解释、对话式的软化处理，以及兴奋程度的变化。

声学证据 将描述建立在可听见的属性上，例如友好度、权威感、能量感、技术密度、对话温度、节奏规律性、停顿时机、情绪范围，以及照本宣科式的措辞。合成语音的判断需要有直接的听觉证据。

代表性区分 代表性群体包括商品推荐者和直播主播、健康或教育类讲解者、金融或商务类演讲者，以及服务类角色；与之匹配的风格涵盖从对话式分享、故事叙述到充满活力的推销和结构化讲解等多种类型。

7 SwanVerifier

7.1 动机

Speakers 字段为 SwanTale 提供了稳定、可控的说话人属性。在嘈杂的媒体音频中，自动字幕生成器难以准确判断感知年龄和性别，尤其是面对儿童或老年人语音、角色扮演配音、广告、动画和游戏风格配音时。由于这些标签在整个训练数据中反复出现，系统性错误会造成重复性的错误监督，而非孤立的字幕错误。

SwanVerifier 为这些粗粒度属性提供基于波形的校验。它检验人口统计标签在声学上是否合理，并在波形或预测结果不明确时选择弃权；字幕生成不在其职责范围内。详细的角色人设、角色定位和表达风格仍由字幕标注和人工审核处理，前提是自动证据不足时。

7.2 概述

SwanVerifier 是一个基于预训练 WavLM 编码器 [chen2022wavlm] 构建的轻量级音频标签器。输入波形被重采样至 16 kHz，并编码为帧级语音表示，随后由各属性专用头进行池化，生成话语级预测。在其主要一致性检查中，SwanData-Caption 使用以下两个人口统计属性头：

•

年龄段：儿童、青少年、青年-成人、中年和老年。

•

感知性别：字幕清单中的男性和女性标签。

底层标签器还输出情绪、音高、音高标准差和语速。我们将这些输出视为辅助证据，而非自动进行人口统计修正的依据。短暂的情绪变化、强调、犹豫和场景特定表演仍保留在 Content 中，并在每个保留样本的最终字幕生成和审核环节中进行检查。

7.3 问题设定

设 为包含以下说话人清单的字幕：

其中 Speakers 字段中包含了说话人的规范化描述。为进行验证， 表示归属于该说话人的一段语音片段。仅当 包含单个可在声学上分离的说话人时，才会应用自动人口统计信息核查；存在未解决的重叠、串扰或归属不确定的片段会跳过硬性验证，留待后续审计后再进行任何自动修复。

当 中存在对应的 token 时，令 和 分别表示其规范化年龄和感知性别标签。SwanVerifier 按如下方式估计其类别分布：

并将每个置信度足够高的预测与相应的字幕标签进行比较。缺失的标签不会被推断或插入。因此，SwanVerifier 是一种选择性一致性检查工具，而非完整的说话人画像系统。

7.4 主干编码与预测头

WavLM 将语音片段映射为帧级隐藏状态，

其中 为有效声学帧的数量。对于每个人口统计属性 ，一个注意力池化头形成如下话语级表示：

相应的分类器产生如下输出分布：

独立的预测头使得年龄和性别预测可以分别进行校准和审计。

7.5 训练目标

人口统计预测头使用规范化标签上的交叉熵进行训练：

其中 用于补偿年龄类别不平衡。只有当标签可用时，相应的 项才会被评估。辅助情感头在具有非未知情感标签的样本上进行训练；其余辅助输出仅作为该流程中的次要信号使用。

7.6 训练与适用范围

我们在带有标签的语音数据上微调现有的基于 WavLM 的标注器，这些数据的说话人和话语属性可以映射到验证器的分类体系。没有明确声学主体的样本会被排除在监督式人口统计核查之外。SwanVerifier 是一个内部过滤组件，而非新的标注基准；因此，以下结果描述的是数据流程中使用的验证器，不应被解读为与专用说话人属性系统的对比。

7.7 评估

我们在一个留出的带标注子集上评估最终模型。表 12 报告了话语级准确率；情感准确率仅在带有非“未知”情感标签的样本上计算。

媒体内容 · 前往原文查看

表 12：SwanVerifier 在留出带标注子集上的话语级准确率（%）。

子集 年龄 性别 情感

留出带标注子集 86.11 97.60 92.75

这些结果确立了过滤组件在其留出子集上的运行准确率。它们并不表明每个预测都适合自动修正，因此推理过程还需要基于置信度的弃权机制，并将模糊案例留给人工审核。

7.8 推理流程

在字幕验证期间，SwanVerifier 处理来自语音流的、按说话人归类的片段。只有当某个预测针对该属性的置信度超过阈值时，才会将其与归一化的人口统计 token 进行比较。置信度高的匹配会保持字幕不变；置信度高的不匹配则将该样本标记为需要修复、重新生成字幕或移除。在基于置信度的验证规则下，低置信度预测、未解决的说话人重叠以及缺失的人口统计 token 均不会产生自动决策。

以这种方式限制自动决策，旨在针对系统性的年龄和性别标签错误，而不会将推断出的个人形象、角色身份或瞬时表达方式视为人口统计证据。在整个数据流水线中，字幕级检查和人工听力审核负责处理这些更丰富的属性。
