SwanTale 发布统一多说话人语音与音频生成模型
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成
TIMELINE
1 条公开报道 · 官方一手 0 条 · 最新在前报道时间线
- SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成
SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。