# 字节跳动发布 Seed Audio 1.0 音频创作模型，统一建模人声与音效实现端到端影视级音频生成

- 来源：字节 Seed：Research Feed（网页内嵌数据）
- 发布时间：2026-07-20 00:00
- AIHOT 分数：79
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmrsopm9r0b7ubiwmtfvpwkxu
- 原文链接：https://seed.bytedance.com/zh/blog/%E4%BB%8E-%E4%BC%9A%E8%AF%B4-%E8%B5%B0%E5%90%91-%E4%BC%9A%E5%88%9B%E4%BD%9C-seed-audio-1-0-%E9%9F%B3%E9%A2%91%E5%88%9B%E4%BD%9C%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83

## 精选理由

字节这次发布的 Seed Audio 1.0 不是又一个 TTS 模型，它把台词、音效、氛围统一编排，并支持百毫秒级时间线控制，对做视频和出海内容的团队是个立刻能用的创作升级。

## AI 摘要

字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0，在统一框架下联合建模人声、音效和环境声，支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线，多数场景音频可用率达 90% 以上，多语言音频自然度 MOS 超 4 分。

## 正文

对音频创作者而言，生成单一音频要素并不困难，真正困难的是让台词、音效等各类声音在同一场景中自然配合，服务于叙事和情绪表达。长期以来，这类创作往往依赖多个模型分别生成，再通过人工拼接、对齐和混音完成，不仅流程冗长，也难以兼顾整体完成度与控制精度。

今天，我们很高兴向你介绍音频创作模型 Seed Audio 1.0，它面向完整声音场景，在统一框架下联合建模人声、音效和环境声等多种音频要素，端到端完成影视级音频创作。声音不再只是画面的补充，而是可以直接参与叙事，在听者脑海中直接形成画面感，做到 “听见” 即 “看见”。

其核心能力主要体现在以下方面：

多要素统一编排，支持精细的时间控制：一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声，并可按时间线精准控制声音进场。

音色风格可控，长时稳定：支持文本与参考音频输入，在长音频和多次延长场景下保持角色一致性，同一音色也能自然呈现不同语气和情绪。

多语种自然生成：支持 20+ 语种的音频生成，同一角色声音可依据不同语种的特点，呈现更自然的发音、节奏与表达方式。

目前，Seed Audio 1.0 已在火山方舟体验中心上线，欢迎大家体验，用声音表达创意。

项目主页：

https://seed.bytedance.com/seed_audio1_0

体验入口：

https://ark.volcengine.com/region:cn-beijing/experience/voice?_vtm_=a441938.b28928.0_0.0_0.0.242_7661095862207497779&model=doubao-seed-audio-1-0

从拼接生成到完整声音场景生成

过去，完整音频内容的生产通常依赖多环节拼接。要打破这种级联方式，实现完整声音场景的生成，模型至少需要跨越三个门槛：

兼顾多类声音的细节保留。不同类型音频对表征的要求并不相同：语音看重清晰度和韵律，环境声则要求空间氛围持续稳定。模型需具备足够强的声学细节建模能力。

理解并生成完整声音场景。一段完整音频里，各音频要素间存在时间关系、情绪关系和声学互动，彼此关联、相互影响，模型要理解的是整个声音场景。

遵循多种指令控制。模型不仅要有生成质量，还要能够服从文本、参考音频、时间轴和角色设定等多种条件，使声音在合适的时间、以合适的方式出现。

Seed Audio 1.0 的核心思路，是将不同的音频要素放在统一框架下理解与生成，学习更复杂的联合分布。为此，我们训练了一个通用声学编码器，将各类音频要素视为同一声音场景中的组成部分，映射到统一的声学表征中，而非将多类音频作为独立任务编码。

基于这种统一建模方式，模型能够更自然地组织角色语气、背景氛围和声音节奏，让输出更接近一段完整作品，而不是一组拼接起来的素材。这也是我们更愿意将 Seed Audio 1.0 称为 “音频创作模型” 的原因。

Seed Audio 1.0 可生成兼具角色互动、情绪推进和氛围营造的复杂音频作品，支持专题叙事、剧情对话、主播互动等典型场景。

视频 · 前往原文观看

在真实创作环境中，声音出现的时机同样关键。它会直接影响节奏推进、情绪表达，以及一段内容能否真正成立。

Seed Audio 1.0 能先将创作意图拆解成结构化时间线，明确角色、台词、情绪和音效的进入时机，从而控制不同声音何时出现、如何衔接，以及怎样更自然地服务剧情。

基于此，Seed Audio 1.0 支持精准时间控制生成，创作者可以在 prompt 中指定角色台词的时间安排，当前时间控制支持 100ms 间隔精度。对于视频配音、视频翻配、广告片等场景，这项能力尤其关键。

视频 · 前往原文观看

音色立得住、接得上、演得开

Seed Audio 1.0 支持零样本音频生成。创作者既可以直接用文字描述目标声音，也可以结合参考音频进一步控制生成结果，而无需为每一种声音单独训练模型。

对真实创作来说，这意味着在前期尚未明确最终声音方案时，创作者可以先快速试出方向，再围绕更合适的音色与表达继续细化，从而减少反复试音和后期返工的成本。

视频 · 前往原文观看

与此同时，在长音频创作场景中，有声书、播客、长剧集和多人对话都要求角色声音前后一致，一旦出现明显音色变化，听众很快就会出戏。传统制作中，这通常需要配音演员长时间连续录制，或者依赖后期反复比对和修正。

针对这一问题，Seed Audio 1.0 支持基于参考音频进行延展生成，当前单次可生成约 2 分钟音频，并可在此基础上继续延长，同时保持角色音色与表达方式一致。

视频 · 前往原文观看

不过，稳定并不意味着表达单一。Seed Audio 1.0 在保持角色辨识度的同时，也支持同一音色自然呈现不同情绪、场景和表达方式。它支持“单音色、多角色”能力，同一音色可以通过差异化演绎塑造不同人物，从而拓展配音、叙事类内容和创意音频的创作空间。

视频 · 前往原文观看

多语种生成，声音表达更地道

多语种创作，不只是内容翻译，而是让声音的节奏、重音、停顿与情绪都更符合目标语言的表达方式。

Seed Audio 1.0 支持同一音色在多种语言中的自然迁移，并已覆盖 20+ 语种，包括中文、英文、日语、韩语、西班牙语、印尼语、德语、法语、泰语、越南语等。

对于出海内容、游戏本地化、品牌广告、多语种播客和短视频创作来说，这意味着一个创意不必在每个语言市场重新制作，而可以基于同一角色或音色设定，高效地扩展出多语言版本。

视频 · 前往原文观看

评测结果

为了更全面地验证 Seed Audio 1.0 在真实创作任务中的表现，我们从文本生成音色、多场景创作和多语种生成三个维度进行了评估。

在文本生成音色能力上，Seed Audio 1.0 在 AB 主观评测中表现出显著优势，可用率和优良率也明显提升。

Seed Audio 1.0 在文本到音色任务上与其他模型的主观评测结果

在多场景音频生成能力上，我们进一步评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示，多数场景中的音频可用率已达到 90% 以上。

Seed Audio 1.0 按场景拆分的条件音频到音频生成评测

针对多语言音频生成能力，我们从指令遵循和音频自然度两个维度进行了人工评测。结果显示，在音频自然度上，大部分语言的 MOS 超过 4 分，音质已达到优秀水准；复杂音频生成的指令遵循能力，除越南语外，其余语言的 MOS 均高于 3.5 分，表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

Seed Audio 1.0 在 “文本生成音频” 任务上的效果

写在最后

从“会说”到“会创作”，Seed Audio 1.0 迈出了重要一步。

以 Seed Audio 1.0 为起点，我们希望进一步拓展模型在真实创作流程中的能力边界，通过模型框架创新支持视频参考等更多模态输入，并满足长音频、分轨等更复杂的音频生成需求。同时，我们也将探索把 Seed Audio 与可控翻译结合起来，提升模型在多语种场景下对内容表达和时长约束的控制能力。

未来，我们希望音频生成朝着更自然、更可控、更贴近创作流程的方向继续演进，让创作者轻松将脑海中的声音变成可听见的作品。
