# 字节跳动发布 Seed Audio 1.0 音频创作模型：支持精细时间控制与多语种生成

- 来源：IT之家（RSS）
- 发布时间：2026-07-20 14:43
- AIHOT 分数：58
- AIHOT 链接：https://aihot.virxact.com/items/cmrsv0y8e00gkbi244z0gny0k
- 原文链接：https://www.ithome.com/0/979/008.htm

## AI 摘要

字节跳动 Seed 官方今日发布音频创作模型 Seed Audio 1.0，在统一框架下联合建模人声、音效和环境声，支持按时间线精准控制声音进场。该模型支持 20+ 语种音频生成，在文本生成音色能力的 AB 主观评测中表现出显著优势，多数场景音频可用率达 90% 以上。目前 Seed Audio 1.0 已在火山方舟体验中心上线。

## 正文

IT之家 7 月 20 日消息，字节跳动 Seed 官方今日发布了音频创作模型 Seed Audio 1.0，面向完整声音场景，在统一框架下联合建模人声、音效和环境声等多种音频要素，端到端完成影视级音频创作。

官方宣称，声音不再只是画面的补充，而是可以直接参与叙事，在听者脑海中直接形成画面感，做到“听见”即“看见”，其核心能力主要体现在以下方面：

多要素统一编排，支持精细的时间控制：一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声，并可按时间线精准控制声音进场。

音色风格可控，长时稳定：支持文本与参考音频输入，在长音频和多次延长场景下保持角色一致性，同一音色也能自然呈现不同语气和情绪。

多语种自然生成：支持 20+ 语种的音频生成，同一角色声音可依据不同语种的特点，呈现更自然的发音、节奏与表达方式。

据介绍，在文本生成音色能力上，Seed Audio 1.0 在 AB 主观评测中表现出显著优势，可用率和优良率也明显提升。

在多场景音频生成能力上，官方评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示，多数场景中的音频可用率已达到 90% 以上。

针对多语言音频生成能力，在音频自然度上，大部分语言的 MOS 超过 4 分，音质已达到优秀水准；在复杂音频生成的指令遵循上，除越南语外，其余语言的 MOS 均高于 3.5 分，表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

目前，Seed Audio 1.0 已在火山方舟体验中心上线，IT之家附相关链接：
