ByteDance Seed 发布 SeedRealtime
SeedRealtime 免费上线豆包 App,支持语音和视频对话,对标 GPT Live。
事件全貌
字节跳动 Seed 团队于 2026 年 8 月 5 日发布音视频全双工大模型 SeedRealtime,采用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。端到端评测显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少一半。该模型已在豆包 App 全量上线,用户更新至最新版本后可在对话框选择“打电话”体验,标志着音视频全双工技术的首次规模化落地。
最新报道补充,SeedRealtime 免费上线,支持语音和视频对话,可同时看、听、说,对标 GPT Live。此外,模型将轮次切换内化到模型内部,取代外部语音活动检测器,但未发布技术报告、参数规模、开源权重或 API,也未提供基准分数或延迟数据。
本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。
报道时间线
- 字节跳动 Seed 团队发布 SeedRealtime:原生音视频全双工大模型,一个模型同时看、听、说
字节跳动 Seed 团队推出 SeedRealtime,一款原生音视频全双工大模型,将音频、视频和文本统一在一个端到端架构中,并行处理感知、理解、决策与表达,并将轮次切换内化到模型内部,取代外部语音活动检测器。该模型已在豆包 App 中上线,但未发布技术报告、参数规模、开源权重或 API。字节内部人工评估显示,其节奏问题相比级联架构减半,但未提供基准分数或延迟数据。
- 字节跳动发布原生音视频全双工模型 SeedRealtime
字节跳动推出 SeedRealtime,一款原生音视频全双工大语言模型,采用统一架构原生融合音频、视频与文本,支持连续多模态流上的实时交互。该模型已免费上线豆包 App,支持语音和视频对话,可同时看、听、说,对标 GPT Live。
- 字节跳动发布音视频全双工大模型 SeedRealtime,已上线豆包 App
字节跳动 Seed 今日推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持“边看、边听、边说”的实时交互。端到端评测显示,相比级联模型,其音视频对话节奏问题减少一半。该模型已在豆包 App 全量上线,更新至最新版本后可在对话框选择“打电话”体验。
- 字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。