STORY · 事件已收束

ByteDance Seed 发布 SeedRealtime

4 个精选信源 · 4 篇报道持续 5最新动态 9天前
最新进展

SeedRealtime 免费上线豆包 App,支持语音和视频对话,对标 GPT Live。

DIGEST

事件全貌

AI 综述 · 更新于 9天前

字节跳动 Seed 团队于 2026 年 8 月 5 日发布音视频全双工大模型 SeedRealtime,采用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。端到端评测显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少一半。该模型已在豆包 App 全量上线,用户更新至最新版本后可在对话框选择“打电话”体验,标志着音视频全双工技术的首次规模化落地。

最新报道补充,SeedRealtime 免费上线,支持语音和视频对话,可同时看、听、说,对标 GPT Live。此外,模型将轮次切换内化到模型内部,取代外部语音活动检测器,但未发布技术报告、参数规模、开源权重或 API,也未提供基准分数或延迟数据。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

TIMELINE

报道时间线

4 条公开报道 · 官方一手 1 条 · 最新在前
  1. 字节跳动 Seed 团队发布 SeedRealtime:原生音视频全双工大模型,一个模型同时看、听、说
    MarkTechPost(RSS)

    字节跳动 Seed 团队推出 SeedRealtime,一款原生音视频全双工大模型,将音频、视频和文本统一在一个端到端架构中,并行处理感知、理解、决策与表达,并将轮次切换内化到模型内部,取代外部语音活动检测器。该模型已在豆包 App 中上线,但未发布技术报告、参数规模、开源权重或 API。字节内部人工评估显示,其节奏问题相比级联架构减半,但未提供基准分数或延迟数据。

  2. 字节跳动发布原生音视频全双工模型 SeedRealtime
    X:Testing Catalog (@testingcatalog)

    字节跳动推出 SeedRealtime,一款原生音视频全双工大语言模型,采用统一架构原生融合音频、视频与文本,支持连续多模态流上的实时交互。该模型已免费上线豆包 App,支持语音和视频对话,可同时看、听、说,对标 GPT Live。

  3. 字节跳动发布音视频全双工大模型 SeedRealtime,已上线豆包 App
    IT之家(RSS)

    字节跳动 Seed 今日推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持“边看、边听、边说”的实时交互。端到端评测显示,相比级联模型,其音视频对话节奏问题减少一半。该模型已在豆包 App 全量上线,更新至最新版本后可在对话框选择“打电话”体验。

  4. 字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
    字节 Seed:Research Feed(网页内嵌数据)官方一手精选

    字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。