# 字节跳动发布音视频全双工大模型 SeedRealtime，已上线豆包 App

- 来源：IT之家（RSS）
- 发布时间：2026-08-05 12:12
- AIHOT 分数：70
- AIHOT 链接：https://aihot.virxact.com/items/cmsfmmuis05wxrochspb72rjh
- 原文链接：https://www.ithome.com/0/985/891.htm

## AI 摘要

字节跳动 Seed 今日推出原生音视频全双工大模型 SeedRealtime，用统一架构融合音频、视频与文本，支持“边看、边听、边说”的实时交互。端到端评测显示，相比级联模型，其音视频对话节奏问题减少一半。该模型已在豆包 App 全量上线，更新至最新版本后可在对话框选择“打电话”体验。

## 正文

IT之家 8 月 5 日消息，字节跳动 Seed 今日宣布推出原生音视频全双工大模型 SeedRealtime，走向全模态自然交互。

SeedRealtime 用统一架构原生融合音频、视频与文本，能在连续的多模态信息流上实时交互，带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破：

音视频联合理解：原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义，也能准确理解视觉中的时序指代，让所见、所闻与所说融为一体。

主动的交互能力：具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时（如关键目标出现）主动提醒，并能调用工具融入表达，让交互从被动响应升级为主动协作。

流畅的交互节奏：能够实时感知用户的对话状态与交流节奏，在适当时机自然接话、停顿与回应；同时具备较强的抗干扰能力，能分辨旁人闲聊与背景噪声，不因干扰误触发，保持沟通的流畅连贯。

端到端人工评测结果显示，相比级联模型，SeedRealtime 的音视频对话节奏问题减少了一半 —— 模型对说话时机的把握更加自然，“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少；同时，单次对话能够完整、顺畅交流的概率也有明显提升。

目前，SeedRealtime 已在豆包 App 全量上线，在业界率先实现了音视频全双工技术的规模化落地。将豆包 App 更新至最新版本，在对话框内选择“打电话”，进入视频通话界面体验即可。

IT之家附项目主页地址：

广告声明：文内含有的对外跳转链接（包括不限于超链接、二维码、口令等形式），用于传递更多信息，节省甄选时间，结果仅供参考，IT之家包含外链的文章均包含本声明。
