# 字节 Seed 发布 SeedRealtime 音视频全双工大模型，走向全模态自然交互

- 来源：字节 Seed：Research Feed（网页内嵌数据）
- 发布时间：2026-08-05 00:00
- AIHOT 分数：78
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsfkn6cf03ciroch6tfynepy
- 原文链接：https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92

## 精选理由

SeedRealtime 将音视频感知与表达统一到同一端到端模型中，级联系统常见的说话节奏问题减少了一半，实时场景中能主动提醒并自然停顿，为全模态智能助手交互提供了新的技术路线。

## AI 摘要

字节 Seed 发布 SeedRealtime，用统一架构原生融合音频、视频与文本，实现“边看、边听、边说”的实时交互。相比级联模型，其音视频对话节奏问题减少一半，并已在豆包 App 全量上线，率先实现音视频全双工技术的规模化落地。

## 正文

作为走向全模态交互的关键一步，SeedRealtime 用统一架构原生融合音频、视频与文本，能在连续的多模态信息流上实时交互，带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破：

音视频联合理解： 原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义，也能准确理解视觉中的时序指代，让所见、所闻与所说融为一体。

主动的交互能力： 具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时（如关键目标出现）主动提醒，并能调用工具融入表达，让交互从被动响应升级为主动协作。

流畅的交互节奏： 能够实时感知用户的对话状态与交流节奏，在适当时机自然接话、停顿与回应；同时具备较强的抗干扰能力，能分辨旁人闲聊与背景噪声，不因干扰误触发，保持沟通的流畅连贯。

端到端人工评测结果显示，相比级联模型，SeedRealtime 的音视频对话节奏问题减少了一半——模型对说话时机的把握更加自然，“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少；同时，单次对话能够顺畅、完整交流的概率也有明显提升。

目前，SeedRealtime 已在豆包 App 全量上线，在业界率先实现了音视频全双工技术的规模化落地，欢迎大家体验。

项目主页：

https://seed.bytedance.com/seedrealtime

体验入口：

将豆包 App 更新至最新版本，在对话框内选择“打电话”，进入视频通话界面体验即可。

原生音视频交互，走向全模态，实现边看、边听、边说

音视频实时交互此前长期卡在两种形态之间：级联系统依赖 ASR、VLM、TTS 等多个模块串联，延迟层层叠加，信息逐级损耗；端到端模型虽更流畅，但不少方案仍依赖外置 VAD 判断轮次，本质上仍接近一问一答的半双工交互。

SeedRealtime 的核心突破，在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答，而是在连续音视频流上，让感知、理解、决策与表达同步进行，使“听到的”和“看到的”能够共同参与每一次实时判断。

难点首先在于对话节奏。语音天然带有停顿，可以借此判断何时接话；视频却始终在线、持续变化。模型既要不断理解画面中正在发生什么，又不能因为背景噪声干扰而频繁介入，而是要持续判断该关注哪个对象、该听谁说话，以及此刻是否应该回应。

更深层的挑战在于音视频的联合建模与时序对齐。用户说“这个怎么弄”时，模型需要结合当前画面、手势、视线与历史动作，判断“这个”具体指向什么；遇到同音词或模糊语音时，也要借助视觉场景完成消歧。只有将声音、画面与时序信息统一建模，模型才能真正把所见、所闻与所说对应起来。当看、听、说被纳入同一套实时决策体系，模型便不再只是等待用户提问，而能持续理解场景变化，在合适的时机主动开口。

接下来，我们通过 7 个具体案例，来看看 SeedRealtime 在真实场景中的表现。

音视频联合理解，看得懂画面，分得清对象

SeedRealtime 能在多人、嘈杂、开放的真实环境中，把画面、声音和时序对齐理解。

四位好友聚餐，人多话杂。用户逐一介绍在场的人，SeedRealtime 就能根据外形特征把名字和人对上 —— 认出浅色头发的七七、戴眼镜的 Julia，还主动和乐乐打招呼；在之后的交谈中，始终把每个人的声音和身份对应起来。

随后大家你一言我一语聊起旅行：有人想去海边拍照、逛海洋馆，有人怕热怕累，还有人对海鲜过敏。 SeedRealtime 能分辨每句话出自谁，并根据大家的交流，给出一份兼顾每个人需求的旅行方案。认人、辨声、听懂各自的需求，这些都在同一场对话里由一个模型实时完成。

视频 · 前往原文观看

在川菜馆，外籍食客面对中文菜单一筹莫展。SeedRealtime 直接从画面中认出菜品、用英语推荐，还能顺着文化背景解释“为什么‘鱼香肉丝’里没有鱼”、“皮蛋是怎么做的”。

服务员上菜时顺道说“很下饭”，它能结合画面中的菜，理解这句话并翻译给客人听。视觉信息无需先转成文字再理解，而是与语音在同一模型里对齐，做到眼前有什么，就能答什么。

视频 · 前往原文观看

主动的交互能力，持续观察，适时介入

模型会根据实时画面的持续变化，自主判断是否需要主动介入，而不必每次都等用户先开口。

在河北博物院逛展，用户交代一句“看到错金银铜虎噬鹿屏座就提醒我”，SeedRealtime 便在镜头不断移动的过程中留意画面，扫过那件展品时出声提醒。

随后，它结合画面细节，讲解错金银四龙四凤铜方案座、长信宫灯等镇馆之宝，以及铸造、错金银、焊接等多种工艺。将任务保存在上下文中、目标出现即提醒，正是持续视觉感知与主动介入能力的体现。

视频 · 前往原文观看

操作一台复杂咖啡机的过程中，模型能够基于视觉状态的变化实现实时纠错与反馈。

当观察到用户把整粒咖啡豆直接倒进萃取手柄时，模型快速指出：“豆子不能直接倒进去，得先磨成细粉”；萃取结束后，它基于对杯中油脂成色与液量的视觉解析，主动给出“下次萃取时间缩短 2-3 秒”的调整建议。无需用户逐步提问，模型便能基于实际场景进行点评。

视频 · 前往原文观看

研读 ResNet 论文时，模型结合网络结构图讲清跳接如何缓解梯度消失；当用户说“帮我盯着，翻到训练参数那部分提醒我”，它便在快速翻页的过程中持续观看画面，准确认出 “3.4 Implementation” 段落并主动叫停，随即报出学习率、动量、权重衰减等关键训练配置。在连续画面流中识别目标并主动叫停，展现了实际交互中的主动协作能力。

视频 · 前往原文观看

流畅的交互节奏，在干扰中判断何时开口

轮次判断不再交给外部 VAD 规则，而由 SeedRealtime 基于多模态信息持续决策：该接话时不迟疑，该沉默时不打断，在复杂环境中也能保持更自然的交流节奏。

大兴机场人流密集、环境嘈杂。同伴闲聊时随口提到“老李的航班”，模型并未被这句无关对话触发回复；当用户正式问起，即便航班信息已从画面移出，它仍能结合此前看到的大屏信息，回答实时到达时间，并联网提供行李转盘位置。

随后二人边走边聊往事，它持续观看眼前画面，扫到网约车指示牌时便自然接话，给出上车点的路线指引。嘈杂环境不再是必须过滤的干扰，闲谈里的关键信息也能被恰当留存、在需要时取用。

视频 · 前往原文观看

妈妈在一旁忙着别的事，让 SeedRealtime 陪女儿学习动物英文。背景里爸爸正在接电话、人声不断，模型却没有被这段无关对话带偏，始终跟着女孩手指的方向实时纠音、举例造句。模型该出声时不迟疑，受干扰时不跑偏。

视频 · 前往原文观看

总结与展望

SeedRealtime 的推出，标志着音视频交互迈出了关键一步。通过统一架构原生融合音频、视频与文本，模型得以在连续的多模态流中持续理解场景、判断节奏并作出回应。由此，“边看、边听、边说”真正成为日常可用的交互体验。

然而，现实环境中的音视频交流复杂而连续：背景嘈杂，人声会重叠，画面会变化，用户也会随时停顿、补充或打断。面对这些真实场景中的挑战，未来我们将在以下几个方面继续突破：

更低的延迟与更自然的节奏：持续压缩“听到—理解—回应”的端到端时延，让打断、抢话、附和与停顿等真实对话中的微妙节奏被自然还原，不只是更快，而是更恰到好处。

更主动的感知与决策：基于对画面与声音的持续理解，主动判断何时提醒、何时补充、何时递上用户正需要的信息，让模型不仅能“该说话时说话”，也能“该出手时出手”。

更稳健的多人复杂场景：在嘈杂环境、多人同框与多方对话中，稳定识别“谁在说话、在看什么、该回应谁”，将能力带入更多真实生活与工作场景。

从“能对话”到“能行动”：打通工具调用与现实世界的连接，让模型不仅能交流与观察，更能协助用户完成查询、预订与任务办理，把实时多模态理解转化为具体行动。

我们希望，AI 交互不再局限于清晰轮次中的问答，而是能在连续变化的真实场景中理解上下文、敏锐把握时机，并在合适的时候提供帮助。
