# 字节 Seed 发布 SeedRealtime 音视频全双工大模型，走向全模态自然交互

- 来源：字节 Seed：Research Feed（网页内嵌数据）
- 发布时间：2026-08-05 00:00
- AIHOT 分数：78
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsfkn6cf03ciroch6tfynepy
- 原文链接：https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92

## 精选理由

SeedRealtime 将音视频感知与表达统一到同一端到端模型中，级联系统常见的说话节奏问题减少了一半，实时场景中能主动提醒并自然停顿，为全模态智能助手交互提供了新的技术路线。

## AI 摘要

字节 Seed 发布 SeedRealtime，用统一架构原生融合音频、视频与文本，实现“边看、边听、边说”的实时交互。相比级联模型，其音视频对话节奏问题减少一半，并已在豆包 App 全量上线，率先实现音视频全双工技术的规模化落地。

## 正文

该来源未收录可展示正文，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
