企业版登录 尝试使用 Runway 上传中……
您的视频文件正在上传。当前加载的视频为源文件。构建 Runway 角色:
基于单张图片的实时对话式视频智能体
立即尝试
2026 年 5 月 4 日
由 Runway 研究与工程团队撰写
引言
我们如何构建一个实时视频智能体,将任意单张图片——逼真的人类、卡通吉祥物或幻想生物——转化为一个以 24fps 运行、具备端到端低延迟的、富有表现力的对话角色。无需任何微调。上传中……
您的视频文件正在上传。当前加载的视频为源文件。
Runway 角色是一个实时视频智能体,能将单张参考图片转化为一个富有表现力、可对话的视频角色。它基于我们的通用世界模型 GWM-1 构建,能够以每秒 24 帧(fps)的高清画质生成自然的唇形同步、面部表情和头部运动。
角色模型每帧的有效模型处理时间为 37 毫秒(帧率超过 24 fps),从用户停止说话到角色开始响应的服务器端周转时间为 1.75 秒。
本文将介绍角色的独特之处:其能够驱动的视觉风格广度、我们实现实时性的方法,以及围绕该模型构建的产品生态系统。
01
跨任意视觉风格的表现力生成
角色的输入仅需一张参考图片。仅此而已。系统直接从图片中提取风格,并立即开始生成以实时音频为条件的对话视频。
以下是 720p 片段,展示了角色如何跨多种风格驱动单张参考图片——从逼真的人类到卡通、生物和品牌吉祥物——并实现自然、富有表现力的对话。上传中……
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中……
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中……
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中……
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中……
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中...
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中...
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中...
您的视频文件正在上传。当前加载的视频为源文件。
取消静音 上传中...
您的视频文件正在上传。当前加载的视频为源文件。
02
实现实时化
实时 24fps:角色运行时的有效模型时间为每帧 37 毫秒,从语音结束到首帧响应的服务端周转时间为 1.75 秒。
在交互式对话循环中以 24fps 生成高清视频,与离线视频生成在工程上属于完全不同的问题。离线模式下,每帧可以花费数秒。而在对话场景中,每帧的预算只有 42 毫秒(1/24 秒)——这还没算上音频处理、网络传输以及“实时感”的感知成本,一旦延迟增加,实时感就会消失。在我们的实时会话中,我们实现了每帧 37 毫秒的有效模型时间,以及从用户停止说话到角色开始响应之间 1.75 秒的服务端周转时间(语音智能体 + 视频管线)。
我们通过 GWM-1 的自回归逐帧生成实现了这一点:帧按顺序生成,并在生成的同时流式传输到客户端,而不是对整个片段进行迭代去噪。上传中...
您的视频文件正在上传。当前加载的视频为源文件。
我们之所以能达到实时 24fps,是因为采用了重叠处理:扩散 Transformer 和 VAE 解码器通过管线拆分并发运行。这使得有效迭代成本更接近 max(扩散时间, 解码时间),而非扩散时间 + 解码时间。
每次迭代生成 4 个像素帧,因此在 24fps 下,每 167 毫秒(4/24 秒)需要一次迭代。在我们的测量中,扩散过程耗时 151 毫秒,VAE 解码器耗时 119 毫秒;由于解码是重叠进行的,它基本上从关键路径中消失了。这样算下来,每帧的有效模型处理时间为 37 毫秒(151 毫秒 / 4 帧),低于 41 毫秒/帧的实时预算。
如果没有重叠,扩散过程将消耗 167 毫秒预算中的大部分,而解码则会使其超限。通过重叠,第 N-1 帧的解码与第 N 帧的扩散同时进行。
“实时”也是用户端到端的感受:即从他们停止说话到角色开始回应的时间。综合来看:1185 毫秒(语音智能体)+ 567 毫秒(视频管线)= 本次会话中 1.75 秒的服务端延迟。客户端与服务器之间的网络连接每侧增加 200 毫秒(往返共 400 毫秒),具体取决于连接质量。
进一步降低延迟的最大杠杆在于语音智能体:视频管线已经很快,我们预计随着语音智能体响应时间的改善,整体周转时间将会下降。
以下是实现这种实时性能的五项关键模型和系统级优化:
去噪时间步蒸馏
流匹配可能需要许多去噪步骤。我们使用分布匹配蒸馏(DMD)来减少步骤/前向传递次数,并结合学生强制和多块生成技术以实现长时程稳定性。
并行化
我们在多个设备间对推理进行分片,主要限制在于通信开销。我们将张量并行扩散与专用设备上的 VAE 解码器进行流水线处理,这样解码就不会与 Transformer 架构争抢资源。
KV 缓存管理
自回归视频每帧都会增加 KV 缓存。高效的驱逐/压缩策略能在不牺牲吞吐量的情况下保持时间一致性。
CUDA 图
在某些分辨率下,内核启动开销可能占据主导地位。我们将前向传播捕获到静态 CUDA 图中以减少开销,并伴有严格的形状和内存约束。
内核性能
我们针对硬件调整注意力/矩阵乘法内核,以减少延迟和内存流量。诸如 CuteDSL Flash Attention 4 和融合的 Triton 内核等工具有助于保持关键路径的高速运行。
03
从模型到产品生态
实现24帧/秒的实时角色视频只是故事的一半。要构建一个有用的实时视频智能体,你需要配套的产品功能面:将角色锚定在你的领域的方法、将其连接到真实应用的能力,以及将其部署到实际对话发生场景的途径。上传中……
你的视频文件正在上传。当前已加载的视频是源文件。
视觉(摄像头 + 屏幕共享)
角色可以在会话期间看到你的网络摄像头或共享屏幕,用于辅导、演示、游戏和设计反馈等视觉工作流。
了解更多
自定义语音
角色的语音是身份和可信度的核心。我们通过文本转语音(从提示词设计)和即时语音克隆(从音频样本)两种方式,让你能快速获得“正确的声音”,然后将其分配给角色,确保跨会话的音色一致。
了解更多 上传中……
你的视频文件正在上传。当前已加载的视频是源文件。
工具调用
角色可以在会话期间为你执行操作。你可以定义它们被允许使用的“工具”——从UI操作(显示字幕、弹出知识卡片、更新游戏状态)到受信任的后端RPC(例如`fetch_order_status`以拉取真实状态/预计到达时间),其结果会反馈到对话中。
了解更多
知识库
附加你自己的文档(文本/Markdown格式),让角色能够基于你的公司和产品知识——支持文档、常见问题解答、内部政策、规格说明——进行对话,而不是给出泛泛的回复。
了解更多 上传中……
你的视频文件正在上传。当前已加载的视频是源文件。
可嵌入组件
只需一行代码,即可将实时角色放入任何Web应用。该组件为你处理实时通信的底层逻辑,让你在几分钟内就能嵌入虚拟形象。
了解更多
会议集成
将角色带入Zoom/Google Meet/Teams的真实会议中,让它们能够看到和听到正在发生的事情并实时响应——从团队站会到客户通话都适用。
了解更多 上传中……
你的视频文件正在上传。当前已加载的视频是源文件。
取消静音 尝试角色。与我们一同构建。
Runway Characters 现已通过 Runway API 以及 Runway 网页版和移动端应用提供。如果你热爱实时模型、低延迟系统,并希望在最前沿领域交付产品——我们正在招聘。
立即试用加入团队