# OpenMOSS 开源 MOSS-VL-Realtime 实时视频流多模态模型

- 来源：Berryxia.AI (@berryxia)
- 发布时间：2026-07-15 08:25
- AIHOT 分数：50
- AIHOT 链接：https://aihot.virxact.com/items/cmrlctz6v03y6bi2bax5wli3n
- 原文链接：https://x.com/berryxia/status/2077187667025125579

## AI 摘要

OpenMOSS 开源了 11B 参数的 MOSS-VL-Realtime 模型，支持在视频持续输入时同步感知与生成，可边处理新帧边回复，并在场景变化时主动修改或中断回答。该模型采用 Cross-Attention 架构与 XRoPE 时空位置编码，支持 256K 上下文窗口，已以 Apache-2.0 协议开源。

## 正文

兄弟们，开源大小模型多端开花啊！

OpenMOSS 今天正式开源了 MOSS-VL-Realtime，这是一个专注于实时视频流交互的 11B 多模态模型。

不同于传统"先看完视频再回答"的离线模式，MOSS-VL-Realtime 支持在视频持续输入的过程中同步进行感知和生成。

它可以一边处理新帧，一边生成回复，并在场景变化时主动修改或打断自己的回答，也能在信息不足时保持沉默，真正实现"边看边聊"的实时交互体验。

模型亮点包括：
- 采用 Cross-Attention 架构，将视觉编码与语言推理分离
- XRoPE 实现统一的时空位置编码
- 支持文本、单图/多图、单视频/多视频以及图文交错输入（中英双语）
- 256K 超长上下文窗口
- 统一的对话模板，可同时支持离线、流式和实时交互模式

在流式视频理解基准上，MOSS-VL-Realtime 在开源模型中达到领先水平，尤其在主动预警（Proactive Alerting）和及时响应方面表现突出。

同时，新发布的 MOSS-VL-0708 Instruct 在细粒度感知、时间动作定位以及长视频理解等任务上也有明显提升。

模型已全部开源（Apache-2.0 协议），支持本地部署和实时推理。

Hugging Face：https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime
GitHub：https://github.com/OpenMOSS/MOSS-VL
技术博客：https://github.com/OpenMOSS/MOSS-VL(内含详细说明）

这可能是目前开源社区在实时多模态交互方向上的一次重要推进，尤其适合需要持续视频理解和动态对话的场景。

### 引用推文

> OpenMOSS：🤗 MOSS-VL-Realtime is now open source on @huggingface . The 11B model family supports text, single and multiple images, single and multiple videos, and interle...
