# MOSS-VL技术报告：将实时交互作为一等能力的开源视觉语言模型家族

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-15 08:00
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsyhyrd60wg3roz03o05ne6l
- 原文链接：https://arxiv.org/abs/2608.15045

## 精选理由

把视觉 token 放在解码序列之外，并用门控交叉注意力让模型边生成边接收画面，给低延迟多模态交互提供了一个具体架构参考。

## AI 摘要

MOSS-VL是一个将实时交互（边感知边说话）作为一等能力的开源视觉语言模型家族，通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首（三项第一、一项第二），在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线（37.5分）。

## 正文

我们推出 MOSS-VL，一个开放视觉语言模型家族，将实时交互——即边说话边感知——作为一等能力来对待。它在全栈范围内进行协同设计：语言解码器仅通过门控交叉注意力来关注视觉信息，因此模型在生成的同时能够自然地看到传入的帧；一个合成的交互语料库负责监督何时该说话、何时该保持沉默、以及何时该修正；而一个分阶段的课程则将所有实时专属训练集中在一个轻量级的最终阶段，该阶段建立在强大的离线基础之上。在离线状态下，MOSS-VL-Instruct 在同等规模下具有竞争力，并在时序推理视频数据集上领先。在四个流式基准测试中，MOSS-VL-Realtime 在开源流式模型中取得了三个基准的平均最佳成绩（在第四个基准上排名第二），并横扫了直接测试主动行为的三个子集——在 OmniMMI 主动提醒基准上取得 66.0 分，而最佳基线仅为 37.5 分。尽管拥有 113 亿参数，但由于视觉 token 位于被解码的序列之外，随着视觉上下文的增长，MOSS-VL 相对于同骨干网络的 Qwen3-VL-8B 在首 token 生成时间上的优势从 2.8 倍扩大到了 5.1 倍。我们已在 https://github.com/OpenMOSS/MOSS-VL 发布了全部五个检查点、训练课程以及实时推理代码。
