内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
原文
Berryxia.AI@berryxia
50
2026-07-15 08:25· 6天前
跳到正文
AI 摘要

OpenMOSS 开源了 11B 参数的 MOSS-VL-Realtime 模型,支持在视频持续输入时同步感知与生成,可边处理新帧边回复,并在场景变化时主动修改或中断回答。该模型采用 Cross-Attention 架构与 XRoPE 时空位置编码,支持 256K 上下文窗口,已以 Apache-2.0 协议开源。

兄弟们,开源大小模型多端开花啊!

OpenMOSS 今天正式开源了 MOSS-VL-Realtime,这是一个专注于实时视频流交互的 11B 多模态模型。

不同于传统"先看完视频再回答"的离线模式,MOSS-VL-Realtime 支持在视频持续输入的过程中同步进行感知和生成。

它可以一边处理新帧,一边生成回复,并在场景变化时主动修改或打断自己的回答,也能在信息不足时保持沉默,真正实现"边看边聊"的实时交互体验。

模型亮点包括: - 采用 Cross-Attention 架构,将视觉编码与语言推理分离 - XRoPE 实现统一的时空位置编码 - 支持文本、单图/多图、单视频/多视频以及图文交错输入(中英双语) - 256K 超长上下文窗口 - 统一的对话模板,可同时支持离线、流式和实时交互模式

在流式视频理解基准上,MOSS-VL-Realtime 在开源模型中达到领先水平,尤其在主动预警(Proactive Alerting)和及时响应方面表现突出。

同时,新发布的 MOSS-VL-0708 Instruct 在细粒度感知、时间动作定位以及长视频理解等任务上也有明显提升。

模型已全部开源(Apache-2.0 协议),支持本地部署和实时推理。

Hugging Face:https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime GitHub:https://github.com/OpenMOSS/MOSS-VL 技术博客:https://github.com/OpenMOSS/MOSS-VL(内含详细说明)

这可能是目前开源社区在实时多模态交互方向上的一次重要推进,尤其适合需要持续视频理解和动态对话的场景。

OpenMOSS🤗 MOSS-VL-Realtime is now open source on @huggingface . The 11B model family supports text, single and multiple images, single and multiple videos, and interle...
Hugging Face多模态开源生态模型发布
Berryxia.AI@berryxia · X
50导出 Markdown
2026-07-15 08:25·6天前
在 X 看原推· x.com
AI 摘要

OpenMOSS 开源了 11B 参数的 MOSS-VL-Realtime 模型,支持在视频持续输入时同步感知与生成,可边处理新帧边回复,并在场景变化时主动修改或中断回答。该模型采用 Cross-Attention 架构与 XRoPE 时空位置编码,支持 256K 上下文窗口,已以 Apache-2.0 协议开源。

兄弟们,开源大小模型多端开花啊!

OpenMOSS 今天正式开源了 MOSS-VL-Realtime,这是一个专注于实时视频流交互的 11B 多模态模型。

不同于传统"先看完视频再回答"的离线模式,MOSS-VL-Realtime 支持在视频持续输入的过程中同步进行感知和生成。

它可以一边处理新帧,一边生成回复,并在场景变化时主动修改或打断自己的回答,也能在信息不足时保持沉默,真正实现"边看边聊"的实时交互体验。

模型亮点包括: - 采用 Cross-Attention 架构,将视觉编码与语言推理分离 - XRoPE 实现统一的时空位置编码 - 支持文本、单图/多图、单视频/多视频以及图文交错输入(中英双语) - 256K 超长上下文窗口 - 统一的对话模板,可同时支持离线、流式和实时交互模式

在流式视频理解基准上,MOSS-VL-Realtime 在开源模型中达到领先水平,尤其在主动预警(Proactive Alerting)和及时响应方面表现突出。

同时,新发布的 MOSS-VL-0708 Instruct 在细粒度感知、时间动作定位以及长视频理解等任务上也有明显提升。

模型已全部开源(Apache-2.0 协议),支持本地部署和实时推理。

在 X 查看原推
导出 Markdown

Hugging Face:https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime GitHub:https://github.com/OpenMOSS/MOSS-VL 技术博客:https://github.com/OpenMOSS/MOSS-VL(内含详细说明)

这可能是目前开源社区在实时多模态交互方向上的一次重要推进,尤其适合需要持续视频理解和动态对话的场景。

OpenMOSS🤗 MOSS-VL-Realtime is now open source on @huggingface . The 11B model family supports text, single and multiple images, single and multiple videos, and interle...
Hugging Face多模态开源生态模型发布视频
在 X 查看原推x.com