# 微软发布4B流式视觉模型Mage-VL

- 来源：Berryxia.AI (@berryxia)
- 发布时间：2026-07-29 01:00
- AIHOT 分数：44
- AIHOT 链接：https://aihot.virxact.com/items/cms4yde5e001jroflbnb8r0af
- 原文链接：https://x.com/berryxia/status/2082149193498705990

## AI 摘要

微软在Hugging Face发布Mage-VL 4B，一款Codec-Native流式视觉语言模型，能实时描述视频中正在发生的事件。用户可用自然语言指定关心的时刻（如“火车到站时”），4B参数即可持续处理流式输入，效率较高。

## 正文

兄弟们，微软居然还搞了这个好东西，值得看看啊！
做零售店、巡检的行业人简直是大喜~

Microsoft扔出一个仅仅4B的流式视觉模型，能实时盯着视频说"什么时候发生了什么"。

Mage-VL是Codec-Native的Streaming VLM，专门做直播式理解。

它一边看视频一边描述正在发生的事，你还能用自然语言指定关心的时刻，比如"火车到站的时候""进球的瞬间"。4B体量却能持续处理流式输入，效率很高。

以前实时视频理解要么靠大模型烧算力，要么只能事后分析。

### 引用推文

> Hugging Apps：Microsoft just dropped Mage-VL 4B on Hugging Face an efficient codec-native streaming VLM that describes live events as they happen, and you can prompt it for t...
