商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

SenseTime · @SenseTime_AI · X·2026-07-14 08:38·46天前
AI 导读

商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

SenseTime@SenseTime_AI
精选
74AI 编辑部评分,满分 100

商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

2026-07-14 08:38· 46天前
AI 导读

商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

推荐理由

商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

正文 · AI 翻译

SenseNova-Vision-7B-MoT,现已完全开源:一个模型,覆盖以下所有主要视觉任务: 🔹检测 / OCR / GUI 🔹深度与法线 🔹分割 🔹多视图

它还能通过自然语言定义全新的视觉任务变体--跨越传统任务边界,重新组合视觉能力。

开源内容包括:模型权重 + SenseNova-Vision 语料库(含 5000 万样本子集,以及用于复现其余公开来源数据的完整工具包),供研究与开发使用。

🤗 HF:https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT 🔧GitHub:https://github.com/OpenSenseNova/SenseNova-Vision 💻 试用演示:https://huggingface.co/spaces/sensenova/SenseNova-Vision 📋技术报告:https://arxiv.org/abs/2607.06560 👾Discord:http://discord.gg/BuTXPHmQub

来源:SenseTime· x.com