STORY · 事件已收束

商汤开源 SenseNova-Vision-7B-MoT

1 个精选信源 · 2 篇报道持续 1最新动态 24天前
最新进展

商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

TIMELINE

报道时间线

2 条公开报道 · 官方一手 2 条 · 最新在前
  1. 商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型
    X:商汤 SenseTime (@SenseTime_AI)官方一手精选

    商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

  2. 商汤开源 SenseNova-Vision-7B-MoT:单一模型覆盖所有主要视觉任务
    X:商汤 SenseTime (@SenseTime_AI)官方一手

    商汤开源 SenseNova-Vision-7B-MoT,该模型将计算机视觉重构为多模态生成,无需任务专用头即可达到 SOTA,在分割与密集几何任务上超越 Google DeepMind 的 Vision Banana。具体对比:Referring segmentation(RefCOCOg cIoU)80.3 vs 73.8,Semantic segmentation(Cityscapes mIoU)71.2 vs 69.9,Depth estimation(NYUv2 δ1)98.1 vs 94.8,Surface normal(NYUv2 mean error)14.4 vs 17.8。模型支持语言或视觉提示引导,基于商汤十年 CV 积累。新任务由指令定义,而非新模型头。