商汤开源 SenseNova-Vision-7B-MoT
商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型
TIMELINE
2 条公开报道 · 官方一手 2 条 · 最新在前报道时间线
- 商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型
商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
- 商汤开源 SenseNova-Vision-7B-MoT:单一模型覆盖所有主要视觉任务
商汤开源 SenseNova-Vision-7B-MoT,该模型将计算机视觉重构为多模态生成,无需任务专用头即可达到 SOTA,在分割与密集几何任务上超越 Google DeepMind 的 Vision Banana。具体对比:Referring segmentation(RefCOCOg cIoU)80.3 vs 73.8,Semantic segmentation(Cityscapes mIoU)71.2 vs 69.9,Depth estimation(NYUv2 δ1)98.1 vs 94.8,Surface normal(NYUv2 mean error)14.4 vs 17.8。模型支持语言或视觉提示引导,基于商汤十年 CV 积累。新任务由指令定义,而非新模型头。