STORY · 事件已收束

ActiveVision 基准测试发布

1 个精选信源 · 1 篇报道持续 1最新动态 33天前
最新进展

ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

TIMELINE

报道时间线

1 条公开报道 · 官方一手 0 条 · 最新在前
  1. ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力
    HuggingFace Daily Papers(社区热门论文)精选

    最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。