ActiveVision 基准测试发布
ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力
TIMELINE
1 条公开报道 · 官方一手 0 条 · 最新在前报道时间线
- ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力
最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。