STORY · 事件已收束

Kimi.ai 发布视觉感知基准 PerceptionBench

2 个精选信源 · 2 篇报道持续 1最新动态 10天前
最新进展

Kimi.ai 发布视觉感知基准 PerceptionBench,包含 3000 道题评估 10 种原子视觉感知能力,当前最佳模型准确率不足 60%。

DIGEST

事件全貌

AI 综述 · 更新于 7天前

Kimi.ai 发布了视觉感知基准 PerceptionBench,用于评估多模态大语言模型的原子视觉感知能力。该基准从当前前沿模型在 42 个基准上的失败模式中归纳而来,将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

对 16 个前沿模型的评测显示,没有模型准确率超过 60%,GPT-5.6-Sol 以 59.7% 的准确率暂时领先,Kimi K3 以 58.5% 紧随其后。

PerceptionBench 通过自底向上的错误归因方法构建,旨在隔离感知错误,提供细粒度能力诊断。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

TIMELINE

报道时间线

2 条公开报道 · 官方一手 1 条 · 最新在前
  1. Kimi 发布视觉感知基准 PerceptionBench
    X:Kimi.ai (@Kimi_Moonshot)官方一手精选

    Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

  2. PerceptionBench:多模态大语言模型原子视觉感知评测基准
    HuggingFace Daily Papers(社区热门论文)

    研究者推出 PerceptionBench,专门评估多模态大语言模型的原子视觉感知能力,包含 3,000 道验证问题,覆盖十项原子感知能力。对 16 个前沿模型的评测显示,没有模型准确率超过 60%,GPT-5.6-Sol(59.7%)和 Kimi K3(58.5%)暂时领先。该基准通过自底向上的错误归因方法构建,旨在隔离感知错误,提供细粒度能力诊断。