Kimi.ai 发布视觉感知基准 PerceptionBench
Kimi.ai 发布视觉感知基准 PerceptionBench,包含 3000 道题评估 10 种原子视觉感知能力,当前最佳模型准确率不足 60%。
DIGEST
AI 综述 · 更新于 7天前事件全貌
Kimi.ai 发布了视觉感知基准 PerceptionBench,用于评估多模态大语言模型的原子视觉感知能力。该基准从当前前沿模型在 42 个基准上的失败模式中归纳而来,将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
对 16 个前沿模型的评测显示,没有模型准确率超过 60%,GPT-5.6-Sol 以 59.7% 的准确率暂时领先,Kimi K3 以 58.5% 紧随其后。
PerceptionBench 通过自底向上的错误归因方法构建,旨在隔离感知错误,提供细粒度能力诊断。
本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。
TIMELINE
2 条公开报道 · 官方一手 1 条 · 最新在前报道时间线
- Kimi 发布视觉感知基准 PerceptionBench
Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
- PerceptionBench:多模态大语言模型原子视觉感知评测基准
研究者推出 PerceptionBench,专门评估多模态大语言模型的原子视觉感知能力,包含 3,000 道验证问题,覆盖十项原子感知能力。对 16 个前沿模型的评测显示,没有模型准确率超过 60%,GPT-5.6-Sol(59.7%)和 Kimi K3(58.5%)暂时领先。该基准通过自底向上的错误归因方法构建,旨在隔离感知错误,提供细粒度能力诊断。