我们发布了 PerceptionBench,这是一个将视觉感知独立出来、并将其作为一组原子能力进行评估的基准测试——这些能力是从当今模型的失败模式中发现的,而非预先定义的。
从前沿模型在 42 个基准测试中的失败案例中,我们推导出 10 种原子感知能力,并构建了 3000 道经过验证的题目,每道题都只测试单一能力,仅凭观察即可作答,无需推理或外部知识。
博客:http://kimi.com/blog/perception-bench GitHub:http://github.com/MoonshotAI/PerceptionBench HuggingFace:http://huggingface.co/datasets/moonshotai/PerceptionBench