返回
AI 评分 57/100

CORE-Bench 基准发布:AI 复现论文能力测试准确率仅 22%

AI as Normal Technology(RSS)·2024-09-18 22:32·705天前·Sayash Kapoor
AI 导读

研究人员推出 CORE-Bench 基准,用于衡量 AI 自动化复现论文计算结果的能力。该基准包含 90 篇论文,设三个难度等级。测试中,基于 GPT-4o 的专用智能体 CORE-Agent 在最高难度等级上准确率仅达 22%。

AI as Normal Technology(RSS)
57AI 编辑部评分,满分 100

CORE-Bench 基准发布:AI 复现论文能力测试准确率仅 22%

2024-09-18 22:32· 705天前· Sayash Kapoor
AI 导读

研究人员推出 CORE-Bench 基准,用于衡量 AI 自动化复现论文计算结果的能力。该基准包含 90 篇论文,设三个难度等级。测试中,基于 GPT-4o 的专用智能体 CORE-Agent 在最高难度等级上准确率仅达 22%。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:AI as Normal Technology(RSS)· normaltech.ai