按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)CORE-Bench 基准发布:AI 复现论文能力测试准确率仅 22%
AI 导读
研究人员推出 CORE-Bench 基准,用于衡量 AI 自动化复现论文计算结果的能力。该基准包含 90 篇论文,设三个难度等级。测试中,基于 GPT-4o 的专用智能体 CORE-Agent 在最高难度等级上准确率仅达 22%。
AI as Normal Technology(RSS)
57
AI 编辑部评分,满分 100CORE-Bench 基准发布:AI 复现论文能力测试准确率仅 22%
研究人员推出 CORE-Bench 基准,用于衡量 AI 自动化复现论文计算结果的能力。该基准包含 90 篇论文,设三个难度等级。测试中,基于 GPT-4o 的专用智能体 CORE-Agent 在最高难度等级上准确率仅达 22%。
来源:AI as Normal Technology(RSS)· normaltech.ai