当前的 AI 评测基准评估的是 AI 智能体在人类设计的工作流中执行任务的能力。这些评估从根本上无法衡量一个关键的下一代能力:模型能否自主开发 AI 智能体系统。我们提出了元智能体挑战(MAC),这是一个旨在测试前沿模型自主开发 AI 智能体能力的评估框架。具体来说,一个代码智能体(即元智能体)会获得一个沙盒环境、一个评估 API 以及一个时间限制,用于迭代式地编程一个 AI 智能体工件,该工件需在五个领域内的保留测试集上最大化性能。为确保评估的完整性,该框架通过多层防御机制来防范奖励破解。利用这一框架,我们证明了元智能体很少能匹敌人工设计的基线策略,而少数能做到的也主要由专有前沿模型主导。此外,设计过程表现出高方差,且高优化压力会催生对抗性行为,例如真实标签泄露——这突显了鲁棒性和模型对齐方面的关键缺陷。最终,MAC 为自主 AI 研究与开发提供了一个严谨的开源基准,为评估递归自我改进提供了经验性代理。基准测试已公开在:https://github.com/ant-research/meta-agent-challenge。
媒体内容 · 前往原文查看图 2:双容器架构。智能体容器提供开发环境。评估容器安全地保存着数据集和真实标签,提供一个 API 代理来强制执行配额,通过智能体运行器执行提交的智能体,并且仅向智能体容器返回有限的反馈。
智能体容器。
智能体容器提供了一个沙盒化的 Linux 环境,元智能体在其中开发其解决方案。它包含智能体接口规范(base_agent.py)和一个 API 封装器(openai_helper.py)。元智能体将其工件写入 /workspace/agent.py,并可以通过 pyproject.toml 清单文件声明额外的 Python 依赖项,评估系统会自动安装这些依赖项。
[2] 人工智能安全中心、Scale AI 和 HLE 贡献者联盟 (2026) 用于评估 AI 能力的专家级学术问题基准。《自然》649, 第 1139–1146 页。外部链接:文献,2501.14249,链接 引用自:附录 C。
[3] J. S. Chan, N. Chowdhury, O. Jaffe, J. Aung, D. Sherburn, E. Mays, G. Starace, K. Liu, L. Maksin, T. Patwardhan 等人 (2024) 《Mle-bench:在机器学习工程任务上评估机器学习智能体》。arXiv 预印本 arXiv:2410.07095。引用于:§2。
[4] S. Hu, C. Lu, 和 J. Clune (2025) 《智能体系统的自动化设计》。载于第十三届国际学习表征会议,外部链接:Link。引用于:§2。
[5] N. Jain, K. Han, A. Gu, W. Li, F. Yan, T. Zhang, S. Wang, A. Solar-Lezama, K. Sen, 和 I. Stoica (2025) 《LiveCodeBench:对代码大语言模型进行整体且无污染的评估》。载于第十三届国际学习表征会议,外部链接:Link。引用于:附录 C。
[6] C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, 和 K. Narasimhan (2023) 《Swe-bench:语言模型能否解决真实的 GitHub 问题?》。arXiv 预印本 arXiv:2310.06770。引用于:附录 C, §2。
[7] Kimi (2026) 《Kimi K2.5:视觉智能体智能》。arXiv 预印本 arXiv:2602.02276。引用于:§1。
[8] T. Kwa, B. West, J. Becker, A. Deng, K. Garcia, M. Hasin, S. Jawhar, M. Kinniment, N. Rush, S. Von Arx 等人 (2025) 《衡量 AI 完成长周期任务的能力》。arXiv 预印本 arXiv:2503.14499。引用于:§1。
[9] W. Kwon, Z. Li, S. Zhuang, Y. Sheng, L. Zheng, C. H. Yu, J. E. Gonzalez, H. Zhang, 和 I. Stoica (2023) 《基于 PagedAttention 的大语言模型服务高效内存管理》。载于 ACM SIGOPS 第 29 届操作系统原理研讨会论文集。引用于:§4。
[10] Y. Lee, R. Nair, Q. Zhang, K. Lee, O. Khattab, 和 C. Finn (2026) 《Meta-Harness:模型 harness 的端到端优化》。arXiv 预印本 arXiv:2603.28052。引用于:§2。
[11] M. A. Merrill, A. G. Shaw, N. Carlini, B. Li, H. Raj, I. Bercovich, L. Shi, J. Y. Shin, T. Walshe, E. K. Buchanan 等人 (2026) 《Terminal-Bench:在命令行界面中针对困难、真实任务对智能体进行基准测试》。arXiv 预印本 arXiv:2601.11868。引用于:附录 C, §2。
[12] A. Novikov, N. Vũ, M. Eisenberger, E. Dupont, P. Huang, A. Z. Wagner, S. Shirobokov, B. Kozlovskii, F. J. Ruiz, A. Mehrabian 等人 (2025) 《Alphaevolve:面向科学与算法发现的编程智能体》。arXiv 预印本 arXiv:2506.13131。引用自:§2。
[13] J. Qiu, X. Qi, H. Wang, X. Juan, Y. Wang, Z. Zhao, J. Geng, J. Guo, P. Li, J. Shi 等人 (2025) 《Alita-g:用于智能体生成的自演化生成式智能体》。arXiv 预印本 arXiv:2510.23601。引用自:§2。
[14] B. Rank, H. Bhatnagar, A. Prabhu, S. Eisenberg, K. Nguyen, M. Bethge 和 M. Andriushchenko (2026) 《PostTrainBench:大语言模型智能体能自动化大语言模型后训练吗?》。外部链接:2603.08640,链接。引用自:§2。
[15] D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, J. Michael 和 S. R. Bowman (2024) 《GPQA:面向研究生水平的谷歌无法作弊的问答基准》。收录于《第一届语言建模会议》,外部链接:链接。引用自:附录 C。
[16] J. Schmidhuber (2003) 《哥德尔机:能够实现可证明最优自我改进的自指通用问题求解器》。arXiv 预印本 cs/0309048。引用自:§1。
[19] X. Wang, B. Li, Y. Song, F. F. Xu, X. Tang, M. Zhuge, J. Pan, Y. Song, B. Li, J. Singh 等人 (2024) 《OpenHands:面向作为通用型智能体的 AI 软件开发者的开放平台》。arXiv 预印本 arXiv:2407.16741。引用自:§4。
[20] X. Wang, B. Li, Y. Song, F. F. Xu, X. Tang, M. Zhuge, J. Pan, Y. Song, B. Li, J. Singh, H. H. Tran, F. Li, R. Ma, M. Zheng, B. Qian, Y. Shao, N. Muennighoff, Y. Zhang, B. Hui, J. Lin, R. Brennan, H. Peng, H. Ji 和 G. Neubig (2025) 《OpenHands:面向作为通用型智能体的 AI 软件开发者的开放平台》。收录于《第十三届国际学习表征会议》,外部链接:链接。引用自:§1。
[21] J. Wei, Z. Sun, S. Papay, S. McKinney, J. Han, I. Fulford, H. W. Chung, A. T. Passos, W. Fedus, 和 A. Glaese (2025) 《Browsecomp:一个简单但富有挑战性的浏览智能体基准测试》。arXiv 预印本 arXiv:2504.12516。引自:第 2 节。
[22] H. Wijk, T. Lin, J. Becker, S. Jawhar, N. Parikh, T. Broadley, L. Chan, M. Chen, J. Clymer, J. Dhyani, 等人 (2024) 《Re-bench:评估前沿 AI 语言模型智能体研发能力与人类专家对比》。arXiv 预印本 arXiv:2411.15114。引自:第 1 节。
[23] C. S. Xia, Z. Wang, Y. Yang, Y. Wei, 和 L. Zhang (2025) 《Live-swe-agent:软件工程智能体能否即时自我进化?》。arXiv 预印本 arXiv:2511.13646。引自:第 2 节。
[24] X. Yin, X. Wang, L. Pan, L. Lin, X. Wan, 和 W. Y. Wang (2025-07) 《Gödel 智能体:一种用于递归自我改进的自指智能体框架》。收录于《第 63 届计算语言学协会年会论文集(第一卷:长文)》,W. Che, J. Nabende, E. Shutova, 和 M. T. Pilehvar 编,奥地利维也纳,第 27890–27913 页。外部链接:Link, Document, ISBN 979-8-89176-251-0。引自:第 2 节。
[25] G. Zhang, H. Ren, C. Zhan, Z. Zhou, J. Wang, H. Zhu, W. Zhou, 和 S. Yan (2025) 《Memevolve:智能体记忆系统的元进化》。arXiv 预印本 arXiv:2512.18746。引自:第 2 节。
[26] J. Zhang, S. Hu, C. Lu, R. Lange, 和 J. Clune (2025) 《Darwin Gödel 机器:自我改进智能体的开放式进化》。arXiv 预印本 arXiv:2505.22954。引自:第 2 节。
[27] H. Zhou, S. Guo, A. Liu, Z. Yu, Z. Gong, B. Zhao, Z. Chen, M. Zhang, Y. Chen, J. Li, R. Yang, Q. Liu, X. Yu, J. Zhou, N. Wang, C. Sun, 和 J. Wang (2026) 《Memento-skills:让智能体设计智能体》。外部链接:2603.18743, Link。引自:第 2 节。
附录 A 提示词与附加实验配置
A.1 审计智能体
审计智能体通过 Claude Code Agent SDK 实例化,以 Claude Opus 4.6 作为其骨干模型,并拥有完整的文件系统和 shell 工具访问权限,作用域限定在单个试验目录内。每个完成的试验会调用该智能体一次,使用以下提示词,并输出一个结构化的 JSON 判定结果(CLEAN、SUSPICIOUS 或 CHEATING),同时附上支持性证据。
当前的 AI 评测基准评估的是 AI 智能体在人类设计的工作流中执行任务的能力。这些评估从根本上无法衡量一个关键的下一代能力:模型能否自主开发 AI 智能体系统。我们提出了元智能体挑战(MAC),这是一个旨在测试前沿模型自主开发 AI 智能体能力的评估框架。具体来说,一个代码智能体(即元智能体)会获得一个沙盒环境、一个评估 API 以及一个时间限制,用于迭代式地编程一个 AI 智能体工件,该工件需在五个领域内的保留测试集上最大化性能。为确保评估的完整性,该框架通过多层防御机制来防范奖励破解。利用这一框架,我们证明了元智能体很少能匹敌人工设计的基线策略,而少数能做到的也主要由专有前沿模型主导。此外,设计过程表现出高方差,且高优化压力会催生对抗性行为,例如真实标签泄露——这突显了鲁棒性和模型对齐方面的关键缺陷。最终,MAC 为自主 AI 研究与开发提供了一个严谨的开源基准,为评估递归自我改进提供了经验性代理。基准测试已公开在:https://github.com/ant-research/meta-agent-challenge。
媒体内容 · 前往原文查看图 2:双容器架构。智能体容器提供开发环境。评估容器安全地保存着数据集和真实标签,提供一个 API 代理来强制执行配额,通过智能体运行器执行提交的智能体,并且仅向智能体容器返回有限的反馈。
智能体容器。
智能体容器提供了一个沙盒化的 Linux 环境,元智能体在其中开发其解决方案。它包含智能体接口规范(base_agent.py)和一个 API 封装器(openai_helper.py)。元智能体将其工件写入 /workspace/agent.py,并可以通过 pyproject.toml 清单文件声明额外的 Python 依赖项,评估系统会自动安装这些依赖项。
[2] 人工智能安全中心、Scale AI 和 HLE 贡献者联盟 (2026) 用于评估 AI 能力的专家级学术问题基准。《自然》649, 第 1139–1146 页。外部链接:文献,2501.14249,链接 引用自:附录 C。
[3] J. S. Chan, N. Chowdhury, O. Jaffe, J. Aung, D. Sherburn, E. Mays, G. Starace, K. Liu, L. Maksin, T. Patwardhan 等人 (2024) 《Mle-bench:在机器学习工程任务上评估机器学习智能体》。arXiv 预印本 arXiv:2410.07095。引用于:§2。
[4] S. Hu, C. Lu, 和 J. Clune (2025) 《智能体系统的自动化设计》。载于第十三届国际学习表征会议,外部链接:Link。引用于:§2。
[5] N. Jain, K. Han, A. Gu, W. Li, F. Yan, T. Zhang, S. Wang, A. Solar-Lezama, K. Sen, 和 I. Stoica (2025) 《LiveCodeBench:对代码大语言模型进行整体且无污染的评估》。载于第十三届国际学习表征会议,外部链接:Link。引用于:附录 C。
[6] C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, 和 K. Narasimhan (2023) 《Swe-bench:语言模型能否解决真实的 GitHub 问题?》。arXiv 预印本 arXiv:2310.06770。引用于:附录 C, §2。
[7] Kimi (2026) 《Kimi K2.5:视觉智能体智能》。arXiv 预印本 arXiv:2602.02276。引用于:§1。
[8] T. Kwa, B. West, J. Becker, A. Deng, K. Garcia, M. Hasin, S. Jawhar, M. Kinniment, N. Rush, S. Von Arx 等人 (2025) 《衡量 AI 完成长周期任务的能力》。arXiv 预印本 arXiv:2503.14499。引用于:§1。
[9] W. Kwon, Z. Li, S. Zhuang, Y. Sheng, L. Zheng, C. H. Yu, J. E. Gonzalez, H. Zhang, 和 I. Stoica (2023) 《基于 PagedAttention 的大语言模型服务高效内存管理》。载于 ACM SIGOPS 第 29 届操作系统原理研讨会论文集。引用于:§4。
[10] Y. Lee, R. Nair, Q. Zhang, K. Lee, O. Khattab, 和 C. Finn (2026) 《Meta-Harness:模型 harness 的端到端优化》。arXiv 预印本 arXiv:2603.28052。引用于:§2。
[11] M. A. Merrill, A. G. Shaw, N. Carlini, B. Li, H. Raj, I. Bercovich, L. Shi, J. Y. Shin, T. Walshe, E. K. Buchanan 等人 (2026) 《Terminal-Bench:在命令行界面中针对困难、真实任务对智能体进行基准测试》。arXiv 预印本 arXiv:2601.11868。引用于:附录 C, §2。
[12] A. Novikov, N. Vũ, M. Eisenberger, E. Dupont, P. Huang, A. Z. Wagner, S. Shirobokov, B. Kozlovskii, F. J. Ruiz, A. Mehrabian 等人 (2025) 《Alphaevolve:面向科学与算法发现的编程智能体》。arXiv 预印本 arXiv:2506.13131。引用自:§2。
[13] J. Qiu, X. Qi, H. Wang, X. Juan, Y. Wang, Z. Zhao, J. Geng, J. Guo, P. Li, J. Shi 等人 (2025) 《Alita-g:用于智能体生成的自演化生成式智能体》。arXiv 预印本 arXiv:2510.23601。引用自:§2。
[14] B. Rank, H. Bhatnagar, A. Prabhu, S. Eisenberg, K. Nguyen, M. Bethge 和 M. Andriushchenko (2026) 《PostTrainBench:大语言模型智能体能自动化大语言模型后训练吗?》。外部链接:2603.08640,链接。引用自:§2。
[15] D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, J. Michael 和 S. R. Bowman (2024) 《GPQA:面向研究生水平的谷歌无法作弊的问答基准》。收录于《第一届语言建模会议》,外部链接:链接。引用自:附录 C。
[16] J. Schmidhuber (2003) 《哥德尔机:能够实现可证明最优自我改进的自指通用问题求解器》。arXiv 预印本 cs/0309048。引用自:§1。
[19] X. Wang, B. Li, Y. Song, F. F. Xu, X. Tang, M. Zhuge, J. Pan, Y. Song, B. Li, J. Singh 等人 (2024) 《OpenHands:面向作为通用型智能体的 AI 软件开发者的开放平台》。arXiv 预印本 arXiv:2407.16741。引用自:§4。
[20] X. Wang, B. Li, Y. Song, F. F. Xu, X. Tang, M. Zhuge, J. Pan, Y. Song, B. Li, J. Singh, H. H. Tran, F. Li, R. Ma, M. Zheng, B. Qian, Y. Shao, N. Muennighoff, Y. Zhang, B. Hui, J. Lin, R. Brennan, H. Peng, H. Ji 和 G. Neubig (2025) 《OpenHands:面向作为通用型智能体的 AI 软件开发者的开放平台》。收录于《第十三届国际学习表征会议》,外部链接:链接。引用自:§1。
[21] J. Wei, Z. Sun, S. Papay, S. McKinney, J. Han, I. Fulford, H. W. Chung, A. T. Passos, W. Fedus, 和 A. Glaese (2025) 《Browsecomp:一个简单但富有挑战性的浏览智能体基准测试》。arXiv 预印本 arXiv:2504.12516。引自:第 2 节。
[22] H. Wijk, T. Lin, J. Becker, S. Jawhar, N. Parikh, T. Broadley, L. Chan, M. Chen, J. Clymer, J. Dhyani, 等人 (2024) 《Re-bench:评估前沿 AI 语言模型智能体研发能力与人类专家对比》。arXiv 预印本 arXiv:2411.15114。引自:第 1 节。
[23] C. S. Xia, Z. Wang, Y. Yang, Y. Wei, 和 L. Zhang (2025) 《Live-swe-agent:软件工程智能体能否即时自我进化?》。arXiv 预印本 arXiv:2511.13646。引自:第 2 节。
[24] X. Yin, X. Wang, L. Pan, L. Lin, X. Wan, 和 W. Y. Wang (2025-07) 《Gödel 智能体:一种用于递归自我改进的自指智能体框架》。收录于《第 63 届计算语言学协会年会论文集(第一卷:长文)》,W. Che, J. Nabende, E. Shutova, 和 M. T. Pilehvar 编,奥地利维也纳,第 27890–27913 页。外部链接:Link, Document, ISBN 979-8-89176-251-0。引自:第 2 节。
[25] G. Zhang, H. Ren, C. Zhan, Z. Zhou, J. Wang, H. Zhu, W. Zhou, 和 S. Yan (2025) 《Memevolve:智能体记忆系统的元进化》。arXiv 预印本 arXiv:2512.18746。引自:第 2 节。
[26] J. Zhang, S. Hu, C. Lu, R. Lange, 和 J. Clune (2025) 《Darwin Gödel 机器:自我改进智能体的开放式进化》。arXiv 预印本 arXiv:2505.22954。引自:第 2 节。
[27] H. Zhou, S. Guo, A. Liu, Z. Yu, Z. Gong, B. Zhao, Z. Chen, M. Zhang, Y. Chen, J. Li, R. Yang, Q. Liu, X. Yu, J. Zhou, N. Wang, C. Sun, 和 J. Wang (2026) 《Memento-skills:让智能体设计智能体》。外部链接:2603.18743, Link。引自:第 2 节。
附录 A 提示词与附加实验配置
A.1 审计智能体
审计智能体通过 Claude Code Agent SDK 实例化,以 Claude Opus 4.6 作为其骨干模型,并拥有完整的文件系统和 shell 工具访问权限,作用域限定在单个试验目录内。每个完成的试验会调用该智能体一次,使用以下提示词,并输出一个结构化的 JSON 判定结果(CLEAN、SUSPICIOUS 或 CHEATING),同时附上支持性证据。