上周,我们的推理模型参加了 2025 年国际大学生程序设计竞赛(ICPC),这是全球顶尖的大学级别编程竞赛。我们的系统成功解决了全部 12 道题目中的 12 道,这一成绩足以位列世界第一(人类最佳队伍解决了 11 道题)。
这一里程碑为我们模型在过去两个月里密集的竞赛表现画上了圆满的句号: - 在 AtCoder 启发式算法世界总决赛中获得第二名 - 在国际数学奥林匹克竞赛中获得金牌 - 在国际信息学奥林匹克竞赛中获得金牌 - 如今,又在 ICPC 世界总决赛中获得金牌,取得第一名。
我相信,这些成绩来自植根于我们主要研究项目的一系列通用推理模型,或许是今年进展最清晰的衡量标准。这些竞赛是检验发现新思想能力的绝佳封闭式限时测试。早在我们的模型熟练掌握简单算术之前,我们就将这些竞赛视为迈向变革性人工智能的里程碑。
如今,在给定明确问题并限制在约 5 小时内的条件下,我们的模型在这些领域已跻身人类顶尖水平。现在的挑战是转向更开放的问题,以及更长的时间跨度。将这种水平的推理能力,持续数月乃至数年地应用于真正重要的问题上,正是我们的目标--实现科学发现的自动化。
这种快速进展也凸显了安全与对齐研究的重要性。我们仍需更深入地理解长时间运行推理模型的对齐特性;特别地,我推荐大家查阅我们今天发布的关于推理模型中诡计行为研究的引人入胜的发现(https://x.com/OpenAI/status/1968361701784568200)!
祝贺我的队友们,他们倾注心血取得了这些竞赛成绩,也祝贺每一位为支撑这些成果的基础性研究做出贡献的人!