兄弟们,国产模型高光时刻来了。结果有点牛逼。
去年IMO大赛,只有Gemini Deep Think和一个实验性OpenAI模型勉强拿到35分。
而就在今年刚刚结束IMO 2026 大赛中,我实测了模型GPT-SOL-5.6-High 、Claude-Fable-5 、Qwen3.8-Max-Preview、KIMI K3 模型,满分为42分,6道题目。
结论: 3个模型全部执行完成任务并且得分为满分42分,Fable 5 把我的额度干没了还没有完成任务。
因为结果都正确,时间排序如下: 1、 GPT-SOL-5.6-High (14m58s), 2、Qwen3.8-Max-Preview (45mins), 3、Kimi K3 (1h32m6s)
每个模型都是一次性解决所有问题,与博主@@deedydas 测试的时间和次数有点不同。基本都是一次性在CLI终端跑完。
去年还是"接近人类顶尖水平",今年已经变成多个主流模型都能稳定一次过。
数学竞赛这种需要严密推理、多步推导、创造性解题的顶级人类挑战,现在对前沿模型来说已经不是障碍了。
速度的问题也可能受到API速率和算力的影响,真的没有想到如今已经IMO都可以轻松完赛啊!
真的是感慨AI的前沿领域已经正式远远超越了国际数学奥林匹克竞赛(IMO)的数学范畴啊。