# 小红书大模型 dots-note-3.0 以满分获 IMO 2026 金牌，第三题解法获冠军选手称赞

- 来源：IT之家（RSS）
- 发布时间：2026-07-22 08:44
- AIHOT 分数：72
- AIHOT 链接：https://aihot.virxact.com/items/cmrvd7lml00wgbihbdjosaked
- 原文链接：https://www.ithome.com/0/979/839.htm

## AI 摘要

小红书大模型 dots-note-3.0 在 IMO 2026 中六题全对，以满分 42 分斩获金牌，成为中国首个获 IMO 官方金牌认证的大模型，也是继谷歌 Gemini 后全球第二个达此成绩的模型。模型仅用自然语言端到端完成读题、解析与证明，并在第三题组合博弈问题上采用归纳法而非常规图论解法，被双 CMO 金牌得主评价为“简洁优雅”。该模型即将开源。

## 正文

刚刚，IMO 2026 成绩新鲜出炉，大模型交卷今年卷到了新高度。经 IMO 官方评定，小红书大模型 dots-note-3.0，六道题全部答对，以满分成绩斩获金牌。

含金量有多高呢？

这么说吧，这是中国大模型首次获得 IMO 官方金牌水平认证，也是继谷歌 Gemini 模型之后，全球第二个达到该成绩的大模型。

而且划重点！是满分！谷歌当年也只答对了 5/6……

震惊了，这还是我印象中的小红书吗？

首次登上世界级竞赛，就来了场开门红～

再往下深扒，小红书大模型 dots-note-3.0 的解题方式也让人眼前一亮又一亮：

它仅用自然语言就完成了从读题、解析到写证明的全过程，最终答案不仅全部正确，在部分题目上还创新地提出了非常规解法。

双 CMO 金牌得主刘涵祚看完后这样评价：

模型最终给出了一条正确且漂亮的证明思路。

这种解法结构紧凑、逻辑自然，即使放在 IMO 解答中，也属于较为简洁优雅的一类。

CMO 金牌得主汪千桐也给出了相似的结论：

从数学审美的角度看，小红书大模型 dots-note-3.0 的解答非常漂亮也很优雅。

常规解法已经很巧妙，但 dots 直接攻克了题目最难、也最本质的部分。

在他看来，dots 解题简洁明了而且直击本质。

看完以后，会觉得每一步都顺理成章，但真正拿到题目时，人类选手很难想到能从这个角度切入。

换句话说，IMO 满分金牌或许还远不是小红书大模型 dots-note-3.0 能力的上限。

为什么当前的大模型需要 IMO

先来个科普，讲讲 IMO 究竟是什么，又为何各家都在争先送自家大模型上考场。

IMO 又叫国际数学奥林匹克竞赛，每年全世界最顶尖的中学生云集于此。

陶哲轩等几乎半数当代菲尔兹奖得主都是从 IMO 出来的，谷歌联创 Sergey Brin 也拿过 IMO 金牌。

比赛一般分两天进行，每天 4.5 小时需要完成 3 道题，总计 6 道题，覆盖代数、组合、几何和数论四个方向。每题 7 分，满分 42 分。

但光有答案还不算数，参赛者要想拿分，必须写出逻辑完整、能接受逐步审查的证明过程。

这对大模型来说，难度极高，却也是最直观的能力展示途径。

以 Gemini 为例，2024 年谷歌首次挑战 IMO，最终只拿到 28 分的银牌水平，彼时系统也还需要先将自然语言题目翻译成 Lean 等形式化语言，部分题目耗时甚至长达数天。

第二年卷土重来，Gemini Deep Think 直接以自然语言端到端完成证明，用 4.5 小时就解决了 5 道题，获得金牌。

这背后是一次跨代的能力跃迁。

往深了说，数学就是大模型智力与推理能力的试金石，大模型在 IMO 这类数学竞赛中走得越远，越能说明其底层优势。

再举个最近的例子，就在本周，Fable 5 参与构造了一个雅可比猜想反例。

该猜想自 1939 年提出以来悬而未决长达 87 年，连张益唐等顶尖数学家都曾在此折戟。

这次找到的反例虽尚未经过正式同行评审，但也标志着大模型现阶段的能力足以参与真正的数学发现。

而数学竞赛，正是模型进入科研深水区之前，那道最硬核的能力门槛。

除此之外，IMO 还有一个相比 Benchmark 得天独厚的优势 —— 未知。

每届比赛的赛题都是由专家命制，在正式比赛前严格保密。

也就是说，模型不可能提前拿到原题，实时参与当届比赛，也能够确保模型无法提前进行针对性训练。

一位头部模型研究员对此给出了这样的判断：

在今天的模型训练里，你基本可以认为，互联网上一旦出现了某些数据，很快就会被模型拿去训练，模型也就知道了。

所以如果要测试一个模型到底聪不聪明，只能测一些没有公开过的东西。

这恰是同步参与官方 IMO 测评之于大模型最难复制的价值。

它考验的不是模型记住了多少题目和数学知识，而是在一个真正未知的问题第一次出现时，模型能否独立理解、探索，并最终完成严密推理。

而且只有新题还不够，官方评测采用的是严格的当届赛事流程。

每个比赛日的学生考试结束后，模型团队才会收到当天题目，并须在规定期限内提交 PDF 答卷。

模型将直接阅读英文题目并生成证明，工作人员只负责保障系统运行。

最终答卷则由来自不同国家的 IMO 评审员，按照正式标准进行审阅。

本届新题、规定时间、完整证明、第三方专业评审，当这些条件同时成立，才让 IMO 成为现下很难靠背题和包装绕过去的能力大考。

一分没丢，比拿到金牌更难

正因如此，这次小红书大模型 dots-note-3.0 能拿到金牌，还是满分，就显得格外醒目。

六道题全部做对，首先证明的是 Agentic 推理系统稳定性。

模型需要读懂自然语言条件，判断哪些信息真正关键，提出可能成立的中间结论，再将它们组织成一套完整证明。

整个过程中，任何一个条件被误读、任何一次推导跳步，都会留下可以被评审直接指出的漏洞。

小红书大模型 dots-note-3.0 能够在六类不同问题中连续拿满，意味着它的表现并非依赖某一道题上的偶然灵感迸发。

其次，小红书大模型 dots-note-3.0 直接一步到位，使用自然语言端到端处理，也意味着模型能够像人类选手一样直接读懂题目、自主寻找路径，具备从问题理解到答案表达的完整闭环。

它代表模型拥有可迁移的通用推理能力。

具体来说，在本次答题过程中，小红书大模型 dots-note-3.0 用智能体的方式，让模型使用自然语言结合 python 代码执行来推理解题。

在推理过程中，也会借助递归自我批判能力，审视自己的论证，从而解决更多现实中的复杂任务。

图片由 AI 生成

不过，让人真正感到惊喜的，还是第三题传递出的模型创新思维。

这是一道组合博弈问题，网上关于本届 IMO 赛题讨论的常见解法，是先将原问题转化成图论中的连通性问题，再借助图论语言建立证明。

这条路线本身已经非常巧妙，但小红书大模型 dots-note-3.0 没有沿用它，而是转用归纳。

小红书大模型 dots-note-3.0 的解法，抓住了问题最本质的结构，设计出了恰到好处的归纳对象与归纳命题。

这也解释了，为什么 CMO 得主汪千桐会用漂亮和优雅来形容这套答案。

小红书大模型 dots-note-3.0 对问题结构的剖析之深，会让人自然而然产生一种恍然大悟的感觉。

回到结果本身上，模型能够在本届拿下满分，其实相当不易，我们可以从以下几个层面来看。

第一层，本届整套赛题的得分难度明显高于去年。

2026 年 IMO 金牌线为 29 分，去年则高达 35 分，短短一年，金牌线下降了 6 分，几乎是一整道题的分数。

所以这一届的金牌，较之去年的 Gemini，分量更重。

第二层，满分与金牌之间亦有差距，今年整整相差 13 分。

29 分意味着，选手完整解决 4 道题，再从剩余两道题中拿到 1 分，就已经能够进入金牌区间。而小红书大模型 dots-note-3.0 全部 all in，直接抵达了这套试卷能够衡量的最高点。

毕竟老话说得好，满分只是卷面的上限，不是它的上限。

金牌的确代表进入了全球最顶尖的一批，但满分则代表在这批顶尖选手中，再完成一次极小概率筛选。

小红书大模型 dots-note-3.0 即将开源

选择 IMO 作为起始站，也是小红书非常聪明的一步。

如今行业内，想要把大模型底层技术能力推广出去，一般是两个方向，一个是 Coding，另一个就是数学。

原因也很简单，这两种任务的结果，都很难靠语言包装蒙混过关，相比知识问答和主观评测，它们更直接地考查模型能否真正理解复杂问题、拆解任务并持续推进。

IMO 更是其中的佼佼者，知名度高、业内认可度也够，直接给到的是模型面对高难度未知问题时，所展现出的深度推理能力。

所以对小红书而言，这是一次重要的技术亮相。

过去，外界对小红书的技术认知，更多集中在内容社区、推荐算法和内容理解上。

在基础模型领域，小红书究竟处于什么位置，一直缺少一份足够公开权威，而且不需要复杂解释的成绩单。

参数规模很难直接等同于能力，常规 Benchmark 上的几个百分点，也难让行业形成鲜明认知。

IMO 满分不一样，42 分就摆在那里，足以证明，小红书已经具备值得行业认真审视的基础模型能力。

它用一枚 IMO 满分金牌，让行业第一次看清了自己的技术成色 ——

基础模型领域，出现了一个值得关注的新玩家。
