第67届国际数学奥林匹克竞赛(IMO2026)成绩近日揭晓,小红书大模型 dots-note-3.0以六道题全部答对的满分成绩斩获金牌。这是中国大模型首次获得 IMO 官方金牌水平认证,也是继谷歌 Gemini 之后全球第二个达到该成绩的大模型——且为满分,谷歌此前仅答对5/6题。
IMO 是国际数学奥林匹克竞赛的简称,每年汇聚全球顶尖中学生,陶哲轩等半数当代菲尔兹奖得主均出自该赛事。比赛分两天进行,每天4.5小时完成3道题,覆盖代数、组合、几何和数论四个方向,每题7分,满分42分。参赛者必须写出逻辑完整、可接受逐步审查的证明过程,这对大模型而言难度极高。

谷歌 Gemini 的 IMO 之路可作为参照:2024年首次挑战时仅获28分银牌,且需先将题目翻译成 Lean 等形式化语言,部分题目耗时数天;2025年 Gemini Deep Think 以自然语言端到端完成证明,4.5小时内解决5道题获得金牌。数学竞赛被视为大模型智力与推理能力的试金石,而 IMO 相比常规 Benchmark 有一个独特优势——未知性。每届赛题由专家命制并严格保密,模型无法提前针对性训练,只能依赖实时理解、探索和严密推理。
本届 IMO 金牌线为29分,较去年35分下降6分,整套赛题得分难度明显高于去年。29分意味着完整解决4道题再从剩余两题中拿1分即可进入金牌区间,而小红书大模型 dots-note-3.0全部答对,与金牌线之间整整相差13分。
满分成绩首先证明的是 Agentic 推理系统的稳定性。模型需要读懂自然语言条件,判断关键信息,提出中间结论,并组织成完整证明,任何条件误读或推导跳步都会被评审直接指出。dots-note-3.0在六类不同问题中连续拿满,意味着表现并非依赖某道题的偶然灵感。其次,模型直接以自然语言端到端处理,具备从问题理解到答案表达的完整闭环,代表其拥有可迁移的通用推理能力。

具体答题过程中,dots-note-3.0采用智能体方式,结合自然语言与 Python 代码执行推理解题,并借助递归自我批判能力审视自身论证。真正让人惊喜的是第三题——一道组合博弈问题。常见解法是将原问题转化为图论连通性问题再建立证明,而 dots-note-3.0转用归纳法,抓住了问题最本质的结构,设计出恰到好处的归纳对象与命题。
双 CMO 金牌得主刘涵祚评价其"正确且漂亮,结构紧凑、逻辑自然,即使放在 IMO 解答中也属于较为简洁优雅的一类"。CMO 金牌得主汪千桐认为其"简洁明了而且直击本质,每一步都顺理成章,但人类选手很难想到能从这个角度切入"。
对小红书而言,IMO 满分是一次重要的技术亮相。过去外界对其技术认知集中在内容社区、推荐算法和内容理解,基础模型领域的位置一直缺少公开权威的证明。IMO 满分不一样——42分就摆在那里,无需复杂解释,足以证明小红书已具备值得行业认真审视的基础模型能力,基础模型领域出现了一个值得关注的新玩家。据悉,dots-note-3.0即将开源。