小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅 哈小红书你真是闷声干大事啊刚刚IMO 2026成绩新鲜出炉大模型交卷今年卷到了新高度。结果第一个拿到官方评卷满分的居然是小红书经IMO官方评定小红书大模型dots-note-3.0六道题全部答对以满分成绩斩获金牌。含金量有多高呢这么说吧这是中国大模型首次获得IMO官方金牌水平认证也是继谷歌Gemini模型之后全球第二个达到该成绩的大模型。而且划重点是满分谷歌当年也只答对了5/6……震惊了这还是我印象中的小红书吗首次登上世界级竞赛就来了场开门红再往下深扒小红书大模型dots-note-3.0的解题方式也让人眼前一亮又一亮它仅用自然语言就完成了从读题、解析到写证明的全过程最终答案不仅全部正确在部分题目上还创新地提出了非常规解法。△图片由AI生成双CMO金牌得主刘涵祚看完后这样评价模型最终给出了一条正确且漂亮的证明思路。这种解法结构紧凑、逻辑自然即使放在IMO解答中也属于较为简洁优雅的一类。CMO金牌得主汪千桐也给出了相似的结论从数学审美的角度看小红书大模型dots-note-3.0的解答非常漂亮也很优雅。常规解法已经很巧妙但dots直接攻克了题目最难、也最本质的部分。在他看来dots解题简洁明了而且直击本质。看完以后会觉得每一步都顺理成章但真正拿到题目时人类选手很难想到能从这个角度切入。换句话说IMO满分金牌或许还远不是小红书大模型dots-note-3.0能力的上限。为什么当前的大模型需要IMO先来个科普讲讲IMO究竟是什么又为何各家都在争先送自家大模型上考场。IMO又叫国际数学奥林匹克竞赛每年全世界最顶尖的中学生云集于此。陶哲轩等几乎半数当代菲尔兹奖得主都是从IMO出来的谷歌联创Sergey Brin也拿过IMO金牌。比赛一般分两天进行每天4.5小时需要完成3道题总计6道题覆盖代数、组合、几何和数论四个方向。每题7分满分42分。但光有答案还不算数参赛者要想拿分必须写出逻辑完整、能接受逐步审查的证明过程。这对大模型来说难度极高却也是最直观的能力展示途径。以Gemini为例2024年谷歌首次挑战IMO最终只拿到28分的银牌水平彼时系统也还需要先将自然语言题目翻译成Lean等形式化语言部分题目耗时甚至长达数天。第二年卷土重来Gemini Deep Think直接以自然语言端到端完成证明用4.5小时就解决了5道题获得金牌。这背后是一次跨代的能力跃迁。往深了说数学就是大模型智力与推理能力的试金石大模型在IMO这类数学竞赛中走得越远越能说明其底层优势。再举个最近的例子就在本周Fable 5参与构造了一个雅可比猜想反例。该猜想自1939年提出以来悬而未决长达87年连张益唐等顶尖数学家都曾在此折戟。这次找到的反例虽尚未经过正式同行评审但也标志着大模型现阶段的能力足以参与真正的数学发现。而数学竞赛正是模型进入科研深水区之前那道最硬核的能力门槛。除此之外IMO还有一个相比Benchmark得天独厚的优势——未知。每届比赛的赛题都是由专家命制在正式比赛前严格保密。也就是说模型不可能提前拿到原题实时参与当届比赛也能够确保模型无法提前进行针对性训练。一位头部模型研究员对此给出了这样的判断在今天的模型训练里你基本可以认为互联网上一旦出现了某些数据很快就会被模型拿去训练模型也就知道了。所以如果要测试一个模型到底聪不聪明只能测一些没有公开过的东西。这恰是同步参与官方IMO测评之于大模型最难复制的价值。它考验的不是模型记住了多少题目和数学知识而是在一个真正未知的问题第一次出现时模型能否独立理解、探索并最终完成严密推理。而且只有新题还不够官方评测采用的是严格的当届赛事流程。每个比赛日的学生考试结束后模型团队才会收到当天题目并须在规定期限内提交PDF答卷。模型将直接阅读英文题目并生成证明工作人员只负责保障系统运行。最终答卷则由来自不同国家的IMO评审员按照正式标准进行审阅。本届新题、规定时间、完整证明、第三方专业评审当这些条件同时成立才让IMO成为现下很难靠背题和包装绕过去的能力大考。一分没丢比拿到金牌更难正因如此这次小红书大模型dots-note-3.0能拿到金牌还是满分就显得格外醒目。六道题全部做对首先证明的是Agentic推理系统稳定性。模型需要读懂自然语言条件判断哪些信息真正关键提出可能成立的中间结论再将它们组织成一套完整证明。整个过程中任何一个条件被误读、任何一次推导跳步都会留下可以被评审直接指出的漏洞。小红书大模型dots-note-3.0能够在六类不同问题中连续拿满意味着它的表现并非依赖某一道题上的偶然灵感迸发。其次小红书大模型dots-note-3.0直接一步到位使用自然语言端到端处理也意味着模型能够像人类选手一样直接读懂题目、自主寻找路径具备从问题理解到答案表达的完整闭环。它代表模型拥有可迁移的通用推理能力。具体来说在本次答题过程中小红书大模型dots-note-3.0用智能体的方式让模型使用自然语言结合python代码执行来推理解题。在推理过程中也会借助递归自我批判能力审视自己的论证从而解决更多现实中的复杂任务。△图片由AI生成不过让人真正感到惊喜的还是第三题传递出的模型创新思维。这是一道组合博弈问题网上关于本届IMO赛题讨论的常见解法是先将原问题转化成图论中的连通性问题再借助图论语言建立证明。这条路线本身已经非常巧妙但小红书大模型dots-note-3.0没有沿用它而是转用归纳。小红书大模型dots-note-3.0的解法抓住了问题最本质的结构设计出了恰到好处的归纳对象与归纳命题。这也解释了为什么CMO得主汪千桐会用漂亮和优雅来形容这套答案。小红书大模型dots-note-3.0对问题结构的剖析之深会让人自然而然产生一种恍然大悟的感觉。回到结果本身上模型能够在本届拿下满分其实相当不易我们可以从以下几个层面来看。第一层本届整套赛题的得分难度明显高于去年。2026年IMO金牌线为29分去年则高达35分短短一年金牌线下降了6分几乎是一整道题的分数。所以这一届的金牌较之去年的Gemini分量更重。第二层满分与金牌之间亦有差距今年整整相差13分。29分意味着选手完整解决4道题再从剩余两道题中拿到1分就已经能够进入金牌区间。而小红书大模型dots-note-3.0全部all in直接抵达了这套试卷能够衡量的最高点。毕竟老话说得好满分只是卷面的上限不是它的上限。金牌的确代表进入了全球最顶尖的一批但满分则代表在这批顶尖选手中再完成一次极小概率筛选。小红书大模型dots-note-3.0即将开源选择IMO作为起始站也是小红书非常聪明的一步。如今行业内想要把大模型底层技术能力推广出去一般是两个方向一个是Coding另一个就是数学。原因也很简单这两种任务的结果都很难靠语言包装蒙混过关相比知识问答和主观评测它们更直接地考查模型能否真正理解复杂问题、拆解任务并持续推进。IMO更是其中的佼佼者知名度高、业内认可度也够直接给到的是模型面对高难度未知问题时所展现出的深度推理能力。所以对小红书而言这是一次重要的技术亮相。过去外界对小红书的技术认知更多集中在内容社区、推荐算法和内容理解上。在基础模型领域小红书究竟处于什么位置一直缺少一份足够公开权威而且不需要复杂解释的成绩单。参数规模很难直接等同于能力常规Benchmark上的几个百分点也难让行业形成鲜明认知。IMO满分不一样42分就摆在那里足以证明小红书已经具备值得行业认真审视的基础模型能力。它用一枚IMO满分金牌让行业第一次看清了自己的技术成色——基础模型领域出现了一个值得关注的新玩家。P.S.对应模型即将开源敬请期待