![]()
IMO滿分金牌——這是AI數學推理能力的"圖靈測試"級別里程碑
2026年7月21日,一個注定被寫進AI史的日子:小紅書dots團隊帶著dots-note 3.0模型參加第67屆國際數學奧林匹克(IMO 2026),六道題全部滿分,42/42分,全球僅7位人類選手獲此成績。
這不是一個"AI又考了個高分"的新聞。IMO是地球上最難的數學競賽,沒有之一。每年全球最頂尖的高中生在IMO上鏖戰,能拿滿分的寥寥無幾。2026年,全球只有7個人類選手拿到了滿分金牌。現在,AI也做到了。
更令人震驚的是:dots-note 3.0不依賴形式化語言,直接讀取原始LaTeX題目,通過遞歸自我批判能力端到端完成解題。而且,它還是dots3系列中最輕量級的模型。
"IMO滿分金牌這個里程碑,背后是模型遞歸自我批判能力的突破。不依賴形式化驗證就能給出優雅證明,這對數學推理研究是個真信號,做推理方向的值得細讀。"——AIHOT編輯推薦語
1 IMO滿分意味著什么?不只是"AI會做題"
很多人會問:AI能考IMO滿分,跟我們有什么關系?
答案是:IMO滿分驗證的不是"AI會做題",而是"AI能推理"。
IMO的題目不是"1+1=2"的計算題。每道IMO題目都需要創造性的數學思維——你需要從零開始構建證明思路,嘗試不同的路徑,在遇到死胡同時回溯,最終找到一條優雅的證明路徑。這不是"模式匹配"能解決的問題,這是真正的"推理"。
過去,AI在數學推理上的表現一直差強人意。大語言模型可以"背誦"已知的數學定理,但遇到需要原創性思維的新問題時,往往會"胡編亂造"。這就是為什么IMO一直是AI的"終極考場"——它考的不是知識,而是創造力。
dots-note 3.0的滿分,意味著AI第一次在"需要創造性推理"的頂級智力競賽中,達到了人類頂尖水平。這不是"AI的記憶力比人好",而是"AI的推理能力開始逼近人類"。
![]()
遞歸自我批判——讓AI在解題過程中不斷"反思"自己的推理,是這次突破的核心
2 遞歸自我批判:dots-note 3.0的核心秘訣
dots-note 3.0最引人注目的技術特點是遞歸自我批判。
什么是遞歸自我批判?簡單說,就是讓模型在解題過程中不斷"反思"自己的推理是否正確。傳統的大模型在推理時是"一條路走到黑"——給出一個答案,然后堅持這個答案。但dots-note 3.0不同:它在生成每一步推理后,會主動檢查這一步是否正確、是否有漏洞、是否有更優雅的解法。
這就像人類數學家的工作方式:不是"寫下一個答案就完事",而是"反復推敲、反復修改、反復驗證"。高斯不會因為第一次嘗試就得到正確答案而停止——他會尋找更優美的證明。dots-note 3.0的遞歸自我批判,本質上是在模擬這種"數學家式的思維"。
而且,dots-note 3.0不依賴形式化驗證工具(如Lean、Coq等)。這意味著它不需要把數學問題翻譯成形式化語言,而是直接讀取人類寫的LaTeX題目,用人類的數學語言進行推理。這個能力,比依賴形式化工具的方案更接近"人類式的數學思維"。
dots-note 3.0 IMO 2026 核心數據
IMO成績:42/42分,滿分金牌
人類對比:全球僅7位人類選手獲滿分金牌
解題方式:不依賴形式化語言,直接讀取原始LaTeX題目
核心技術:遞歸自我批判
模型規模:dots3系列最輕量級模型
開源狀態:預期將開源
團隊:小紅書 dots 團隊
3 小紅書做AI?從"種草"到"IMO金牌"
很多人對小紅書的印象還停留在"種草平臺"。但dots團隊在AI數學推理上的突破,讓人不得不重新審視這家公司的技術實力。
小紅書dots團隊并非突然冒出來的。dots系列模型一直在數學推理、代碼生成等方向深耕。dots3系列在多個基準測試中都有出色表現。但IMO滿分金牌,無疑是最具沖擊力的"成績單"。
這背后是中國AI行業一個值得關注的趨勢:非傳統AI公司正在AI核心技術上取得突破。不只是BAT和字節,小紅書、快手、美團等公司也在AI研發上投入巨資。這些公司有獨特的業務場景和海量數據,當它們把AI能力與自身業務深度結合時,往往能產生意想不到的化學反應。
dots-note 3.0預期將開源,這意味著全世界的數學家和AI研究者都可以基于這個模型進行進一步的研究。這不僅是小紅書的勝利,也是開源AI社區的勝利。
![]()
從"會做題"到"能發現新的數學定理"——AI數學推理的下一站
4 從IMO滿分到"AI數學家":還有多遠?
IMO滿分是一個里程碑,但它不是終點。從"能解IMO題"到"能發現新的數學定理",中間還有巨大的鴻溝。
IMO的題目,再難也是"已知有解"的。每道題都有標準答案,評委會提前驗證過。AI做的是"找到已知的答案"。但真正的數學研究,面對的是"不知道有沒有解"的問題——你甚至不知道答案是否存在,不知道這條路是否走得通。
這種"在不確定性中探索"的能力,是當前AI不具備的。人類數學家可以花幾年甚至幾十年研究一個猜想(比如費馬大定理,花了358年才被證明),但AI目前還不能做這種"長期、開放式的探索"。
不過,騰訊混元同日發布的Hyra-1.0給出了一個方向:遞歸自我改進的研究智能體。Hyra在55個數學開放問題中刷新了29個歷史最好結果。如果dots的"遞歸自我批判"和Hyra的"遞歸自我改進"結合起來,AI自主進行數學研究的那一天,可能比我們想象的更近。
AI數學推理的三條技術路線
形式化驗證路線(Lean/Coq):將數學問題翻譯成形式化語言,用定理證明器驗證。優點是100%可靠,缺點是翻譯成本高、不靈活。
端到端推理路線(dots-note 3.0):直接讀取人類數學語言,自主推理。優點是靈活、接近人類思維,缺點是可靠性不如形式化驗證。
遞歸自我改進路線(Hyra-1.0):讓AI在推理過程中不斷改進自己的策略。優點是可能發現人類未發現的解法,缺點是穩定性不足。
5 冷靜看待:IMO滿分背后的"冰山"
盡管dots-note 3.0的IMO滿分令人振奮,但幾個現實問題值得冷靜思考:
42分≠42分。AI的42分和人類的42分,意義不完全相同。人類選手在考場上只有幾個小時,不能查閱資料,不能重試。AI的"考試環境"是否與人類完全一致?如果AI可以多次嘗試、可以選擇最優答案,那這個"滿分"的含金量需要更透明的評估標準。
最輕量級模型拿滿分,說明什么?dots-note 3.0是dots3系列最輕量級模型。這當然說明了"小模型也能有大能力",但反過來也說明:IMO題目可能被"過擬合"了。如果模型在訓練數據中見過類似題目,滿分就不完全代表"推理能力"。
從"解題"到"發現"的鴻溝。如前所述,IMO題目是"已知有解"的。真正的數學研究是"探索未知"。AI能否從"解題工具"進化為"發現工具",是下一個需要回答的問題。
IMO滿分金牌是一個里程碑,但它的真正意義不在于"AI比人類聰明",而在于"AI終于開始理解'推理'這件事了"。當AI不僅能"算"出答案,還能"想"出答案、"批判"自己的答案時,我們離通用人工智能就近了一步。這條路,剛剛開始。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.