![]()
新智元報(bào)道
一頁(yè)紙,啃下了一篇要用44頁(yè)頂刊論文才啃動(dòng)的硬骨頭。
1991年,《數(shù)學(xué)年刊》(Annals of Mathematics)上登出過(guò)一篇44頁(yè)的論文。
作者叫József Beck,這個(gè)名字在組合數(shù)學(xué)圈無(wú)人不知。
他是Beck-Fiala定理的提出者,1985年Fulkerson獎(jiǎng)得主,1986年國(guó)際數(shù)學(xué)家大會(huì)受邀報(bào)告人,差異理論的奠基者之一。
論文標(biāo)題是《單位圓上零點(diǎn)多項(xiàng)式的模:埃爾德什的一個(gè)問(wèn)題》,攻克的是埃爾德什問(wèn)題庫(kù)(Erd?s Problems)里編號(hào)119的那道題。
在單位圓上隨便取一串復(fù)數(shù)當(dāng)零點(diǎn),乘成多項(xiàng)式,這個(gè)多項(xiàng)式在單位圓上的最大模Mn,能不能保證在無(wú)窮多個(gè)n處超過(guò)n的c次方。
Beck證明了,能。這道題是那個(gè)年代公認(rèn)最難啃的硬骨頭。
![]()
AI領(lǐng)走了埃爾德什的賞金。119號(hào)問(wèn)題當(dāng)年一口氣問(wèn)了三問(wèn),第三問(wèn)懸賞100美元,如今狀態(tài)已改為SOLVED。
35年后,這篇論文被一頁(yè)紙超過(guò)了。
說(shuō)這話的,是Thomas Bloom。
他是一位數(shù)學(xué)家、曼徹斯特大學(xué)研究員,也是erdosproblems.com網(wǎng)站的創(chuàng)建者和維護(hù)者。
埃爾德什留下的1000多道開(kāi)放問(wèn)題都掛在這個(gè)網(wǎng)站上,是全球數(shù)學(xué)家追蹤這些問(wèn)題的第一站。
正因如此,AI公司每次宣稱「解決了埃爾德什問(wèn)題」,都要先過(guò)他這一關(guān)。
他在X上寫(xiě)道:
目前為止,GPT-5.6 Sol是我見(jiàn)過(guò)數(shù)學(xué)上最有意思的新模型。那些提交到erdosproblems.com的新證明,凡是我細(xì)看過(guò)的,全部正確,而且都包含一些有趣的想法。
![]()
Bloom還特意強(qiáng)調(diào),這不是因?yàn)锳I動(dòng)用了什么更復(fù)雜的武器,而是我們?cè)疽詾椋@道題比它實(shí)際上難得多。
OpenAI總裁Greg Brockman轉(zhuǎn)發(fā)了這條推文,說(shuō)了一句:
感覺(jué)這是推進(jìn)數(shù)學(xué)的一個(gè)分水嶺時(shí)刻。能真正改善人類生活的科學(xué)與醫(yī)學(xué)突破,現(xiàn)在感覺(jué)非常近了。
![]()
埃爾德什的100美元懸賞
AI領(lǐng)走了
先把這道題的來(lái)龍去脈捋清楚。
1957年,埃爾德什在一篇論文里問(wèn)出了這道題,一口氣問(wèn)了三問(wèn),問(wèn)的是單位圓上零點(diǎn)多項(xiàng)式的模。
此后的四十年里,他在1961、1964、1982、1990、1997年反復(fù)重提。
第一問(wèn),Wagner在1980年拿下。
第二問(wèn),Beck在1991年拿下,證明存在某個(gè)c>0,使得max_{n≤N} M_n > N^c。這就是那篇44頁(yè)的《數(shù)學(xué)年刊》論文。
![]()
Beck這篇論文發(fā)表于《數(shù)學(xué)年刊》1991年第134卷第3期
第三問(wèn),埃爾德什自己掏錢(qián)掛了100美元賞金,出處是他1997年的一篇文章。
現(xiàn)在,領(lǐng)走賞金的是GPT-5.6和一位叫Korsky的數(shù)學(xué)家。他們只用一頁(yè)紙,就搞定了Beck沒(méi)碰的那一問(wèn)。
![]()
埃爾德什一生提出上千道問(wèn)題,并自掏腰包為它們懸賞,金額從25美元到1萬(wàn)美元不等。
Bloom的評(píng)價(jià)是:GPT在Korsky的提示下,只用了1頁(yè)簡(jiǎn)單的調(diào)和分析技巧,就證出了比Beck那篇44頁(yè)Annals論文更強(qiáng)的結(jié)果。
關(guān)鍵的一步,Bloom后來(lái)在討論區(qū)里點(diǎn)破了:把一個(gè)非負(fù)函數(shù)做卷積,再在時(shí)間上平移1,表達(dá)式一下子就光滑了,原本硬啃的地方順了下來(lái)。
他說(shuō),這種把算子范數(shù)放到對(duì)偶范數(shù)和內(nèi)積里去估的路數(shù),本來(lái)就是分析里最常用的招之一。
不是新工具,是舊工具用在了沒(méi)人想過(guò)的地方。
![]()
Bloom說(shuō)明,Beck那篇Annals論文里有許多重要而有趣的想法,只是這道題用不上。他補(bǔ)了一句:至少對(duì)我來(lái)說(shuō),這挺意外的。
他還提到一個(gè)細(xì)節(jié):沒(méi)人算過(guò)那個(gè)常數(shù),估計(jì)非常小。Beck自己當(dāng)年也沒(méi)算,而依他的判斷,如果那個(gè)常數(shù)值得一提,Beck不會(huì)不算。
所以,這不是AI推翻了頂刊,而是發(fā)現(xiàn)了一條人類本來(lái)可以不繞的彎路。
對(duì)數(shù)學(xué)家來(lái)說(shuō),這比「AI又解出一道題」刺激得多。
解出一道題,只是多了個(gè)工具。這一次,是工具反過(guò)來(lái)糾正了用工具的人。
人會(huì)聳聳肩走開(kāi)
AI會(huì)接著試下一個(gè)
如果只有這一件事,它頂多算個(gè)漂亮的孤例。
GPT-5.6 Sol Ultra于7月9日全量放開(kāi),7月10日,OpenAI宣布GPT-5.6 Sol Ultra產(chǎn)出了Cycle Double Cover猜想的完整證明。
這道題由Szekeres在1973年、Seymour在1979年各自獨(dú)立提出,懸了約五十年。
模型被分配了8小時(shí),實(shí)際用了不到1小時(shí),跑法是64個(gè)子智能體并行開(kāi)工。提示詞和證明PDF全部公開(kāi)。
Bloom是第一個(gè)給出實(shí)質(zhì)評(píng)價(jià)的人。
他說(shuō)這是一個(gè)很漂亮的證明,然后給了三個(gè)形容詞:
短。初等。1980年代就本可以被發(fā)現(xiàn)。
他也點(diǎn)出了背后的原因:他推測(cè),關(guān)鍵那一步里有一個(gè)很小的、反直覺(jué)的拐彎。
一個(gè)人類數(shù)學(xué)家會(huì)怎么處理這道題?
他會(huì)先試那個(gè)最自然的做法,檢查一遍線性代數(shù),發(fā)現(xiàn)不行,然后聳聳肩,心里想一句「本來(lái)也沒(méi)指望能這么容易」,起身走人。
但AI不會(huì)氣餒。它會(huì)接著做小變體,直到某一個(gè)成立為止。
AI強(qiáng)在不做情緒性止損。
回頭看今年4月,GPT-5.4 Pro在80分鐘里解掉了Erd?s 1196,用的是von Mangoldt函數(shù)。
牛津的Jared Lichtman在那個(gè)問(wèn)題上耗了七年,他后來(lái)說(shuō),自1935年以來(lái),所有做原始集問(wèn)題的人都習(xí)慣了同一個(gè)開(kāi)局動(dòng)作,而那個(gè)動(dòng)作,遮蔽了一個(gè)在明處擺了整整90年的技術(shù)可能。
陶哲軒看完的評(píng)價(jià)更狠:過(guò)去幾十年,人類在第一步就集體走偏了。
人類的直覺(jué)當(dāng)然不是缺陷。恰恰相反,它是效率工具:替我們省掉了海量注定失敗的嘗試,沒(méi)有它,沒(méi)人能在有限的一生里走到學(xué)科前沿。
代價(jià)是,偶爾它也會(huì)省掉不該省的那一次。
說(shuō)GPT-5.6有意思的人
去年說(shuō)過(guò)另一句話
去年10月,Bloom曾公開(kāi)打臉OpenAI。
當(dāng)時(shí),OpenAI副總裁Kevin Weil轉(zhuǎn)發(fā)了Mark Sellke的帖子并寫(xiě)道:GPT-5剛剛找到了10道此前未解的埃爾德什問(wèn)題的解,另有11道取得進(jìn)展,這些題都已經(jīng)開(kāi)放了數(shù)十年。
![]()
Bloom一句話回應(yīng)為此定性:戲劇性的誤導(dǎo)。
他說(shuō)這些題在網(wǎng)站上標(biāo)著open,只意味著他本人不知道有哪篇論文解決過(guò)它。GPT-5干的事情,是把他不知道的那些文獻(xiàn)翻了出來(lái)。
而找到文獻(xiàn),不等于造出證明。
![]()
接下來(lái)的情形,許多人都記得。
LeCun在旁邊補(bǔ)刀,暗諷自己埋的雷炸了自己。Hassabis更直接:這太尷尬了。
![]()
Weil刪帖。
OpenAI研究員Sébastien Bubeck最后承認(rèn)只是找到了文獻(xiàn)里已有的解。
今年5月OpenAI再宣布推翻一個(gè)1946年的埃爾德什幾何猜想時(shí),在公告里同步附上Noga Alon、Melanie Wood和Thomas Bloom的評(píng)價(jià)。
AI數(shù)學(xué)撞墻了嗎?
Bloom那條帖子底下的論戰(zhàn),也很精彩。
唱衰派以用戶qrdl為代表,「5.6的思維鏈輸出少得可憐,677那道題毫無(wú)進(jìn)展,物理側(cè)的CritPT評(píng)測(cè)相比5.4幾乎沒(méi)動(dòng)」。
他的結(jié)論是:AI在數(shù)學(xué)上已經(jīng)撞墻了。
![]()
用戶qrdl在論壇發(fā)帖,說(shuō)CritPT自5.4以來(lái)幾乎沒(méi)動(dòng),除非他們找到了給基準(zhǔn)刷分的辦法,否則結(jié)果也就這樣。
qrdl的論證倒不情緒化。
他認(rèn)為大模型本質(zhì)上是靜態(tài)權(quán)重的token生成器,做數(shù)學(xué)的時(shí)候,不會(huì)像人一樣實(shí)時(shí)長(zhǎng)出新的神經(jīng)連接。而真正的創(chuàng)造性跳躍,需要一個(gè)有彈性的大腦。
qrdl的體感是:每次開(kāi)新會(huì)話去攻677,模型就把那些早已失敗過(guò)的老招式再來(lái)一遍。
回懟來(lái)得也很快。
Nat Sothanaphan指出,CritPT是物理測(cè)試,不是數(shù)學(xué)基準(zhǔn),拿它一家的曲線證明AI在數(shù)學(xué)上撞墻,是挑對(duì)自己有利的數(shù)據(jù)。
他給的反證是:5.6在包括FrontierMath在內(nèi)的一大批評(píng)測(cè)上都比5.5有提升。
另一派是實(shí)戰(zhàn)派,代表是名為old-bielefelder的用戶。
![]()
old-bielefelder報(bào)告,GPT-5.6 Sol思考14分鐘、復(fù)核9分多鐘,把Pintz 2018年那個(gè)0.72的指數(shù)改進(jìn)到0.7195。
不算驚天動(dòng)地,但確實(shí)動(dòng)了,用old-bielefelder自己的說(shuō)法是「第一口奶」。
作為對(duì)照,前一天晚上GPT-5.5在同一個(gè)問(wèn)題上磨了一個(gè)多小時(shí),0.72紋絲不動(dòng)。
他隨后把結(jié)果直接通知了Pintz本人。
第三種聲音同樣來(lái)自Nat Sothanaphan,他借用了Bloom的一個(gè)說(shuō)法:現(xiàn)代數(shù)學(xué)是一座巨大的教堂。
走到這座教堂的最前沿本身就極耗力氣,而大模型已經(jīng)能以超人的效率做到這件事,最近的突破基本都源于此。再往前推,需要的是流動(dòng)智力。
有人說(shuō)大模型沒(méi)有流動(dòng)智力,他認(rèn)為這是錯(cuò)的。
ARC系列評(píng)測(cè)這幾年的持續(xù)上漲就是證據(jù),GPT-5.6 Sol在最高推理檔位下拿到7.8%。這個(gè)基準(zhǔn)今年3月上線時(shí),最好成績(jī)是0.37%,而人類穩(wěn)定在90%以上。
![]()
ARC Prize官方驗(yàn)證成績(jī)。GPT-5.6 Sol在ARC-AGI-3上的表現(xiàn)隨推理檔位陡升,Low檔只有0.3%,Max檔拿到7.8%。
他的解釋是:教堂的地基太龐大了,龐大到把那點(diǎn)正在快速生長(zhǎng)的流動(dòng)智力完全蓋住。所以你光看產(chǎn)出的分量,會(huì)覺(jué)得什么都沒(méi)發(fā)生。
但等到某一天流動(dòng)智力開(kāi)始?jí)哼^(guò)地基,它會(huì)突然變得肉眼可見(jiàn)。
吵了兩周,這場(chǎng)爭(zhēng)論真正吵出來(lái)的,不是「AI能不能做數(shù)學(xué)」,是「難」這個(gè)字要怎么定義。
數(shù)學(xué)史上那些標(biāo)著「懸而未決」的條目,一部分記錄的是問(wèn)題本身的難度,另一部分記錄的只是人類耐心的邊界。
過(guò)去這兩者混在一起,沒(méi)人分得開(kāi)。現(xiàn)在,開(kāi)始能區(qū)分了。
一道題掛了幾十年沒(méi)人領(lǐng)走,可能不是因?yàn)樗卸嚯y,而是因?yàn)闆](méi)人肯在那條路上再試第三十次。
還有多少題目,卡住它們的其實(shí)只是人類的耐心?
參考資料:
https://annals.math.princeton.edu/1991/134-3/p03
https://www.erdosproblems.com/forum/thread/AI%20Contributions
https://arcprize.org/results/openai-gpt-5-6-sol
編輯:元宇
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.