![]()
新智元報道
一頁紙,啃下了一篇要用44頁頂刊論文才啃動的硬骨頭。
1991年,《數學年刊》(Annals of Mathematics)上登出過一篇44頁的論文。
作者叫József Beck,這個名字在組合數學圈無人不知。
他是Beck-Fiala定理的提出者,1985年Fulkerson獎得主,1986年國際數學家大會受邀報告人,差異理論的奠基者之一。
論文標題是《單位圓上零點多項式的模:埃爾德什的一個問題》,攻克的是埃爾德什問題庫(Erd?s Problems)里編號119的那道題。
在單位圓上隨便取一串復數當零點,乘成多項式,這個多項式在單位圓上的最大模Mn,能不能保證在無窮多個n處超過n的c次方。
Beck證明了,能。這道題是那個年代公認最難啃的硬骨頭。
![]()
AI領走了埃爾德什的賞金。119號問題當年一口氣問了三問,第三問懸賞100美元,如今狀態已改為SOLVED。
35年后,這篇論文被一頁紙超過了。
說這話的,是Thomas Bloom。
他是一位數學家、曼徹斯特大學研究員,也是erdosproblems.com網站的創建者和維護者。
埃爾德什留下的1000多道開放問題都掛在這個網站上,是全球數學家追蹤這些問題的第一站。
正因如此,AI公司每次宣稱「解決了埃爾德什問題」,都要先過他這一關。
他在X上寫道:
目前為止,GPT-5.6 Sol是我見過數學上最有意思的新模型。那些提交到erdosproblems.com的新證明,凡是我細看過的,全部正確,而且都包含一些有趣的想法。
![]()
Bloom還特意強調,這不是因為AI動用了什么更復雜的武器,而是我們原本以為,這道題比它實際上難得多。
OpenAI總裁Greg Brockman轉發了這條推文,說了一句:
感覺這是推進數學的一個分水嶺時刻。能真正改善人類生活的科學與醫學突破,現在感覺非常近了。
![]()
埃爾德什的100美元懸賞
AI領走了
先把這道題的來龍去脈捋清楚。
1957年,埃爾德什在一篇論文里問出了這道題,一口氣問了三問,問的是單位圓上零點多項式的模。
此后的四十年里,他在1961、1964、1982、1990、1997年反復重提。
第一問,Wagner在1980年拿下。
第二問,Beck在1991年拿下,證明存在某個c>0,使得max_{n≤N} M_n > N^c。這就是那篇44頁的《數學年刊》論文。
![]()
Beck這篇論文發表于《數學年刊》1991年第134卷第3期
第三問,埃爾德什自己掏錢掛了100美元賞金,出處是他1997年的一篇文章。
現在,領走賞金的是GPT-5.6和一位叫Korsky的數學家。他們只用一頁紙,就搞定了Beck沒碰的那一問。
![]()
埃爾德什一生提出上千道問題,并自掏腰包為它們懸賞,金額從25美元到1萬美元不等。
Bloom的評價是:GPT在Korsky的提示下,只用了1頁簡單的調和分析技巧,就證出了比Beck那篇44頁Annals論文更強的結果。
關鍵的一步,Bloom后來在討論區里點破了:把一個非負函數做卷積,再在時間上平移1,表達式一下子就光滑了,原本硬啃的地方順了下來。
他說,這種把算子范數放到對偶范數和內積里去估的路數,本來就是分析里最常用的招之一。
不是新工具,是舊工具用在了沒人想過的地方。
![]()
Bloom說明,Beck那篇Annals論文里有許多重要而有趣的想法,只是這道題用不上。他補了一句:至少對我來說,這挺意外的。
他還提到一個細節:沒人算過那個常數,估計非常小。Beck自己當年也沒算,而依他的判斷,如果那個常數值得一提,Beck不會不算。
所以,這不是AI推翻了頂刊,而是發現了一條人類本來可以不繞的彎路。
對數學家來說,這比「AI又解出一道題」刺激得多。
解出一道題,只是多了個工具。這一次,是工具反過來糾正了用工具的人。
人會聳聳肩走開
AI會接著試下一個
如果只有這一件事,它頂多算個漂亮的孤例。
GPT-5.6 Sol Ultra于7月9日全量放開,7月10日,OpenAI宣布GPT-5.6 Sol Ultra產出了Cycle Double Cover猜想的完整證明。
這道題由Szekeres在1973年、Seymour在1979年各自獨立提出,懸了約五十年。
模型被分配了8小時,實際用了不到1小時,跑法是64個子智能體并行開工。提示詞和證明PDF全部公開。
Bloom是第一個給出實質評價的人。
他說這是一個很漂亮的證明,然后給了三個形容詞:
短。初等。1980年代就本可以被發現。
他也點出了背后的原因:他推測,關鍵那一步里有一個很小的、反直覺的拐彎。
一個人類數學家會怎么處理這道題?
他會先試那個最自然的做法,檢查一遍線性代數,發現不行,然后聳聳肩,心里想一句「本來也沒指望能這么容易」,起身走人。
但AI不會氣餒。它會接著做小變體,直到某一個成立為止。
AI強在不做情緒性止損。
回頭看今年4月,GPT-5.4 Pro在80分鐘里解掉了Erd?s 1196,用的是von Mangoldt函數。
牛津的Jared Lichtman在那個問題上耗了七年,他后來說,自1935年以來,所有做原始集問題的人都習慣了同一個開局動作,而那個動作,遮蔽了一個在明處擺了整整90年的技術可能。
陶哲軒看完的評價更狠:過去幾十年,人類在第一步就集體走偏了。
人類的直覺當然不是缺陷。恰恰相反,它是效率工具:替我們省掉了海量注定失敗的嘗試,沒有它,沒人能在有限的一生里走到學科前沿。
代價是,偶爾它也會省掉不該省的那一次。
說GPT-5.6有意思的人
去年說過另一句話
去年10月,Bloom曾公開打臉OpenAI。
當時,OpenAI副總裁Kevin Weil轉發了Mark Sellke的帖子并寫道:GPT-5剛剛找到了10道此前未解的埃爾德什問題的解,另有11道取得進展,這些題都已經開放了數十年。
![]()
Bloom一句話回應為此定性:戲劇性的誤導。
他說這些題在網站上標著open,只意味著他本人不知道有哪篇論文解決過它。GPT-5干的事情,是把他不知道的那些文獻翻了出來。
而找到文獻,不等于造出證明。
![]()
接下來的情形,許多人都記得。
LeCun在旁邊補刀,暗諷自己埋的雷炸了自己。Hassabis更直接:這太尷尬了。
![]()
Weil刪帖。
OpenAI研究員Sébastien Bubeck最后承認只是找到了文獻里已有的解。
今年5月OpenAI再宣布推翻一個1946年的埃爾德什幾何猜想時,在公告里同步附上Noga Alon、Melanie Wood和Thomas Bloom的評價。
AI數學撞墻了嗎?
Bloom那條帖子底下的論戰,也很精彩。
唱衰派以用戶qrdl為代表,「5.6的思維鏈輸出少得可憐,677那道題毫無進展,物理側的CritPT評測相比5.4幾乎沒動」。
他的結論是:AI在數學上已經撞墻了。
![]()
用戶qrdl在論壇發帖,說CritPT自5.4以來幾乎沒動,除非他們找到了給基準刷分的辦法,否則結果也就這樣。
qrdl的論證倒不情緒化。
他認為大模型本質上是靜態權重的token生成器,做數學的時候,不會像人一樣實時長出新的神經連接。而真正的創造性跳躍,需要一個有彈性的大腦。
qrdl的體感是:每次開新會話去攻677,模型就把那些早已失敗過的老招式再來一遍。
回懟來得也很快。
Nat Sothanaphan指出,CritPT是物理測試,不是數學基準,拿它一家的曲線證明AI在數學上撞墻,是挑對自己有利的數據。
他給的反證是:5.6在包括FrontierMath在內的一大批評測上都比5.5有提升。
另一派是實戰派,代表是名為old-bielefelder的用戶。
![]()
old-bielefelder報告,GPT-5.6 Sol思考14分鐘、復核9分多鐘,把Pintz 2018年那個0.72的指數改進到0.7195。
不算驚天動地,但確實動了,用old-bielefelder自己的說法是「第一口奶」。
作為對照,前一天晚上GPT-5.5在同一個問題上磨了一個多小時,0.72紋絲不動。
他隨后把結果直接通知了Pintz本人。
第三種聲音同樣來自Nat Sothanaphan,他借用了Bloom的一個說法:現代數學是一座巨大的教堂。
走到這座教堂的最前沿本身就極耗力氣,而大模型已經能以超人的效率做到這件事,最近的突破基本都源于此。再往前推,需要的是流動智力。
有人說大模型沒有流動智力,他認為這是錯的。
ARC系列評測這幾年的持續上漲就是證據,GPT-5.6 Sol在最高推理檔位下拿到7.8%。這個基準今年3月上線時,最好成績是0.37%,而人類穩定在90%以上。
![]()
ARC Prize官方驗證成績。GPT-5.6 Sol在ARC-AGI-3上的表現隨推理檔位陡升,Low檔只有0.3%,Max檔拿到7.8%。
他的解釋是:教堂的地基太龐大了,龐大到把那點正在快速生長的流動智力完全蓋住。所以你光看產出的分量,會覺得什么都沒發生。
但等到某一天流動智力開始壓過地基,它會突然變得肉眼可見。
吵了兩周,這場爭論真正吵出來的,不是「AI能不能做數學」,是「難」這個字要怎么定義。
數學史上那些標著「懸而未決」的條目,一部分記錄的是問題本身的難度,另一部分記錄的只是人類耐心的邊界。
過去這兩者混在一起,沒人分得開。現在,開始能區分了。
一道題掛了幾十年沒人領走,可能不是因為它有多難,而是因為沒人肯在那條路上再試第三十次。
還有多少題目,卡住它們的其實只是人類的耐心?
參考資料:
https://annals.math.princeton.edu/1991/134-3/p03
https://www.erdosproblems.com/forum/thread/AI%20Contributions
https://arcprize.org/results/openai-gpt-5-6-sol
編輯:元宇
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.