Claude首次形式化證明費馬大定理!清華姚班大神出手了

新智元
09/05

新智元報道

就在啱啱,數學圈又有驚人消息。

清華姚班大神帶隊,用Claude徹底攻克了費馬大定理。

至此,AI完成了數學史上最大證明。

曾經,費馬大定理折磨了人類350多年,需要數學家耗費數年心血,寫下129頁天書才能證明。

今天,Anthropic卻宣佈,Claude僅用11天,就完成了費馬大定理的首個端到端機器驗證證明!

為此,Claude瘋狂敲了1300萬行代碼,產出了30300條可驗證定理,最後有29500條被採用,直接進了最終證明。

這個體量,是全球最大數學定理庫Mathlib的5倍還多!而且,整個過程燒掉了足足60億Token。

這是迄今為止編寫的最大的 Lean 證明。

消息一出,全網震動。有人驚呼:「一個月就把費馬大定理形式化了?這種秀肌肉方式,讓數學界看起來像蝸牛在爬。」

姚班大神彭天翼

350年的世紀難題,Claude 11天解決

1637年,法國數學家費馬看書的時候,隨手在書頁空白處寫了句:

當整數n > 2時,關於x, y, z的方程 xⁿ + yⁿ = zⁿ 沒有正整數解。、

然後他還不忘補一刀:「我確信已發現了一種美妙的證法,可惜這裏空白的地方太小,寫不下。」

這麼一句話,把後世數學家折磨得死去活來三百多年。

直到1995年,英國數學家懷爾斯,才用高深的現代數學工具,整出了一篇129頁的證明論文,總算是終結了這場350多年的懸案。

但問題來了:懷爾斯的證明,實在太複雜了。

現代數學,已經發展到普通人連題目都看不懂的地步。證明一個定理,就像搭一條超複雜的邏輯鏈條,只要中間一個環節斷了,整個全崩。

懷爾斯1993年第一次公布的時候,就被揪出一個致命漏洞,他又閉關痛苦煎熬了一年纔將其修復。對於這種頂級的數學證明,人類去驗證它的正確性,往往需要頂級專家花費數月甚至數年的時間。

有沒有一種方法,能讓計算機像檢查計算器結果一樣,跑一遍就知道對不對?

有!這就是「形式化」。

簡單來說,就是把人類寫的數學證明,翻譯成計算機能跑的程序語言(比如Lean),然後讓機器一步一步推導,如果跑通了,就說明這個證明絕對正確。

但把費馬大定理「形式化」,數學界公認是「以年為單位」的超級大工程。

僅僅是帝國理工教授Kevin Buzzard牽頭的項目,第一階段藍圖就有86頁!

然後,Claude來了。

人類預計要幹好幾年的活,它僅僅花了11天,而且是「基本自主工作」。

1300萬行代碼,60億Token

「11天,1300萬行代碼」——這背後,是AI的暴力美學+精密系統設計的雙重暴擊。

來看看Claude到底幹了啥:

它不光是證明了費馬大定理本身。

因為形式化證明必須從最底層公理開始,一層層往上蓋,所以Claude順手把中間需要的29000多條其他數學定理也一塊兒證明了。

裏面涉及代數、幾何、數論、調和分析……好多分支之前壓根沒被形式化過,Claude直接給「開荒」了。

整個過程,人類基本沒怎麼插手。

研究員就給了一些高層指令,比如「雅可比簇作為一個概形優先級挺高」「儘快推進馬祖爾定理」這種。

剩下的,就是幾十個Claude智能體在那兒瘋狂互相對話、定義概念、證明中間定理,然後一層層往上壘。

最後,Lean編譯器全檢查通過,只依賴了三條最基礎的標準公理。

等程序跑完,控制台彈出那句神聖的「PROVED」(已證明)時,Claude自己的內部日誌都激動了:

「!!! 費馬大定理根節點讀取為 PROVED……這是本次戰役的目標……歷史性的時刻。」

你看,連AI自己都知道這事兒有多牛。

幕後大神:清華「姚班」出身的超級學霸

能指揮Claude幹出這種神蹟的,那肯定不是一般人。

領頭的,是哥倫比亞大學商學院助理教授、Anthropic研究員——彭天翼。

這哥們兒的履歷,簡直就是「開掛」本掛:

本科2013-2017,清華「姚班」,拿過最佳畢業論文,還入選過信息學奧賽國家集訓隊。

博士去了MIT,運籌學方向,GPA滿分5.0畢業。

現在一邊當哥大助理教授,一邊在Anthropic搞AI智能體和形式化工具。

有意思的是,彭天翼對「AI自動驗證數學證明」這事的執念,其實來自本科一段「慘痛經歷」。

當時他導師想把他論文裏的成果寫進《Nature》,但問他:「你百分百確定證明對嗎?」

他老實回答:「99%把握吧,但這麼長,真沒法100%確定。」

就因為那1%的不確定,他錯失了上《Nature》的機會。

現在好了,他用AI親手把那個「1%」給堵死了。

從翻車到封神:Prove2Me如何救了AI一命

你以為讓AI證明定理,就是輸入一句「請證明費馬大定理」,它就啪啪吐出1300萬行代碼?

大錯特錯。

剛開始,實驗差點翻車。

Anthropic透露,早期幾十個Claude智能體協作沒多久就徹底亂套了,像沒頭蒼蠅一樣,互相跟不上進度,合作效率低到爆炸。早期失敗嘗試貢獻的代碼,最後只佔了7%。

大模型的「健忘症」和「幻覺」,在嚴謹數學面前就是致命傷——一行錯,後面幾百萬行全廢。

關鍵時刻,彭天翼團隊搞出了Prove2Me平台。

這玩意兒相當於給AI們配了個「超級項目經理」,專治各種不服:

定理DAG(任務樹):給每個AI一張清晰的地圖,告訴它下一步該證明哪個中間節點,極大緩解了記憶衰退,幾十個智能體能高效並行。

陳述與證明分離:加快編譯速度,省資源。

自然語言索引:每個定理都留着人話描述,AI們檢索複用成果方便多了。

配上Claude Code的多智能體框架,AI們就像裝了導航的工兵,在數學迷宮裏狂飆,11天打通全關。

數學界服了

成果一發布,X和各大技術論壇直接海嘯。

帝國理工那位原本計劃花幾年搞形式化的教授,看完都服了,評價極高:「這是現代數學文獻自動形式化的一大步!以後可以用來查人類數學庫裏的錯,還能覈驗大模型生成的數學結論。」

但網友們的腦洞更清奇。

有人神評:「AI解決數學的方式是——給你一個極其複雜的答案(1300萬行代碼),你想證明它是錯的,比自己解一遍還難。所以你只能放棄抵抗,接受它對了。這不就是數學界的PUA嗎?」

還有人說:「寫1300萬行代碼,就為了讓一個350年的定理在機器面前乖乖坐好……人類的桌子還沒準備好接受這種規模的東西。」

更絕的是,Anthropic為了秀肌肉,還順手做了個小實驗。

用3個普通賬號,在Prove2Me上花了3天,就把數論裏著名的「維諾格拉多夫三素數定理」也給形式化了!

也就是說,只要有合適的工具,以後民間科學家買幾個消費級AI賬號,也能去驗證人類最頂級的數學定理了!

AI不會取代數學家,但會徹底改變數學

所以,數學家是不是要失業了?

Anthropic官方給了答案:不會取代,但會徹底改變玩法。

歷史上,數學驗證有很多「悲劇」。

比如1998年有人證明開普勒猜想,評審團花了4年,最後只能說「99%確定」;佩雷爾曼證明龐加萊猜想,整個數學界花4年寫了3本300多頁的書才勉強看懂;還有的定理,被當成真理接受了好幾年,別人在上面蓋了樓,最後發現地基是塌的。

而Claude帶來的技術,就是要終結這種「不確定性」。

未來,AI不光是數學家的計算器,更是最嚴裁判員。

當AI能快速生成成千上萬條新猜想和證明時,人類看不過來,那就把「附帶形式化驗證代碼」變成論文標配。

大模型時代,大規模自動形式化用接近工程化落地的方式,展開新的可能。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10