Scott Aaronson談OpenAI數學成果潮與「數學末日」
“数学末日”
OpenAI 昨日公佈 372 項重大數學結果,當中包括 Unique Games Conjecture 的證明;Scott Aaronson 指出,研究者目前幾乎尚未理解這些證明。
文章以多項數學猜想的 AI 解答為切入點,呈現證明尚未被理解時,數學界在核實和傳播成果上面對的難題。
昨晚,我9歲的兒子這樣嘲弄我太太、複雜性理論學家 Dana Moshkovitz:「媽咪,我聽説你被打爆了!我聽説有個機械人解決了你整個職業生涯都在研究的數學問題!哎喲!」
我兒子雖然在耍賴,但他説的也沒錯。不論你對此感到興奮、沮喪、憤怒,還是有其他感受,昨天肯定是數學史上最重要的日子之一。沒錯,在 OpenAI 昨日公佈的372項重大成果中,經由 Timothy Gowers、Edward Witten 和其他知名數學家組成的顧問小組推薦,有一份證明證明瞭 Subhash Khot 的唯一遊戲猜想(UGC)。我認識太太以來,她一直致力於證明這個猜想。(UGC 意味着一大批最佳化問題確實是 NP-hard;即使你只想要一個比半正定規劃鬆弛所得結果稍好的近似解,也無法避開這個結論,而半正定規劃鬆弛是我們的主要工具之一。)
或者至少,我們相當肯定那是一份證明!部分(但並非全部)其他突破性成果也附有 Lean 證明憑證。不過,目前似乎幾乎沒有任何人類理解其中任何一份證明;理解它們的競賽才剛剛開始。如果你想實際感受一下這場競賽會是甚麼樣子,以下是 Dana 昨晚傳給我的部分內容:
感覺像是由服用了迷幻藥的人寫的。內容非常含糊,很多地方都説不通。大量提及先前的研究,卻沒有討論為何儘管已有不可能性結果,仍可使用這些研究
基本上,這篇論文寫得糟糕透頂,沒有 AI 協助根本不可能讀懂
我請 Astra 提出噪音元件合理的完備性和健全性主張,它把論文各處的主張拼合起來,給出了答案
他們還直接為 UGC 的主要應用(Max Cut 和所有 CSP)提供了最佳近似 NP 困難性證明,繞過了 UGC。
UGC 的證明創造了一種全新而古怪的碼,並配有噪音測試。這是一種瘋狂的遞迴構造。
既不是長碼,也不是短碼——是某種外星式的瘋狂東西
我仍認為,或許存在一個使用半空間碼(這很自然)的證明
引文往往無關緊要,而且令人困惑
一種可能的未來是:如果你有遠見或創意構想,AI 可以協助驗證和實現,那麼數學世界將會美好得如同天堂。
當然,我們還有很多東西要向外星人學習
如果你好奇 Dana 有甚麼感受——嗯,她大概甚麼感受都有!即使一項核心職業抱負已被機械人實現,對她來説至少還有兩件事可以稍作安慰。第一,她可以因為 UGC 最終證明為真而感到自己的判斷得到印證;即使許多同事曾經懷疑,她從未懷疑過這一點!第二,我們所有數學、理論計算機科學和數學物理領域的人——至少是那些重視解決明確界定問題的人——現在都處於同一境地。
除了唯一遊戲猜想,以下是阿拉丁寶藏洞穴中的一小部分珍寶,也是我未來幾星期最可能留意的內容:
- L=BPL(即機率對數空間與確定性對數空間相同),是僅次於 P=BPP 的重要去隨機化猜想之一。雖然大家從未真正懷疑它為真,仍有一整個研究社羣專注於證明這一點。
- 在少於 O(n log n) 的時間內完成傅裏葉變換和整數乘法,打破了自 1960 年代以來一直未能突破的瓶頸。若你想知道新的執行時間,是 O(n log0.9999999999999 n),前後可能差幾個 9。
- 對酉合成問題的肯定解答。Greg Kuperberg 和我早在 2007 年便提出了這個問題。對於每個 n 量子位元的酉變換 U,都存在一個經典預言機 A,使得在存取 A 的情況下,可於量子多項式時間內實現 U。這與大多數人的預期相反,並可能影響例如從黑洞解碼霍金輻射等計算問題,以及量子複雜度理論中的許多其他問題——前提是我們有高效建構預言機 A 的方法,而這篇論文並沒有提供這種方法。
- 奇偶性不屬於 QAC0。這是自 1999 年以來量子複雜度理論中的重要問題之一,我的許多同事一直逐漸接近解答。
- 總布林函數的隨機查詢複雜度與量子查詢複雜度之間近乎 4次方的分離。這是我自 1998 年(!)以來最喜歡的問題,當時我們只知道最佳分離指數介乎 2 至 6 之間。過去幾年,我們知道它介乎 3 至 4 之間。因此,這終於為這段故事畫上句號。
- 敏感度與區塊敏感度之間的超二次分離。
- 二維有能隙哈密頓量的面積定律。這是哈密頓量複雜度中的主要未解問題之一。
- 以 O(n9/4) 時間完成矩陣乘法——這次終於有一個有理數指數(!),而且採用的方法與 O(n2.373) 等結果完全不同
- 永久式的行列式複雜度有 Ω(n3) 的下界,改進了此前最佳的二次下界。
- 一種隨機化多項式時間演算法,可近似計算一般圖中的完美匹配數量;此外,還有一種隨機化近線性時間演算法,可在這類圖中找出最大匹配
- 有理數域上的多項式方程求解問題不可計算——這可以説是可計算性理論中最大的未解問題(請注意,丟番圖方程的求解不可計算性,即整數域上的多項式方程求解不可計算性,已於 1970 年代獲證,對希爾伯特第十問題給出了否定答案)
上述任何一項單獨而言,都足以輕易成為某個領域的「年度成果」(有些情況,例如 Unique Games 和 L=BPL,甚至足以成為整個電腦科學理論界的年度成果)。我還省略了許多內容——歡迎在留言中分享任何令你瞠目結舌的成果!數論、組合學、代數幾何、分析學以及幾乎所有其他數學領域,也都有同樣令人驚嘆的成果;其中大部分我都看不懂,不過可以指出,當中包括對黎曼猜想的部分進展、霍奇猜想和伯奇-斯温納通-戴爾猜想的研究進展(即其餘千禧年難題中的大多數)。
我們可以從名單上缺少的項目得到些許安慰。P ≠NP 不在其中,甚至 P=BPP 或 NEXP⊄P/poly 也不在,這顯然不是因為沒有人努力嘗試。看來,理論計算機科學中最重要的未解難題確實相當困難!
噢,免得我忘了:就在 OpenAI 公佈那批成果的前一天,也就是星期一晚上,Virginia Williams 和 Josh Alman 在 arXiv 發布了一篇預印本,證明 3SUM 問題可在 O(n1.9992) 時間內解決,全點對最短路徑問題可在 O(n2.9995) 時間內解決,推翻了已有半個世紀的猜想;這些猜想認為正確答案分別是 n2-o(1) 和 n3-o(1)。這次提出關鍵想法的不是 OpenAI 模型,而是 Anthropic 的模型!不過,Anthropic 隨後採取了與 OpenAI 不同的做法:它沒有把未經消化的解答直接發布給全世界,而是讓 Virginia 和 Josh 有機會撰寫並公佈經整理的版本,並支付報酬。
這已成為傳達 AI 數學突破的兩種主要模式,兩者各有優缺點。「OpenAI 模式」引發一場瘋狂競賽,讓人類設法消化並解釋一份雜亂的 AI 證明(這項工作很可能既吃力不討好、幾乎得不到認可,又競爭激烈、毫無樂趣);而「Anthropic 模式」則讓一傢俬人公司掌握挑選哪些人類數學家擔任 AI 使者的權力。不知道,各位怎麼看?
如果你想知道:據説,產生所有這些成果的 AI 模型並不是一套特製系統,由 10,000 個 Agent 組成,耗用價值數百萬美元的運算資源,例如曾用來構造 Navier-Stokes 方程有限時間爆破解的那種。相反,它只是 OpenAI 最新的內部模型——視 OpenAI 安全委員會的建議而定,未來幾個月內或會向付費 ChatGPT 用戶推出!(我 9 歲的兒子説:「噢,他們絕對不應該推出它。要是它能解決所有那些數學問題,就絕對不可能安全。」)據説,平均每道成功解決的問題用了約 3 小時的 GPT-Pro 級別運算資源。
另外,如果你想知道:據説,他們曾用這個模型嘗試解答約 8,000 道問題。所以目前,它「僅僅」解決了約 5% 被問到的長期未解數學問題——這些問題是整個社羣多年來投入研究的;而它每道只嘗試一次,用時 3 小時。
看到計算機科學理論界積極應對,我很高興。在 Berkeley 的 Simons Institute、我所在的 UT Austin,以及其他地方,我聽説研究人員正趕忙仔細研讀手稿,努力理解內容並加以解説——因為我們還能做甚麼?否則又如何延續這門我們投入了大半人生的技藝?
如果你想感受一下如今數學界的處境,可以想像一個狩獵採集者,一生都在學習如何於嚴酷雨林深處求生;接着,一座配備直升機停機坪、暖水泳池和 AirBnBs 的大型度假酒店突然在他身旁拔地而起,而他卻毫不遲疑地説:「好吧,既然如此,我現在的新工作就是替遊客舉辦荒野體驗營之類的活動。」
在 Quanta 雜誌中,Jordana Cepelewitz 嘗試用了另一個比喻:
就像你被瞬間傳送到一座高山的山頂。四周濃霧瀰漫,你完全不知道自己身在何處,也不知道周遭有甚麼。你不知道自己所在的山與其他山如何相連,也沒有任何裝備可以助你探索,更沒有辦法讓其他人加入你。如果是你親自爬上這座山,就會親身體會人體如何適應海拔高度和氧氣水平的變化。你或許還得發明工具,幫助自己辨認方向、攀上陡峭的懸崖,或搭建庇護所。你或許會遇上一位同路的探險者,兩人在隱蔽的山谷中一同迷路,最後找到一種可以製成救命藥物的植物。
但你現在卻置身山頂,四周一片漆黑,而傳送機的製造者告訴你,這部機器比任何人類都更懂得探索荒野。
只要我們足夠重視這些山峯中的任何一座,我便樂觀地認為,我們可以像以往一樣,驅散迷霧、找出路徑,只是現在會用傳送機協助引路。更大的挑戰,是培育一個社羣,讓大家在有了這部機器的世界裏,仍然在乎尋找登上這些山峯的路徑,並珍視這場英雄式的冒險。(哦,我認為這個比喻有一處不太貼切:我們仍然確實擁有彼此,和以往一樣!)
經驗告訴我們,即使到了現在,仍然會有人用居高臨下的口吻解釋,説這一切都不是真的,也不算數。如果這些人會因實證世界中發生的任何事而感到驚訝,會因任何事而更新看法,那麼幾年前他們早就該感到驚訝、更新看法了,遠在事情發展到真正的 Mathocalypse 之前。
他們會説,所謂的解答或許根本不是解答,只是「AI 垃圾內容」。又或者,那 372 道廣為人知、已獲解決的未解問題,根本沒有一道是真正的數學問題,全都只是包裝得好聽的競賽謎題和瑣碎問題。(畢竟,黎曼猜想還是沒有解決!)又或者,整個有 4000 年歷史的數學學科都該被拋棄:原來數學全都只是解謎和處理瑣碎問題;唯一不同之處,只是如今這種瑣碎本質已暴露無遺。無論如何,真正重要的是,人類創造力真正的內在聖域尚未被攻破,而且很可能永遠不會;還有,Sam Altman 和 Dario Amodei 是可鄙的小書呆子。
如果你仍然支持那套註定失敗的世界觀,仍然身處這艘正在沉沒的船上,我強烈建議你讀一讀昨天另一篇對 AI 討論有重大貢獻的文章,除了 OpenAI 的 Mathocalypse 發布內容之外:也就是 Scott Alexander 給 Steven Pinker 的公開信。我覺得自己對此負有一點責任,因為我是最先讓 Steven Pinker 知道理性主義社羣存在的人,也是最先介紹 Steven Pinker 和 Scott Alexander 認識的人(他們此前都一直欣賞對方的作品)。而現在,Scott 更向 Steve 發出真正的決鬥挑戰,還要用槍!
無論如何,Steve 一直是我敬仰的思想界英雄,Scott 亦然;而我也有幸能稱 Steve 為朋友。但我認為 Scott 的文章是我讀過最具殺傷力的反駁之一。我也認為 Scott 的結論完全正確:談到 AI 風險,Steve 現在面對的重大挑戰,是接受並開始採用更「平克式」的認識論。
昨晚,我本應埋頭研讀 OpenAI 數百篇論文中的一些,及/或撰寫這篇文章,卻決定改為陪孩子一會。他們想來個電影之夜,於是我提議看一部他們從未看過、而我幾十年來也沒有重看的電影;這部電影似乎充滿不講空話、切實可行的指引,能讓他們瞭解自己將要成長的世界:Terminator 2。
本篇文章於2026年10月7日(星期三)下午1:57刊登,分類為未分類。 你可以透過RSS 2.0訂閲源追蹤本文的所有回應。 你可以留言,或從自己的網站發出引用通告。
你可以在留言中使用豐富的 HTML!你也可以使用基本 TeX:以 $$ $$ 包住內容以顯示獨立公式,或以 \( \) 包住內容以顯示行內公式。
在二十年間大部分時間都開放留言後,Shtetl-Optimized 於2024年7月改行以下政策:
所有留言預設均視為寫給我 Scott Aaronson 的私人信件;不應預期留言會刊登在網誌上,也不應預期我會回覆。
我會按自己的時間和酌情權,並諮詢Shtetl-Optimized 守護者委員會,在網誌上刊登經挑選的留言,當中包括我認為特別有趣或有助推進討論的內容,並會盡力回覆。形式會更像「讀者來函」。如果有人覺得自己受到不公正的審查,歡迎轉往互聯網上的其他地方。
來源:Hacker News 熱門(buzzing.cc 中文翻譯) · scottaaronson.blog