OpenAI 發佈近 400 項 AI 數學成果,數學家稱理解或需多年
‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop
OpenAI 本週發布近 400 項 AI 生成數學成果,分佈於 700 多份手稿;數學家表示,理解和核查這批內容可能需時多年。OpenAI 表示,719 份手稿中有 300 項主要成果已形式化,約 42%;截至 10 月 8 日,資料庫已修訂十多份手稿,並因符號錯誤撤下 3 篇論文。數學家指出,成果的形式化程度和論文質素不一,大量發布也令研究者難以及時核實和消化,並衝擊部分研究計劃。
本文並列形式化比例、論文修訂與研究者反應,呈現大規模 AI 數學成果如何增加核查負擔,並衝擊既有研究安排。
「驚人。」「令人難以招架。」「前所未有。」「超現實。」「簡直瘋狂。」
這是三十多位數學家在接受 The Verge 訪問時,用來形容 OpenAI 本週突然向數學界拋出大量數學成果的部分説法。他們既為此感到驚嘆和興奮,也對這場成果洪流的規模感到不安,並深深憂慮這一切意味着甚麼,以及接下來會怎樣。儘管反應各異,研究人員都認為,單是理解 OpenAI 發佈的內容便可能需要數年,更遑論弄清楚在這個如今正不斷變化的領域中,數學家本身應處於甚麼位置。許多人擔心,OpenAI 不會等上那麼久便轉向下一步,甚至發佈更多內容。
OpenAI 共發佈了近 400 項由 AI 生成的成果,分佈於 700 多份論文之中,涵蓋多個不同的數學領域,包括組合學、幾何學的多個分支、數論、理論計算機科學、代數學、拓撲學、機率論與統計力學,以及數學物理。這批資料規模龐大,OpenAI 認為有必要發佈指引,説明如何瀏覽內容繁多的 GitHub 儲存庫。
單是這批工作的龐大數量,已令外界難以初步評估 OpenAI 究竟發佈了甚麼。在發佈後數小時至數天內,The Verge 訪問的大多數數學家都表示,仍在努力消化所有內容;其中數人説,單是看完約 40 頁的目錄和摘要,便花了他們近一小時。康涅狄格大學數學教授 Álvaro Lozano-Robledo 説:「光是看完整份摘要清單,已令人難以招架。」
數百份論文中,散見以 Lean 編寫的形式化內容。Lean 是一種程式語言及證明助手,可讓研究成果透過計算方式驗證。這些形式化內容在評估 OpenAI 過往的一些數學主張時發揮了重要作用,即使研究人員未完全理解背後的論證,也能因此確信主張在邏輯上正確。
「如果 AI 現在消失,就像有外星人來到地球,然後又離開一樣,我們接下來 10 年都會研究這些內容,試圖弄明白一切。」
不過,各項成果的驗證程度差異極大。OpenAI 在 GitHub 上承認,這些成果「處於不同的驗證階段」,而「許多、但並非全部論文都已完成形式化」。截至撰文時,這批論文中似乎不到一半已完成形式化。OpenAI 表示,719 份論文中只有 300 項主要成果已完成形式化,約佔 42%,並稱「隨着取得更多形式化內容,我們會更新儲存庫」。
數名數學家向The Verge表示,他們對形式化不足感到不滿,尤其是研究結果數量龐大;他們強調,即使某項結果附有 Lean 程式碼,評估也不會即時完成。研究人員必須確認形式化證明確實證明瞭該結果所聲稱的內容,這又是一個耗時的過程。數名仔細查閲論文的研究人員表示,即使有些論文提供了可由電腦驗證的證明,其質素也參差不齊,而證明所驗證的陳述,未必總能與相關論文中的主張清楚對應。
倫敦帝國學院數學教授 Kevin Buzzard 表示,他在自己的研究範疇——代數數論——中找到不少定理,當中只有約六個即時「脱穎而出」。這些定理似乎很少(如果有的話)經 Lean 正式驗證。「因此,我要麼閲讀可能不正確的劣質內容,要麼等其他人也去讀,要麼等有人把它們形式化,之後我才能確定結果是否正確。」不少其他研究人員也有同樣的憂慮。
Buzzard 並非唯一擔心 AI「劣質內容」的人。這個詞是對低質素、往往錯誤的 AI 生成材料的簡稱;這類內容愈來愈常見於網上,也出現在現實世界,包括學術論文。數學家向The Verge表示,與其他領域一樣,近年他們看到使用 ChatGPT 和 Claude 等工具製作的此類材料大幅增加。當中不少內容令人困惑、難以閲讀,也顯示作者對相關主題缺乏理解;在註明其他研究人員的貢獻方面,問題尤其嚴重。
OpenAI 先前的數學文章曾遭專家廣泛批評,指其內容粗疏,尤其是未有妥善標明貢獻者,甚至完全沒有標明。在發布前與The Verge交談時,數名研究人員已開始把即將湧現的大量論文稱為「劣質內容末日」(slopocalypse),或使用類似的説法。
人們擔心的「劣質內容末日」是否真的出現,很難判斷,主要是因為發布的材料數量多得令人眼花繚亂。初步跡象顯示,OpenAI 這次在論文方面更加謹慎,或至少部分論文如此。數名數學家向The Verge表示,第一印象遠比預期好;不過他們也承認,考慮到公司過往刊出的粗劣作品,這個預期本來就不高。
「這是一團糟。它可能令學術文化大幅崩潰,甚至摧毀大部分學院。這是社會問題,而 AI 實驗室似乎完全無視這個問題。」
然而,較好不一定代表好,更遑論達到學術作品通常應有的標準,尤其是當中提出如此重大的主張。OpenAI 的許多主張都欠缺形式化驗證,因此相關論文的質素格外重要;數學家主要透過這些論文確認、理解、審視結果,並瞭解其脈絡。
即使在最理想的情況下,撰寫嚴謹的數學論文也是艱鉅的工作。要以這種規模做到這一點,更是一項艱巨的工程。OpenAI 的模型正以令人目眩的速度,在廣泛的專門領域大量產出數學成果,遠遠超出人類員工的處理能力。該公司根本沒有足夠廣泛的專業知識或資源,妥善審視數學前沿的研究成果。研究人員向 The Verge 表示,這點已顯而易見。
許多人形容,這些論文難以理解,有時甚至幾乎無法理解。布朗大學數學教授 Brendan Hassett 向 The Verge 表示:「我快速讀過自己最熟悉的問題的論述後,覺得內容不太合理。如果這是由人寫的,我不會再花時間試圖理解它。當然,還有另外 721 篇預印本!」(Hassett 説這番話時,OpenAI 尚未撤回三篇論文。)
有些研究人員向 The Verge 表示,他們或同事留意到,數篇論文似乎涉及其他數學家已經研究過的範疇;不過,在有機會妥善審閲材料前,他們不願公開如此表示。另一些人則指出,這些研究篇幅異常簡短:他們通常預期要用數百頁推演的結果,卻被濃縮成幾十頁甚至更少。
澳洲悉尼大學數學教授 Nalini Joshi 表示,快速搜尋這批發佈內容後,她發現與自己研究重疊之處不多,但她指出自己檢視的部分論文「參考書目很短」。鑑於外界過去曾批評 OpenAI 的致謝方式,她表示自己「擔心論文中的歸屬説明可能未有交代完整情況」。
然而,儘管內容粗疏、結果不確定,大家普遍認為,這批發佈內容確實包含一些令人印象深刻的成果。
多位接受 The Verge 訪問的研究人員強調,評估如此大量的材料並不容易,而且必須妥善核實結果;不過,他們表示,儘管呈現方式有不足之處,這些研究的水平似乎非常高。他們指出,在人工智能出現之前,OpenAI 的許多研究成果顯然足以在頂尖期刊發表,也可能足以讓作者建立學術生涯。當中有少數成果被形容為足以令數學家成為菲爾茲獎的有力競爭者;菲爾茲獎是數學界最高殊榮之一。
「我只能選擇閲讀可能不正確的粗製濫造內容,或等待其他人也這樣做,又或者等待有人將它們形式化,之後才能確定結果是否正確。」
史丹福數學家 Jared Duker Lichtman 表示,他會把「幾十項」成果歸入這一類,包括朝黎曼猜想邁進的進展、霍奇猜想的一個特殊情況,以及四維 Kakeya 猜想的解答。這些都是數學界的重大難題。黎曼猜想——可説是整個數學學科中最惡名昭彰的未解難題——與霍奇猜想,均名列著名的七大千禧年大獎難題。前者關乎質數的分佈;後者則大致探討如何透過較簡單的基本構件來理解複雜的幾何形狀。至於 Kakeya 猜想,粗略而言,是問需要多小的空間,才能朝各個方向轉動一根針或鉛筆。今年較早前,紐約大學數學家 Hong Wang 獲頒授菲爾茲獎,其中一項成就是證明 Kakeya 猜想的三維版本。
數學家 Scott Armstrong 説:「這些並非只是一些無人聽聞的愚蠢問題。當中很多都是非常知名的問題,不少人已經研究了幾十年。」
塵埃逐漸落定之際,數學家不得不面對眼前突然改變的局面。他們當中很多人剛剛目睹多年的工作和精心制定的研究計劃在瞬間化為烏有,或認識經歷同樣情況的同事。整個學界無論反應交織著興奮、恐懼、絕望,抑或介乎其中的情緒,都瀰漫著一種強烈的迷失感。
翌日早上,這種氣氛並沒有太大改變。Armstrong 一邊在巴黎街上行走,一邊透過電話受訪;他想像,假如索邦大學沒有因持續的學生抗議而關閉,而他的同事又聚在平日常聚集的咖啡機旁,氣氛大概會相當「肅穆」。
在蘇格蘭,聖安德魯斯大學數學教授 Colva Roney-Dougal 形容,同事和學生之間也瀰漫著同樣陰鬱的氣氛。她説,這場洪流令人感到有點可怕,但在經歷數星期的不確定後,它的到來也帶來了一些慰藉。她説:「我有一羣朋友和同事,他們的資助申請剛剛全都化為烏有。」
「我有一羣朋友和同事,他們的資助申請剛剛全都化為烏有。」
Armstrong 表示,他知道有一個團隊的整個研究計劃幾乎因這次發布而「被抹去」。與此同時,NYU 數學家 Tristan Buckmaster——他曾身處 OpenAI 早前就納維-斯托克斯問題的爭議核心——表示,他已聽説有「三個人的整個研究計劃都被徹底摧毀」。
在《The Verge》與數學家的訪談中,類似的故事一再出現,不過這場衝擊主要集中在數學界的某些領域。蘇格蘭赫瑞瓦特大學數學教授 Francesco Fournier-Facio 説,概率論、組合數學及理論電腦科學領域的研究人員似乎「尤其震驚」;他又補充,羣論領域有些範疇已被「夷為平地」。
Armstrong 和其他研究人員表示,有些領域似乎受到近乎軍事級精準度的針對。Armstrong 説:「確實有一些目標。」他特別提到王今年憑藉相關領域的研究獲得菲爾茲獎,以及數道千禧年大獎難題。他表示,一系列數學物理方面的研究結果清楚表明,OpenAI 正在研究楊-米爾斯理論——這套數學框架是現代粒子物理學的基礎——以及其尚未解決的「質量間隙」問題,這是七道大獎難題之一。
另一方面,有些研究人員對自己的研究似乎很少受到波及,感到既意外又如釋重負。Roney-Dougal 説,她所在的領域一隅——研究大多以羣論為中心——似乎相對未受影響。她開玩笑説,幸好自己研究的是一個「非常不時興的領域」,但後來傳訊息表示,在發現自己的研究被其中一篇論文引用後,她感到「不太確定」。
Joshi 的研究同樣與相關成果少有重疊;她的研究大多集中於可積系統,即能夠精確求解的複雜系統。她認為,這可能是因為她的領域較少受長期存在、以正式形式表述的猜想和定義所推動,更多是圍繞著隨物理學發展而興起或退潮的問題。
截至10月8日,該紀錄已列出多項更正,包括修訂十多份手稿,以及因一個據稱會令某項論證失效的「符號錯誤」而撤下三篇論文。
不論自己的研究有否直接受到影響,《The Verge》訪問的大多數數學家都認為,這個領域似乎已跨越某種門檻,不再是一天前的模樣。Institute for Advanced Study 研究員 Constantin Kogler 稱之為「數學史上最重要的單一時刻」;London Institute for Mathematical Sciences 研究員 Yang-Hui He 則追溯至數千年前,將今年由 AI 推動的發展比作歐幾裏得《幾何原本》的出版。這部著作是該學科最具影響力的作品之一。
很少研究人員的評價如此宏大,但大家普遍認為,數學正迅速變化,而數學家也必須隨之改變。
OpenAI 知道這次發布會帶來重大衝擊,並曾作出一些努力,以減輕影響並與數學界交流。今年較早時與研究人員幾次激烈交鋒後,公司轉而向數學家尋求協助,與新成立的數學與人工智能諮詢小組(AGMAI)合作,商討如何以負責任的方式發布研究結果。
AGMAI 早已闡明其認為負責任的參與應該是甚麼樣子。理想情況下,AI 實驗室應發布「人類能理解的」論文;否則,就應提供所需的支援,讓人類能進行理解和吸收 AI 生成的數學成果、並找出其可能應用所需的額外數學工作。他們表示,在可行情況下,應將證明形式化,企業亦應公開用來生成這些成果的模型和提示詞。該團體還呼籲 AI 實驗室不要再把數學成果發布當作「推廣模型的營銷工具」,並「停止在一般科學界無法使用的專有模型上測試高深的數學問題」。
「這些並不是一些沒人聽過的無聊問題。當中很多都是非常知名的問題,許多人已經嘗試解決數十年。」
OpenAI 採納了該團體部分建議。它表示會資助一系列圍繞其數學工作的工作坊和會議,協助學界處理並理解其工作,但沒有透露活動可能採用甚麼形式,或何時舉行。該公司披露的資訊亦比以往發布時多得多——研究人員再次指出,這個標準本來就很低——包括其模型曾嘗試超過 4,000 道問題,而一項典型成果約耗用了三小時的 ChatGPT Pro 思考運算時間。它亦已實施「論文修訂和引用規範」,並在 GitHub 表示會「保留公開發布紀錄」。截至 10 月 8 日,該紀錄已列出多項更正,包括修訂十多份手稿,以及因一項據稱會令論證失效的「符號錯誤」而撤下三篇論文。OpenAI 沒有就The Verge索取更多詳情的要求作出正式回應。
這項改變處理了與數學家之間一個主要的摩擦來源;其中一些人談到,圍繞該公司已發布主張的氣氛帶有某種「偏執」。該公司一向慣於因應批評暗中修改新聞稿和論文,卻沒有清楚披露相關改動。
但 OpenAI 沒有採納該團體的所有建議,包括其中一些影響最重大的建議。它沒有指出此次發布所用的模型,也沒有披露所用的提示詞或模型嘗試過的完整問題清單。OpenAI 似乎亦承認其形式化工作有所不足,表示取得更多成果後會補上;它也承認論文質素欠佳,並表示:「日後發布時,我們承諾透過改善引用、數學闡述和結果呈現方式,進一步提升論文質素,讓內容更易理解。」
「我快速讀過一遍後,發現自己最熟悉的那道問題的書面説明幾乎説不通。」
《The Verge》訪問的研究人員質疑,OpenAI 為何不能提升這些論文的質素;他們亦對公司似乎懶得預先將許多結果形式化,甚至在遭撤回的論文中連核查也沒有,表示失望。所用提示詞等資訊,也會大大減輕不少人評估公司突然推出的大量材料時所感受到的負擔。
最重要的是,該公司表示沒有計劃停止以數學問題測試其模型,並且暗示認為這樣做勢在必行。該公司公佈最新成果時表示:「我們希望直接為科學家提供最先進的能力,並正負責任地準備發布產生這些成果的模型。」「因此,繼續以數學及其他科學領域評估我們內部的前沿模型十分重要,讓我們可以加快開發工具,推動這些領域發展。」
OpenAI 發布成果後,AGMAI 形容這次發布是「第一步」,並再次呼籲各方公平取得運算資源和研究工具。更根本而言,該組織認為:「數學研究的未來不能只限於理解 AI 實驗室產生的成果。」
OpenAI 聲稱已解決數百個長期未解的問題,但數學家表示,仍有大量工作有待完成。許多人估計,學界要理解公司剛發布的所有內容,可能需要多年時間。
Armstrong 把大量新數學成果突然湧現,比作外星人短暫造訪後可能引發的騷動。他説:「如果 AI 現在消失,就像外星人來到地球後便離開一樣,我們接下來 10 年都會研究這些成果,試圖理解一切。」
其中不少工作本身也會令人振奮。研究人員需要補足缺漏、提取有用的想法和關聯,並把解答置於更廣闊的數學脈絡中;這些工作通常都與為人類提供解答密不可分。Lichtman 説:「對於許多這類成果,相關領域的專家非常重視其解答,我相信他們能夠理解並向更廣泛的大眾介紹。」他認為,隨着 AI 改變各個領域,解釋、驗證和提供成果背景脈絡的工作將需要獲得更多重視。他説:「作為一個社會,我們應該更加肯定這些消化成果的工作。」
人類或許還有大量數學工作可以做。Lichtman 表示,據他所知,所有成果雖然「令人驚嘆」,但都「源自現有的方法和技巧」。這些成果填補了已知數學版圖的部分空白,而非創造全新的版圖。Lozano-Robledo 也表達了相同看法:「事實證明,還有比專家先前所知多得多的空間可以填補!」他説:「這些成果都以極具巧思的方式運用了現有技巧。」
而現有的版圖絕非極限。Lozano-Robledo 説:「數學研究本質上是無窮無盡的。研究會繼續下去。」倫敦研究所的 He 説,他尤其期待看到接下來會有甚麼成果,並推測研究人員最終或會創造新想法,「甚至可能開創新的數學領域」。
各家公司似乎已準備好立即轉向下一步,遠早於學界有合理機會消化它們所產生的成果。
《The Verge》訪問的數學家之中,幾乎沒有人原則上反對 AI 產生新的數學成果。事實上,許多人對此表示歡迎,也有不少人表示自己熱衷使用 AI 工具,只是程度各有不同。他們大多對開發這些工具的 AI 公司進入其領域的方式感到不安。
若只看 OpenAI 和其他 AI 實驗室發布的數學成果,難免會以為數學研究基本上就是逐項解決清單上的問題。AI 實驗室公佈成果的方式,更加深了這種印象:先發布一則引人注目的公告,再發表一份初步報告,然後把其餘工作交給數學家去弄清楚並梳理背景脈絡。多位研究人員告訴The Verge,這些公司似乎隨時準備立即轉向下一件事,遠早於學界有合理機會消化它們的成果。
研究人員形容,這種看法忽略了數學研究實際運作方式的豐富層面。找到解答固然重要,但尋找解答的過程同樣重要:發展想法、建立聯繫,以及提出新問題或開拓其他研究方向。數學家表示,像 OpenAI 這樣的公司若只找出答案,卻沒有做任何相關工作,這些工作便會落回學界身上。
「有新成果固然好,但這個規模完全是另一個層次。」波蘭波茲南的 Adam Mickiewicz University 數學家 Bartosz Naskręcki 説。「這簡直是一團糟,」他説。「這可能令學術文化大幅崩潰,甚至摧毀大多數院系。這是個社會問題,而 AI 實驗室似乎完全忽視了這件事。」
需要多年時間才能理解的,不只是數學本身。研究人員也難以理解這場巨變對自己意味着甚麼。許多人形容,學界籠罩着一種黯淡、近乎存在主義的氣氛;數學家正努力弄清自己在這個迅速變化的領域中身處何處。他們或許沒有太多時間弄清這一點。
有關 OpenAI 即將發布更多成果的傳聞已在數學家之間流傳。OpenAI 沒有回應The Verge有關是否計劃發布更多成果的提問。
Roney-Dougal 説,她很擔心又有一批成果突然發布,也擔心 Anthropic 或其他 AI 實驗室加入競逐。
這場動盪對博士生、初級研究人員,以及其他沒有終身教職保障的人打擊尤其大。OpenAI 模型正迅速攻克的這類未解問題,可以成為論文、資助申請、求職申請,以及多年研究計劃的基礎;這些都是學術生涯的重要基石。多位研究人員形容,一種日益普遍的焦慮正在蔓延:他們用來建立學術生涯的研究,可能突然成為下一個被攻克的目標;而 AI 模型在封閉其他研究方向時,卻鮮有開闢未來探究的新途徑。「對於資助快要到期,或正在找工作的人來説,這造成了極大的衝擊。」即將加入法國國家科學研究中心(CNRS)的瑞士 ETH Zurich 數學家 Simon Machado 説。
「數學研究基本上是無窮無盡的。研究會繼續下去。」
士氣或許特別低落,因為一切都令人感到永無休止。OpenAI 的研究結果一浪比一浪大,彼此之間幾乎沒有間隔,而且公司經常暗示還會有更多成果。「你會覺得他們根本不在乎這些個別成果,」Roney-Dougal 説。「這種感覺真的很糟糕。」
數學家幾乎沒有時間消化一批成果,下一批規模更大的成果便接踵而至。「再過兩個月,就會有某些成果把這些比下去,」Armstrong 説。「這就像一枚比一枚大的炸彈接連轟炸。」
Armstrong 表示,他認為自己是對 AI 最熱衷、最樂觀的數學家之一。他在自己的工作中使用這項技術,並相信它潛力巨大。但即使是他,也愈來愈感到不安。「晚上有點難以入睡,」他坦言。
被問到接下來有甚麼計劃時,Armstrong 沒那麼肯定。當時他仍在巴黎街頭步行,正要去吃午餐。他説,眼前最重要的是完成手頭上的一些工作——有時會藉助 OpenAI’s Codex——「趁 OpenAI 未搶先之前」。
除此之外,即使是自稱 AI 樂觀派的他,也感到迷惘,並質疑自己在數學領域還有怎樣的未來。他尤其擔心這個領域的年輕研究人員。「數學界未來幾年會非常古怪,」他説。
追蹤這篇報道中的主題和作者,即可在個人化首頁動態中查看更多類似內容,並接收電郵更新。
- Robert Hart
來源:The Verge · AI · theverge.com