數學長期被視為人類智慧最純粹的試煉場,OpenAI 近日發表一篇「Sharing AI progress in mathematics (分享數學領域的 AI 進展)」,宣布將一個未公開的內部尖端模型在開放數學問題上產出的結果,整批公開於 GitHub 儲存庫 openai/math。
這是繼 8 月 1 日十項數學與理論電腦科學成果、9 月 8 日 Navier-Stokes 千禧年難題證明之後,OpenAI 第三次大規模發布 AI 產出的數學結果,也是第一次明確表示揭露方式參考了數學社群自行制定的準則。
數學為何是 AI 推理的終極試金石
數學命題要求嚴謹的邏輯推演與多步驟證明,任何一步出錯都會導致結論失效,這使得它成為評估 AI 推理能力的嚴格標準。相較於自然語言問答,數學問題的對錯可以被形式化驗證,因此更容易衡量模型是否真正理解而非只是背誦答案。
OpenAI 此次公開的內容,正是在這樣的背景下展示其在形式推理上的階段性成果,讓外界得以一窺模型如何處理抽象符號與證明結構。
從解題到證明:技術門檻的躍升
過去 AI 在數學上的表現多半集中在計算或選擇題式的求解,真正困難的是生成完整且可被檢驗的證明過程。這需要模型不僅算出答案,還要鋪陳出每一步的推理依據,並在長鏈條的邏輯中維持一致性。
這類能力的推進,可以觀察到模型讓自動化定理證明與數學研究輔助工具的可能性變得更加具體。
釋出內容
從儲存庫 README 說明來看,目前收錄 722 份手稿,分為 372 個「家族」(family)。每個家族集合一組相關論文,可能包含主結果、輔助論證、推論或替代證明,並依數學學科分類。儲存庫以 Apache-2.0 授權釋出,附有總覽文件、手稿索引與各篇的 BibTeX 引用資訊。
在驗證狀態上,OpenAI 以 Lean 證明助理對其中許多結果進行形式化,使證明可由電腦檢查,但明確表示並非所有結果都已形式化,未形式化的結果可能存在問題,後續將持續補上形式化證明並修正錯誤。
為了讓外界理解結果如何產生,儲存庫另公開了 10 份模型推理過程的節錄摘要,涵蓋 π 的無理性指數、對稱與一般 Mahler 猜想、Kaplansky 直接有限性猜想 (特徵二)、稀釋自旋玻璃的 Mézard-Parisi 公式、自由群因子同構、三維相對論性 Vlasov-Maxwell 系統等題目。
產出方式與 AI 算力揭露
OpenAI 表示,絕大多數結果是以同一套固定流程、由同一個未公開的內部模型產生。整個評測過程中,模型共被提出約 4,000 道問題,經彙整為結果家族並篩選顯著性後,形成目前的 722 份手稿。平均每個結果耗用的算力,約相當於 ChatGPT Pro 三小時的推理運算。
有兩項結果未循固定流程。一是黎曼 zeta 函數在 Re(s) > 11/12 的零點自由區域,二是 CM 阿貝爾簇上的 Hodge 猜想證明。其中零點自由區域的寫作經過人工編輯以提高可讀性。這兩項例外說明,即使在號稱全自動的釋出中,人工介入的邊界仍需逐案檢視。
README 同時交代了這批評測的由來。OpenAI 稱其既有的數學評測基準已達飽和,才將評測範圍擴大到開放研究問題,部分結果也建立在模型先前產出的結果之上。
從單一難題到批次釋出
這次釋出的脈絡可回溯至 9 月。OpenAI 在 9 月 8 日的文章中表示,一個自 8 月 28 日起訓練、能力顯著超越 GPT-6 Astra 的內部模型,透過約一萬個並行代理協作,在 88 小時內產出 Navier-Stokes 方程可在有限時間內形成奇異點的證明,並以 GPT-6 Astra 完成 Lean 形式化驗證。該文同時承認 Anthropic 員工 Levent Alpöge 與紐約大學教授 Tristan Buckmaster 在帶外力的 Euler 問題上具有優先權。
本次 10 月的釋出,則將同一模型在數千道開放問題上的結果一次公開。從單一重大結果走向批次釋出數百份手稿,驗證、引用與人類理解的負擔也隨之放大,這正是數學社群在 9 月提出準則的直接原因。
數學社群訂下的規則
OpenAI 在文中表示,為改善與數學社群分享成果的方式,已諮詢普林斯頓高等研究院的獨立組織「數學與人工智慧諮詢小組」(Advisory Group on Mathematics and Artificial Intelligence, AGMAI),並依其建議與公開準則決定本次的釋出方式。
AGMAI 於 9 月 29 日發布的「負責任釋出 AI 產生之數學」建議書,由數學社群逾 600 份回覆意見彙整而成。文件開宗明義指出,部分尖端 AI 實驗室以外界無法取得的私有模型測試高階數學問題,該小組不認可這種做法,並要求實驗室停止。建議書隨後以「既然實際上正在發生」為前提,提出一套最低限度的揭露規範,重點如下。
實驗室應主動搜尋文獻,即使模型獨立發現某個想法,仍應引用首先提出該想法的論文。
證明應改寫為符合傳統數學論文慣例的版本,避免冗長推理與非標準術語。
結果應存放於不受任何 AI 實驗室控制的學術儲存庫,具備持久可引用識別碼並允許評論。
每項結果應公開模型名稱、使用的提示詞、摘要後的思維鏈、耗時與估計算力成本。
證明應盡可能形式化,形式化成品需符合社群標準,包括 formalization.yaml 與 comparator 挑戰檔。
批次釋出時,應另撰文件說明問題如何挑選,以及模型嘗試過多少難度相當卻未解出的問題。
實驗室應提供包括經費在內的支持,協助人類理解其釋出的 AI 數學成果,但支持的分配應由既有非營利機構決定。
建議書同時提醒,實驗室不應將數學成果釋出當作推廣模型的行銷工具,並警告私有模型可能造成兩層結構,讓實驗室跑在整個領域前面,使數學社群與自身學科疏離。
AGMAI 的七項要求逐項對照
以 AGMAI 的七項要求檢視本次釋出,可以看出 OpenAI 已回應其中一部分,但仍有明顯缺口。
形式化證明、推理摘要、算力估計、嘗試題數、版本與引用協定,儲存庫均已提供。
儲存庫的 Lean 目錄包含 formalization.yaml 與 comparator 檢查說明,符合建議書對形式化成品的格式要求。
寄存位置仍在 OpenAI 自家的 GitHub。OpenAI 承認這一點,表示正在探索符合委員會準則的社群寄存方案。
模型名稱與提示詞兩項尚未揭露。OpenAI 的文章與 README 均只稱其為「內部模型」或「未公開的內部 OpenAI 模型」。
人類理解的支持方面,OpenAI 承諾資助一系列研討會、會議與專題計畫,細節將另行公布。
未解的爭議
引用與歸功是這一連串釋出中最具體的爭點。據 Scientific American 報導,8 月的十項成果發布後,葉史瓦大學數學家 Steven Miller 指出其中球體堆積證明重用了他 2016 年論文的論證卻未引用,劍橋大學的 Francesco Fournier-Facio 則指出 soficity 結果結合了 2016 與 2019 年既有論文的想法。OpenAI 當時回應將為結果正確性負責並進行更新。AGMAI 建議書將「主動搜尋文獻並引用先行想法」列為第一項要求,OpenAI 本次文章特別強調引用協定與改善引用品質,背景即在於此。
更根本的分歧在於是否該以私有模型測試開放問題。OpenAI 將持續評測內部尖端模型視為加速科學工具開發的必要步驟,並表示正努力以負責任的方式釋出產生這些結果的模型。AGMAI 的立場則是這種做法本身不應進行。OpenAI 參考的是一份在原則上反對其做法的文件,雙方目前的交集僅止於「既然要做,至少依規範揭露」。
此外,OpenAI 有提到未形式化的結果可能有誤,而 722 份手稿的審查工作量遠超過先前任何一次釋出。哪些結果最終能進入正式研究脈絡,以及數學社群是否願意在不認可其做法的前提下接受研討會資助,都還有待觀察。
CyberQ 觀點
OpenAI 在數學推理上的公開進展,值得關注的不只是分數或題數,而是它是否推動了可驗證、可遷移的推理能力。
對開發者與研究者而言,評測 AI 時自然是更需要重視過程與證據,而非單一結果。數學是試金石,讓我們期待他們後續的發展和成果吧。







