CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題
聯繫我們
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
  • 資安
  • NAS 與儲存
  • 網通
  • 虛擬化與容器
  • 開發與 DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
首頁 AI

OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程

Chen Glenn by Chen Glenn
2026 年 10 月 07 日 08:50
in AI, 新聞
閱讀時間: 3 分鐘
A A
OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程
2.5k
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

數學長期被視為人類智慧最純粹的試煉場,OpenAI 近日發表一篇「Sharing AI progress in mathematics (分享數學領域的 AI 進展)」,宣布將一個未公開的內部尖端模型在開放數學問題上產出的結果,整批公開於 GitHub 儲存庫 openai/math。

RELATED POSTS

Anthropic擴大網路安全驗證計畫 新增三大存取層級

Amazon 購物資料推斷「扁平臀」引爆隱私爭議|Apple 聯手 LG 進軍智慧家庭|產業精選 10.07

SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS

這是繼 8 月 1 日十項數學與理論電腦科學成果、9 月 8 日 Navier-Stokes 千禧年難題證明之後,OpenAI 第三次大規模發布 AI 產出的數學結果,也是第一次明確表示揭露方式參考了數學社群自行制定的準則。

數學為何是 AI 推理的終極試金石

數學命題要求嚴謹的邏輯推演與多步驟證明,任何一步出錯都會導致結論失效,這使得它成為評估 AI 推理能力的嚴格標準。相較於自然語言問答,數學問題的對錯可以被形式化驗證,因此更容易衡量模型是否真正理解而非只是背誦答案。

OpenAI 此次公開的內容,正是在這樣的背景下展示其在形式推理上的階段性成果,讓外界得以一窺模型如何處理抽象符號與證明結構。

從解題到證明:技術門檻的躍升

過去 AI 在數學上的表現多半集中在計算或選擇題式的求解,真正困難的是生成完整且可被檢驗的證明過程。這需要模型不僅算出答案,還要鋪陳出每一步的推理依據,並在長鏈條的邏輯中維持一致性。

這類能力的推進,可以觀察到模型讓自動化定理證明與數學研究輔助工具的可能性變得更加具體。

釋出內容

從儲存庫 README 說明來看,目前收錄 722 份手稿,分為 372 個「家族」(family)。每個家族集合一組相關論文,可能包含主結果、輔助論證、推論或替代證明,並依數學學科分類。儲存庫以 Apache-2.0 授權釋出,附有總覽文件、手稿索引與各篇的 BibTeX 引用資訊。

在驗證狀態上,OpenAI 以 Lean 證明助理對其中許多結果進行形式化,使證明可由電腦檢查,但明確表示並非所有結果都已形式化,未形式化的結果可能存在問題,後續將持續補上形式化證明並修正錯誤。

為了讓外界理解結果如何產生,儲存庫另公開了 10 份模型推理過程的節錄摘要,涵蓋 π 的無理性指數、對稱與一般 Mahler 猜想、Kaplansky 直接有限性猜想 (特徵二)、稀釋自旋玻璃的 Mézard-Parisi 公式、自由群因子同構、三維相對論性 Vlasov-Maxwell 系統等題目。

產出方式與 AI 算力揭露

OpenAI 表示,絕大多數結果是以同一套固定流程、由同一個未公開的內部模型產生。整個評測過程中,模型共被提出約 4,000 道問題,經彙整為結果家族並篩選顯著性後,形成目前的 722 份手稿。平均每個結果耗用的算力,約相當於 ChatGPT Pro 三小時的推理運算。

有兩項結果未循固定流程。一是黎曼 zeta 函數在 Re(s) > 11/12 的零點自由區域,二是 CM 阿貝爾簇上的 Hodge 猜想證明。其中零點自由區域的寫作經過人工編輯以提高可讀性。這兩項例外說明,即使在號稱全自動的釋出中,人工介入的邊界仍需逐案檢視。

README 同時交代了這批評測的由來。OpenAI 稱其既有的數學評測基準已達飽和,才將評測範圍擴大到開放研究問題,部分結果也建立在模型先前產出的結果之上。

從單一難題到批次釋出

這次釋出的脈絡可回溯至 9 月。OpenAI 在 9 月 8 日的文章中表示,一個自 8 月 28 日起訓練、能力顯著超越 GPT-6 Astra 的內部模型,透過約一萬個並行代理協作,在 88 小時內產出 Navier-Stokes 方程可在有限時間內形成奇異點的證明,並以 GPT-6 Astra 完成 Lean 形式化驗證。該文同時承認 Anthropic 員工 Levent Alpöge 與紐約大學教授 Tristan Buckmaster 在帶外力的 Euler 問題上具有優先權。

本次 10 月的釋出,則將同一模型在數千道開放問題上的結果一次公開。從單一重大結果走向批次釋出數百份手稿,驗證、引用與人類理解的負擔也隨之放大,這正是數學社群在 9 月提出準則的直接原因。

數學社群訂下的規則

OpenAI 在文中表示,為改善與數學社群分享成果的方式,已諮詢普林斯頓高等研究院的獨立組織「數學與人工智慧諮詢小組」(Advisory Group on Mathematics and Artificial Intelligence, AGMAI),並依其建議與公開準則決定本次的釋出方式。

AGMAI 於 9 月 29 日發布的「負責任釋出 AI 產生之數學」建議書,由數學社群逾 600 份回覆意見彙整而成。文件開宗明義指出,部分尖端 AI 實驗室以外界無法取得的私有模型測試高階數學問題,該小組不認可這種做法,並要求實驗室停止。建議書隨後以「既然實際上正在發生」為前提,提出一套最低限度的揭露規範,重點如下。

實驗室應主動搜尋文獻,即使模型獨立發現某個想法,仍應引用首先提出該想法的論文。

證明應改寫為符合傳統數學論文慣例的版本,避免冗長推理與非標準術語。

結果應存放於不受任何 AI 實驗室控制的學術儲存庫,具備持久可引用識別碼並允許評論。

每項結果應公開模型名稱、使用的提示詞、摘要後的思維鏈、耗時與估計算力成本。

證明應盡可能形式化,形式化成品需符合社群標準,包括 formalization.yaml 與 comparator 挑戰檔。

批次釋出時,應另撰文件說明問題如何挑選,以及模型嘗試過多少難度相當卻未解出的問題。

實驗室應提供包括經費在內的支持,協助人類理解其釋出的 AI 數學成果,但支持的分配應由既有非營利機構決定。

建議書同時提醒,實驗室不應將數學成果釋出當作推廣模型的行銷工具,並警告私有模型可能造成兩層結構,讓實驗室跑在整個領域前面,使數學社群與自身學科疏離。

AGMAI 的七項要求逐項對照

以 AGMAI 的七項要求檢視本次釋出,可以看出 OpenAI 已回應其中一部分,但仍有明顯缺口。

形式化證明、推理摘要、算力估計、嘗試題數、版本與引用協定,儲存庫均已提供。

儲存庫的 Lean 目錄包含 formalization.yaml 與 comparator 檢查說明,符合建議書對形式化成品的格式要求。

寄存位置仍在 OpenAI 自家的 GitHub。OpenAI 承認這一點,表示正在探索符合委員會準則的社群寄存方案。

模型名稱與提示詞兩項尚未揭露。OpenAI 的文章與 README 均只稱其為「內部模型」或「未公開的內部 OpenAI 模型」。

人類理解的支持方面,OpenAI 承諾資助一系列研討會、會議與專題計畫,細節將另行公布。

未解的爭議

引用與歸功是這一連串釋出中最具體的爭點。據 Scientific American 報導,8 月的十項成果發布後,葉史瓦大學數學家 Steven Miller 指出其中球體堆積證明重用了他 2016 年論文的論證卻未引用,劍橋大學的 Francesco Fournier-Facio 則指出 soficity 結果結合了 2016 與 2019 年既有論文的想法。OpenAI 當時回應將為結果正確性負責並進行更新。AGMAI 建議書將「主動搜尋文獻並引用先行想法」列為第一項要求,OpenAI 本次文章特別強調引用協定與改善引用品質,背景即在於此。

更根本的分歧在於是否該以私有模型測試開放問題。OpenAI 將持續評測內部尖端模型視為加速科學工具開發的必要步驟,並表示正努力以負責任的方式釋出產生這些結果的模型。AGMAI 的立場則是這種做法本身不應進行。OpenAI 參考的是一份在原則上反對其做法的文件,雙方目前的交集僅止於「既然要做,至少依規範揭露」。

此外,OpenAI 有提到未形式化的結果可能有誤,而 722 份手稿的審查工作量遠超過先前任何一次釋出。哪些結果最終能進入正式研究脈絡,以及數學社群是否願意在不認可其做法的前提下接受研討會資助,都還有待觀察。

CyberQ 觀點

OpenAI 在數學推理上的公開進展,值得關注的不只是分數或題數,而是它是否推動了可驗證、可遷移的推理能力。

對開發者與研究者而言,評測 AI 時自然是更需要重視過程與證據,而非單一結果。數學是試金石,讓我們期待他們後續的發展和成果吧。

OpenAI 數學突破引監管焦慮|Meta Muse 美加下載量超越 ChatGPT|產業精選 09.22
OpenAI 千禧年難題解題掀波:Navier–Stokes 證明引爆時序質疑,核心研究員為失言公開致歉
OpenAI 宣稱解開 Navier–Stokes 千禧年難題?數學界與科技圈熱議沸騰
標籤: OpenAI
Share30Tweet19ShareShareShare5
上一篇

Anthropic擴大網路安全驗證計畫 新增三大存取層級

Chen Glenn

Chen Glenn

開發工程師,目前在北台灣的科技業任職。

相關文章

Anthropic擴大網路安全驗證計畫 新增三大存取層級
新聞

Anthropic擴大網路安全驗證計畫 新增三大存取層級

2026 年 10 月 7 日
Amazon 購物資料推斷「扁平臀」引爆隱私爭議|Apple 聯手 LG 進軍智慧家庭|產業精選 10.07
新聞

Amazon 購物資料推斷「扁平臀」引爆隱私爭議|Apple 聯手 LG 進軍智慧家庭|產業精選 10.07

2026 年 10 月 7 日
SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS
新聞

SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS

2026 年 10 月 6 日
Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率
AI

Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

2026 年 10 月 6 日
AI 晶片新創估值狂飆至 400 億美元|ChatGPT 將於歐盟加上文字浮水印|Lucid 電動車減產|產業精選 10.06
新聞

AI 晶片新創估值狂飆至 400 億美元|ChatGPT 將於歐盟加上文字浮水印|Lucid 電動車減產|產業精選 10.06

2026 年 10 月 6 日
Anthropic Mythos 揪出 HFS 密碼學漏洞 24 小時內遭武器化|Meta Muse Spark 共同署名六篇數學論文|AI 趨勢精選 10.05
AI

Anthropic Mythos 揪出 HFS 密碼學漏洞 24 小時內遭武器化|Meta Muse Spark 共同署名六篇數學論文|AI 趨勢精選 10.05

2026 年 10 月 5 日

推薦閱讀

OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程

OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程

2026 年 10 月 7 日
Anthropic擴大網路安全驗證計畫 新增三大存取層級

Anthropic擴大網路安全驗證計畫 新增三大存取層級

2026 年 10 月 7 日
Amazon 購物資料推斷「扁平臀」引爆隱私爭議|Apple 聯手 LG 進軍智慧家庭|產業精選 10.07

Amazon 購物資料推斷「扁平臀」引爆隱私爭議|Apple 聯手 LG 進軍智慧家庭|產業精選 10.07

2026 年 10 月 7 日
SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS

SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS

2026 年 10 月 6 日
Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

2026 年 10 月 6 日

近期熱門

  • 極簡 AI 程式碼代理 Pi 1.0 正式登場,做減法的 harness 為何引發關注?

    極簡 AI 程式碼代理 Pi 1.0 正式登場,做減法的 harness 為何引發關注?

    332 shares
    Share 133 Tweet 83
  • GitHub 趨勢周報 Vol.36,代理工程從加功能轉向省資源,技能包成為開發方法論的載體

    253 shares
    Share 101 Tweet 63
  • Apple 推出 Pass Designer 工具,讓數位票卡設計變得更親民

    250 shares
    Share 100 Tweet 63
  • DGX Spark 一年漲七成五,NVIDIA 推 4,999 美元 64GB 會好用嗎 ?

    209 shares
    Share 84 Tweet 52
  • Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

    190 shares
    Share 76 Tweet 48
  • QNAP HDP for Business Beta 實測:一台 x86 NAS 當企業備份中心,不可變備份與開機驗證加影片

    191 shares
    Share 76 Tweet 48
  • 微軟釋出 Windows 11 26H2 更新

    282 shares
    Share 113 Tweet 71
  • SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS

    127 shares
    Share 51 Tweet 32
  • macOS 27 關掉 Apple Intelligence,把被吃掉的硬碟空間要回來

    121 shares
    Share 48 Tweet 30
  • Google 發表 Gemini 4 Argon:新一代多模態模型正式登場,AI 競爭再升溫

    120 shares
    Share 48 Tweet 30

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。