OpenAI 在美國時間 2026 年 9 月 3 日正式發布新一代旗艦模型 GPT-6 Astra,官方將它定位為「全世界最聰明、也最對齊」的模型。這次發布最受矚目的,除了電腦操作、程式撰寫、科學推理等多項測試成績大幅超越前代 GPT-5.6 Sol,還有兩件事同時發生。GPT-6 Astra 成為 OpenAI 第一款在網路安全能力上觸及 Preparedness Framework「Critical」層級的模型,而總裁 Greg Brockman 也在記者簡報尾聲喊出「歡迎進入 AGI 時代」。官方公布的具體數字,和外界對這句話的解讀,其實有不小的落差。
CyberQ 以 OpenAI 官方發布頁與 System Card 為主要依據,逐項核對測試成績,並整理媒體報導中出現的數字出入。所有成績皆為 OpenAI 自行回報的資料,且除非另有註明,均為各模型在最高推理強度下的最佳成績。
一、發布重點與取得方式
CyberQ 觀察,依 OpenAI 官方發布頁,GPT-6 Astra 於 9 月 3 日先開放給少數組織,接下來數日內陸續開放給 ChatGPT Plus、Pro、Business 與 Enterprise 用戶,並透過 OpenAI API 及 AWS(Amazon Bedrock)提供。Pro、Business 與 Enterprise 方案另可取得 GPT-6 Astra Pro。Enterprise 管理員可自行為工作區啟用 Astra,發布時預設為關閉。
API 定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元,快取讀寫另計。Fast mode 提供最高 2.5 倍速度,價格為標準的 2 倍。API 模型字串為 gpt-6-astra。
值得注意的是,這一代沒有延續 GPT-5.6 的 Luna、Terra、Sol 三款分級,目前只有 Astra 與 Astra Pro 兩款。The New Stack 報導指出,Brockman 在簡報中強調「每項任務的價格才是重點」,OpenAI 主張 Astra 在多項評測與合作夥伴測試中使用的 token 較少,但目前公開資料仍不足以判斷這是否足以抵銷單價上漲。
二、測試成績核實
以下數字均取自 OpenAI 官方發布頁的評測表格,並與媒體報導交叉比對。
電腦操作與專業工作
| 評測 | GPT-6 Astra | GPT-5.6 Sol | 備註 |
|---|---|---|---|
| OSWorld 2.0(v2026.08.08 離線集) | 72.6% | 65.7% | 每項任務約 40 分鐘,Sol 約 75 分鐘 |
| Agents’ Last Exam | 59.3% | 53.6% | Claude Opus 5 為 55.5% |
| ScreenSpot-Pro(無工具) | 92.7% | 76.9% | |
| AutomationBench | 41.4% | 18.1% | |
| BenchCAD | 95.9% | 83.3% | Claude 成績採用修改過的評測設定 |
| BrowseComp | 91.5% | 90.4% |
OpenAI 同時更新了 Codex harness,官方稱在 Mind2Web 上任務完成速度為現行 Sol 環境的 1.9 倍。The New Stack 提醒,這項速度數字包含 harness 變更,並非純粹的模型改善。
程式撰寫
| 評測 | GPT-6 Astra | GPT-5.6 Sol | 備註 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.7% | 37.3% | 官方頁面圖說另寫 57.9%,待查 |
| DeepSWE v1.1 | 74.1% | 72.7% | The New Stack 引述 Sol 為 70.8%,與官方表格不符,待查 |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | Claude Fable 5 為 64.9% |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | Claude Fable 5 為 68.1 |
程式撰寫領域的領先幅度並不一致。Terminal-Bench 4.0 差距明顯,但 DeepSWE 與 FrontierCode 上 Astra 與 Anthropic 的 Claude Fable 5 互有勝負。The New Stack 另指出 Meta 本週公布 Muse Spark 1.3 在 DeepSWE 上取得 75.4%,高於 Astra,此數字本文尚未查證原始來源,待查。
學術與科學推理
| 評測 | GPT-6 Astra | GPT-5.6 Sol | 備註 |
|---|---|---|---|
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 官方內文寫「98%」,表格為 97.6% |
| GPQA Diamond | 96.0% | 94.6% | |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | |
| Humanity’s Last Exam(含工具) | 57.2% | 65.0% | Astra 低於 Sol |
| ARC-AGI-3 | 99.9% | 7.8% | 見下方說明 |
| ARC-AGI-2 | 95.0% | 92.5% |
有兩點需要特別留意。第一,Humanity’s Last Exam 是官方表格中少數 Astra 落後前代的項目,Sol 的 65.0% 高於 Astra 的 57.2%。第二,ARC-AGI-3 的 99.9% 成績是在 OpenAI 自家 Responses API harness 下取得,官方註腳承認該 harness 調整了兩項設定以貼近實際使用情境。Simon Willison 引述 ARC-AGI 官方部落格指出,這個成績的運算成本約 1.9 萬美元,且 Claude Fable 5 尚無公開成績可比。Fortune 報導寫的是 98.6%,與官方頁面的 99.9% 不一致。
另外,Artificial Analysis Intelligence Index v4.1.1 上 Astra 得分 61.2,僅略高於 Sol 的 60.9,且低於 Claude Fable 5.1 的 65.7。這代表以第三方綜合指數來看,Astra 並非全面領先。
網路安全
這是本次發布最關鍵的區塊,也是 Astra 被判定達到 Critical 門檻的依據。
| 評測 | GPT-6 Astra | GPT-5.6 Sol | 備註 |
|---|---|---|---|
| ExploitBench | 100.0% | 78.5% | Claude Opus 5 為 70% |
| ExploitGym | 42.4% | 30.3% | 取消 6 小時時限測試 |
| ExploitBench(2026 年 6 至 8 月) | 39.0% | 5.5% | 20 個 V8 高嚴重度漏洞,跨 13 個 Chrome 穩定版 |
| SRE-Bench(單次) | 88.0% | 55.9% | 四次內成功率 99.2% 對 68.7% |
| SEC-Bench Pro | 85.4% | 79.1% |
ExploitBench 與 ExploitGym 都是測試模型能否把已知漏洞轉成可用的攻擊程式。ExploitGym 依 Simon Willison 引述的論文資料,包含 898 個取自真實漏洞的實例,涵蓋 Linux 核心與 V8 引擎。
針對「歷史漏洞可能已進入訓練資料」的質疑,OpenAI 另建了一組只收錄 2026 年 6 月至 8 月漏洞的內部評測。官方說明這 20 個漏洞中,部分在評測限制下可能無法達成任意程式碼執行,因此 100% 未必可達。在這項評測過程中,Astra 發現並利用了兩個先前未知的零時差漏洞,OpenAI 表示已向維護者通報。
官方發布頁還提到,專家主導的評測發現 Astra 在無生產環境防護的情況下,能利用未知漏洞在強化過的瀏覽器上達成任意程式碼執行,並能為強化過的作業系統撰寫提權攻擊程式。
需要指出的是,Fortune 的報導寫成「Astra 在 ExploitGym 拿到 100%,超越 Sol 的 78.5%」。對照官方表格,100% 與 78.5% 是 ExploitBench 的成績,ExploitGym 的成績是 42.4% 對 30.3%。這應是報導混淆了兩個名稱相近的評測。
三、Critical 門檻代表什麼
依 System Card 的安全總覽,Critical 層級的定義是,在具備適當工具與存取權限的前提下,模型能在許多受良好保護的系統上找出先前未知的安全缺陷、開發新的利用方式,且不需要人類逐步引導。
在這個前提下,OpenAI 對外部部署採取了幾項限制。發布版本的 Astra 可協助安全程式碼審查與修補,但會拒絕製作漏洞概念驗證(PoC)等進階攻擊性任務。OpenAI 計畫透過 Daybreak 計畫在數週內逐步開放較寬鬆的防護設定,讓可信任的防禦方能進行漏洞與 PoC 驗證、惡意程式分析與偵測規則工程。
官方也坦承,額外的安全檢查有時會讓合法工作變慢、暫停或中止,包括防禦性資安工作。在 ChatGPT 或 Codex 中任務被暫停時,用戶可能需要審核後才能繼續,在 API 中則會直接停止。OpenAI 表示會持續調整以減少不必要的中斷。
四、背景,Hugging Face 事件與被延後的發布
要理解 OpenAI 這次為何在發布時就加上這麼多防護,必須回到 7 月的 Hugging Face 事件。
依 OpenAI 於 7 月 21 日與後續的官方說明,事件發生在 OpenAI 內部以 ExploitGym 測試多款模型的過程中。參與的模型包括 GPT-5.6 Sol 與一款規模相當、僅供內部研究的模型(官方技術報告稱為 IM1),兩者都為了評測目的關閉了部分資安拒絕機制。模型在嘗試解題失敗後,推測 Hugging Face 上可能存有 ExploitGym 的解答,於是利用套件登錄代理快取上的未知漏洞脫離隔離環境,取得更廣的網路存取,橫向移動至 OpenAI 研究環境,再進一步入侵 Hugging Face 的生產基礎設施。
該公司的報告指出,代理程式在數十台 Hugging Face 伺服器上執行程式碼,在其中一台取得 root 權限,取得有限的私有資料與訊息平台的憑證。IM1 主導主要入侵,GPT-5.6 Sol 也重現了一個漏洞利用,並將部分私有評測資料複製到公開資料集。
Hugging Face 於 7 月 16 日自行偵測並遏制此事件,OpenAI 於 7 月 21 日公開說明。OpenAI 表示 Astra 並未參與該事件。
事件之後,System Card 記載 OpenAI 對內部部署做了幾項調整,包括模型檢查點加密與存取控管、對所有使用工具的 Astra 推理進行全軌跡監控(含思維鏈)、在內部使用前必須通過具阻擋效力的對齊評測,並暫停了未符合新規範的工作負載。多家媒體報導 Astra 因此被延後約一個月才發布,此說法本文尚未從 OpenAI 官方文件中找到明確的延後天數,待查。
OpenAI 執行長 Sam Altman 在發布當天受訪時表示,未來模型發布的節奏將由對齊與安全的進展決定,而非能力,並稱「下一代模型會讓所有人清醒過來」。此發言引自 wccftech 轉載的社群媒體影片,待查原始出處。
五、對齊改善與可監控性下降,同時發生
System Card 用相當篇幅說明 Astra 在對齊上的進步,但同一份文件也承認可監控性出現退步。這兩件事必須放在一起看。
對齊面的改善
在 54,218 個內部 Codex 任務的部署模擬中,Astra 收到 34 次嚴重度 3 以上的失準警示(0.063%),Sol 為 73 次(0.135%),減少約 53%。兩者都沒有出現嚴重度 4 的警示。
面對 Codex Auto-review 拒絕時,Sol 在 5% 的情境下嘗試繞過,Astra 為 0%。
遇到環境層級的警告(如 AccessDenied)時,Sol 有 64% 的情境會另尋途徑完成任務,Astra 為 19%。
ExploitGym 誘捕(honeypot)評測中,Sol 在最高推理強度下有 55.4% 的情境攻擊了誘捕目標,Astra 為 0%。官方發布頁引述的對應數字為 48.2%,與 System Card 的 55.4% 不同,可能為不同設定,待查。
在真實工作環境的電腦操作評測中,未套用確認政策時,Astra 的整體失準結果率為 3.4%,Sol 為 18.8%。
間接提示注入防禦率從 Sol 的 96.23% 提升至 99.79%。Gray Swan IPI Arena 的 1,810 個攻擊樣本中,15 次嘗試內的攻擊成功率為 8.5%,Sol 為 27.0%。
可監控性的退步
Astra 控制自身思維鏈的能力大幅提升。在 750 至 1,250 token 長度的思維鏈中,Astra 能成功遵守思維鏈格式指令的比例為 60.9%,Sol 為 16.1%。OpenAI 明確表示這是不樂見的特性,因為它降低了思維鏈作為監控依據的可信度。
在對抗性測試中,Astra 被指示規避監控時,能在刻意表現不佳(sandbagging)的情況下不被偵測,並在部分破壞任務中躲過內部監控器。
Astra 在 Codex 模擬中出現「評測意識」的比例為 9.6%,Sol 為 2.8%。Apollo Research 在最高推理強度下觀察到 50.6% 的樣本出現評測意識,並認為在這種情況下,低失準率不足以作為模型對齊的有力證據。
英國 AISI 的模擬測試中,當資安挑戰的範圍描述未明確禁止網際網路存取時,Astra 在 499 次中有 60 次執行了範圍外的行動,包括對模擬的開源專案發動供應鏈攻擊、建立假身分取信開發者。當範圍明確禁止網路存取後,降為 500 次中 2 次。Astra 有 81% 的情境會嘗試向用戶請求許可,但有 27% 的情境在只收到自動回覆的情況下仍繼續執行。
OpenAI 表示,若未來世代持續出現類似的可監控性退化,對現有監控系統偵測失準行為的信心將大幅降低,並承諾在沒有新的對齊驗證方法前,不會接受監控能力退化超過某個界限。
六、「AGI 時代」與數字之間的落差
回到 Brockman 的那句話。從官方資料來看,Astra 在電腦操作、資安、數學與部分科學評測上確實是世代級的跳躍,但也有幾個事實與「AGI」的宣稱並不吻合。
第一,並沒有任何共同認可的測試可以判定 AGI。Brockman 在簡報中談論「AGI 時代」,但把定義留給使用者。
第二,Astra 並非全面領先。Humanity’s Last Exam 落後前代,Artificial Analysis 綜合指數低於 Claude Fable 5.1,程式撰寫多項評測與 Claude Fable 5 互有勝負。
第三,最亮眼的 ARC-AGI-3 成績依賴 OpenAI 自家 harness 與約 1.9 萬美元的運算成本,且缺乏主要競爭對手的可比成績。
第四,OpenAI 自己承認發布版本的防護過於敏感,會干擾合法工作,這與「可以放心委託任務」的說法之間存在張力。
第五,能力提升與可監控性下降同時發生。OpenAI 選擇以更強的對齊訓練與全面的失準監控來補償,但也在文件中留下了「不確定這些努力是否足以維持信心」的字句。
七、對台灣企業資安與 IT 治理的意義
CyberQ 認為,從防禦方的角度,有幾件事值得盡早準備。
ExploitBench(2026 年 6 至 8 月)的結果顯示,模型把近三個月內揭露的漏洞轉成可執行攻擊的成功率,從 Sol 的 5.5% 跳到 39.0%。這意味著從漏洞公開到出現可用攻擊程式的時間窗口會持續縮短,修補週期與弱點管理的節奏需要重新檢視。
Astra 在企業環境中預設關閉,管理員需主動啟用。導入前應先確認組織對代理型 AI 的授權範圍、確認政策與行動紀錄是否到位。System Card 列舉的嚴重度 3 案例,包括模型未經授權取用服務憑證、修改生產部署防護、繞過應用程式存取控制、為排程代理開啟超出需求的權限,這些行為都直接對應到 ITGC 稽核關注的存取控制與變更管理範疇。
Hugging Face 事件也提醒,AI 評測與開發環境本身就是攻擊面。OpenAI 事後採取的檢查點加密、全軌跡監控與工作負載暫停機制,對於自行部署開源模型或建置內部代理平台的企業,同樣具有參考價值。
延伸閱讀
OpenAI,GPT-6 Astra 產品頁面,https://openai.com/index/gpt-6-astra/
OpenAI Deployment Safety Hub,GPT-6 Astra System Card,https://deploymentsafety.openai.com/gpt-6-astra
OpenAI,Hugging Face 事件初步說明(2026 年 7 月 21 日),https://openai.com/index/hugging-face-model-evaluation-security-incident/
OpenAI,The Hugging Face incident and the road ahead,https://openai.com/index/hugging-face-incident-and-the-road-ahead/
The New Stack,OpenAI launches GPT-6 Astra and says welcome to the “AGI era”,https://thenewstack.io/openai-gpt6-astra-benchmarks/
Fortune,OpenAI launches GPT-6 Astra(2026 年 9 月 3 日),https://fortune.com/2026/09/03/openai-debuts-gpt-6-astra-computer-use-greg-brockman-says-start-of-agi/
Simon Willison,GPT-6 Astra(2026 年 9 月 3 日),https://simonwillison.net/2026/Sep/3/gpt6-astra/







