OpenAI 在 9 月 22 日(美國時間)發表 GPT-6 Sol 與 GPT-6 Luna,加上本月稍早推出的 GPT-6 Astra,GPT-6 系列三款模型全數到位。三個名字都來自拉丁文,Astra 是星、Sol 是太陽、Luna 是月亮,OpenAI 也在推文中以「進入 Astra 的軌道」形容這次發表。本文整理三款模型的定位、價格與評測數據,並回顧同一天 Anthropic 推出 Claude Opus 5.5 所引發的價格戰。
三款模型的分工
OpenAI 表示 Astra 是最高階的模型,而 Sol 與 Luna 採用與 Astra 相近的方法訓練,目的是把 Astra 在專業工作、事實正確性、程式撰寫、電腦操作與對齊方面的進展,帶到速度更快、價格更低的層級。
微軟 Microsoft Azure 同日宣布 Sol 與 Luna 在 Microsoft Foundry 正式上市,並建議客戶把高難度工作交給 Astra,一般用途使用 Sol,抽取、摘要、請求路由與例行客服等高流量工作則交給 Luna。
Sol 與 Luna 並非全新命名,兩者今年夏天已以 GPT-5.6 系列成員的身分出現,9 月 22 日 OpenAI 將其升級為 GPT-6 並將價格減半。
價格
OpenAI 公布的 API 定價如下(每百萬 token,美元)。
| 模型 | 輸入 | 輸出 | 備註 |
|---|---|---|---|
| GPT-6 Astra | 10 | 50 | Fast mode 速度最高兩倍,價格為標準的兩倍 |
| GPT-6 Sol | 2 | 10 | 較 GPT-5.6 Sol 的 4 / 20 降價 50% |
| GPT-6 Luna | 0.10 | 0.50 | 較 GPT-5.6 Luna 的 0.20 / 1.20 降價 50% |
資料來源為 OpenAI 的 Astra 與 Sol / Luna 公告。OpenAI 說明降價來自快取與推論效率的改善,並將 GPT-6 的提示快取命中率預設提高,快取讀取享有九折優惠,也就是僅收一成費用。GitHub 回報過去幾個月這些改進讓需要重新處理的提示 token 比例減少超過五成。
評測成績
以下資料皆出自 OpenAI 官方公告,屬廠商自行揭露,第三方獨立評測見下一節。
Astra
OpenAI 稱 Astra 在 FrontierMath Tier 4 拿到 98%,ARC-AGI-3 拿到 99.9%,ExploitBench 拿到 100%,並在電腦操作、瀏覽、軟體工程、資安、科學與專業工作上達到最先進水準。在 OSWorld 2.0 的延遲模擬中,Astra 以約 40 分鐘完成任務並取得 72.6%,GPT-5.6 Sol 則需約 75 分鐘且僅得 65.7%。
Sol
在 OpenAI 內部事實正確性評測中,Sol 的錯誤率約為前代的一半。DeepSWE v1.1 拿到 68.8%,與 Claude Fable 5 最高分 69.9% 相差 1.1 個百分點,每項任務成本約低 80%。OSWorld 2.0 離線集則以 60.5% 對上 Claude Opus 5 中等強度的 60.3%。
Luna
Luna 在最高強度下 DeepSWE v1.1 拿到 66.6%,OpenAI 稱與 Claude Opus 5 與 Fable 5 中等強度相當,每項任務成本分別低 93% 與 96%。
資安能力與安全防護
對資安從業者而言,Astra 最值得關注的是其攻擊面能力。OpenAI 表示 Astra 在其 Preparedness Framework 的資安項目達到 Critical 門檻。在無防護條件下,Astra 在 ExploitBench 拿到 100%,ExploitGym 成功率 42.4%,且在評測過程中發現並利用了兩個先前未知的零時差漏洞,OpenAI 已向維護者揭露。在 SRE-Bench 逆向工程評測中,Astra 單次嘗試解出 88.0%,四次內解出 99.2%,GPT-5.6 Sol 分別為 55.9% 與 68.7%。
OpenAI 對現行版本設下限制,Astra 可協助安全程式碼審查與修補,但會拒絕撰寫概念驗證攻擊程式等進階任務。OpenAI 計劃透過 Daybreak 計畫在未來幾週逐步開放較寬鬆的防護,以支援漏洞驗證、惡意程式分析與偵測工程等防禦工作。OpenAI 也坦承 Astra 的書面推理較 GPT-5.6 Sol 更難監控,並將改善可監控性列為研究優先事項。
CyberQ 觀察,OpenAI 稱 Sol 與 Luna 以與 Astra 相近的方法訓練,有可能包含 recurrent depth 技術,該技術能提升效能但會增加人類研究者監控模型決策的難度,OpenAI 還沒有公開透漏更多關於這方面的細節。
服務現況
Sol 與 Luna 即日起在 ChatGPT Work 與 Codex 提供給 Plus、Pro、Business、Enterprise 與 Edu 用戶,Free 與 Go 用戶可在桌面應用程式使用 Luna,一般 Chat 尚未開放。API 的模型名稱為 gpt-6-sol 與 gpt-6-luna。Astra 則透過 OpenAI API、Microsoft Azure 與 Amazon Bedrock 提供,企業管理員須自行啟用,預設為關閉。
市場情勢,同一天的價格戰
這次發表的時機值得注意。Anthropic 在 OpenAI 發表前約 90 分鐘推出 Claude Opus 5.5。Opus 5.5 定價為每百萬 token 輸入 4 美元、輸出 20 美元,Anthropic 稱一般工作負載可較 Opus 5 省 40%,快取讀取降幅最大,減少 60% 至 0.20 美元,另有 8 / 40 美元的加速模式。
CyberQ 觀察,GPT-6 Astra 與 Claude Fable 5.1 同樣定價 10 / 50 美元,目前的價格戰集中在旗艦之下的層級,Anthropic 也預告 Sonnet 5.5 與 Haiku 5.5 即將推出。回顧三週內的攻防,Anthropic 於 9 月 1 日推出 Fable 5.1,兩天後 OpenAI 以相同價格推出 Astra,接著雙方在同一天各自降價。前一天市場上還有 Grok 4.7 與 MiMo v2.6 Flash / Pro 發表,模型更新的節奏已縮短至以天計算。
以目前市場來看,Sol 定價已低於 Opus 5.5,Luna 則低於 DeepSeek V4.1 Flash,直接衝擊開放權重模型的成本優勢。
第三方評測又如何呢 ?
廠商公告的比較對象值得推敲。雙方都未直接比較對手的最新模型,OpenAI 的圖表以 Opus 5 為對照,Anthropic 的表格則以 GPT-5.6 Sol 為對照。在雙方都有揭露的 AutomationBench 上,Opus 5.5 以 40.0% 領先 Sol 的 33.2%。
Artificial Analysis 的獨立評測顯示,Opus 5.5 在 Intelligence Index 拿到 58 分,Sol 為 48 分,Sol 與 Luna 的整體指數與 GPT-5.6 大致持平,部分項目進步、部分退步,Luna 的程式能力較前代略有退步。
幻覺方面,以 AA-Omniscience 指標衡量,Sol 最高強度的幻覺率從 92% 降至 60%,Luna 從 93% 降至 77%。Artificial Analysis 的成本分析則指出,在指數約 44 分以下的需求,Sol 是較便宜的選擇,超過此門檻 Sol 便缺乏上升空間。
對企業的意義
CyberQ 認為,從採購角度看,這三款新模型分別對應三種預算與風險等級,配合 Anthropic 同日的降價,尖端模型的中階市場已進入每百萬 token 輸出 10 至 20 美元的區間,入門級則壓到 1 美元以下。針對企業導入,CyberQ 依據實務部署,有三點建議。
第一,以自身工作負載驗證,不要只看廠商公布的分數。多家第三方分析都指出,模型名稱若不搭配推理強度、工具與退回機制設定,無法反映真實成本。
第二,資安團隊應追蹤 Daybreak 計畫的開放進度,以及 Astra 在企業工作區預設關閉的設定,評估內部啟用流程與監控機制。
第三,快取策略成為成本管理的關鍵。九折的快取讀取優惠加上更高的命中率,對長對話與代理工作流程的帳單影響可能大於模型單價本身。
延伸閱讀:
Introducing GPT-6 Sol and Luna | OpenAI
GPT-6 Astra: A new generation of intelligence | OpenAI
GPT-6 Astra, Sol, and Luna for production AI agents in Microsoft Foundry | Microsoft Azure Blog
GPT-6 Sol vs Opus 5.5: Price and Benchmarks | DEV Community









