Anthropic 於美國時間 2026 年 9 月 22 日正式發布 Claude Opus 5.5,為 Claude 5.5 系列的首款模型。官方將其定位為「在多數工作上達到 Claude Fable 5.1 的水準,執行成本較 Opus 5 低 40%」,並宣布 Sonnet 5.5 與 Haiku 5.5 將於未來數週陸續推出。
CyberQ 觀察,這是 Anthropic 執行長 Dario Amodei 上週提出「AI 進展應有節奏 (pacing the frontier)」主張後的第一款模型,發布前由 Frontier Design 與 METR 兩家外部機構進行評估。
定價與成本
Opus 5.5 的 API 定價全面下修,每百萬 token 費用如下 (美元)。
| 項目 | Opus 5.5 | Opus 5 | 降幅 |
|---|---|---|---|
| 輸入 | $4 | $5 | 20% |
| 輸出 | $20 | $25 | 20% |
| 快取讀取 | $0.20 | $0.50 | 60% |
| 快取寫入 (5 分鐘) | $5 | $6.25 | 20% |
官方說明實際節省幅度接近 40%,原因在於 Opus 5.5 完成相同任務所需的 token 數更少,且快取讀取在 agent 與程式開發工作中佔費用大宗。輸出速度亦較 Opus 5 快 30% 以上。
另提供 Fast mode (研究預覽),速度最高 2.5 倍,定價為輸入 $8、輸出 $40,僅限 Claude API 使用,Bedrock、Google Cloud 與 Microsoft Foundry 暫不支援。批次處理 (Batch) 為半價,輸入 $2、輸出 $10。
訂閱端同步調整,Pro、Max 與 Team 方案的五小時用量上限提高,並新增可自行保存與擇時使用的用量重置 (rate limit reset)。
基準測試
官方公布的主要資料如下,Opus 5.5 除特別註記外均使用 adaptive thinking 於 max effort 執行。
| 測試 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | 未公布 |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
| Humanity’s Last Exam (含工具) | 67.7% | 65.6% | 63.6% | 57.2% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| OSWorld 2.0 (partial) | 81.8% | 80.7% | 74.0% | 未公布 |
第一,Anthropic 自己在公告中承認,到了這個能力層級,「benchmark 的差距已不太能反映實際使用上的差異」,並直言在內部使用經驗中,Opus 5.5 與 Fable 5.1 的差距比分數顯示的更小。
第二,Opus 5.5 是在啟用正式版安全防護的狀態下測試。當防護機制介入時,資安任務改由 Opus 4.8 完成,生物與尖端 LLM 開發任務改由 Opus 5 完成,官方表示這可能拉低了 Opus 5.5 在這些項目的分數。
第三,AutomationBench 由 Zapier 執行,且未設定備援模型,防護介入即計為失敗。GPT 系列的資料對比則引用 OpenAI 自行公布的結果。
程式開發
官方以幾個案例說明效率提升。一位早期測試者用 Opus 5.5 在三小時內完成 20 萬行程式碼的稽核與修復,Opus 5 完成同樣工作花費逾 20 小時、token 用量為 2.5 倍。Anthropic 內部將 HAProxy 從 C 改寫為 Rust 的測試中,Opus 5.5 耗時 9.5 小時、Fable 5.1 為 12 小時,前者成本低 51%,兩者皆通過幾乎全部的 HAProxy 迴歸測試。
在成本效益上,官方強調 Opus 5.5 在預設 effort (medium) 下於 FrontierCode 的得分 (54.6%) 已超越 GPT-6 Astra 的最高分,每項任務成本約為後者的五分之一。
早期測試者的回饋集中在 token 與步驟數的減少。GitHub 表示在 VS Code 中以不到一半的步驟解決比 Opus 5 更多的終端機任務。Optiver 指出 Opus 5.5 以約一半的回合數、時間與輸出 token 達到 Opus 5 的品質,該類工作負載成本降低 40% 至 50%。Stripe 工程師則描述以單一 Opus 5.5 session 指揮十餘個 session 完成 40 個堆疊 PR 的多日 rebase。
知識工作
在一項內部測試中,三款模型被要求在刻意將財報藏起來的網路副本上撰寫公司季度報告,由自動評分器逐一核對數字與引述。Opus 5.5 在 18 次嘗試中有 16 次通過品質門檻,Fable 5.1 與 Opus 5 則全數未通過。
Walleye Capital 的評估中,Opus 5.5 在較高 effort 設定下察覺該公司評測指令中的分鐘索引有偏移一位的錯誤,並主動修正,官方稱此前沒有任何模型做到。Deloitte 表示 Opus 5.5 在最低 effort 下即抓出 72% 的已知程式錯誤,Opus 5 在高 effort 下為 56%。
寫作與溝通
這是 Anthropic 針對 Opus 5 最常收到的抱怨所做的改善。官方描述 Opus 5.5 會將最重要的資訊放在最前面,較少使用術語或特殊句式,並且會遵守使用者給定的寫作規則。Box 表示其回答較 Opus 5 少 40% 的冗詞而準確度不減,token 用量為三分之一。
安全與防護機制
Opus 5.5 在 Anthropic 近 2,000 個情境的自動化行為稽核中,於幾乎所有失準行為指標上取得歷來最佳成績。在一項新設計的圍阻邊界測試中,Opus 5.5 嘗試突破邊界的次數較 Opus 5 或 Mythos 5.1 少約 85%,且所有嘗試皆為低嚴重度並自行回報。
官方同時坦承兩項限制。一是在部署前建立能可靠抓出所有失誤的評估仍是未解問題。二是 Opus 5.5 經常懷疑自己正在接受評估,這會影響評估結果對真實部署環境的推論效力。
對資安從業者而言,最需要留意的是防護分流機制。由於 Opus 5.5 在資安與生物領域的能力與 Mythos 5.1 相當,Anthropic 對其套用與 Fable 5.1 同級的防護。使用者仍可在一般開發流程中找出並修復程式錯誤,但多數資安任務會被透明地改由 Opus 4.8 處理。Anthropic 表示未來數週將擴大 Cyber Verification Program 納入 Opus 5.5,並規劃三個層級的信任存取,最高層級可使用 Mythos 模型。
在 API 層面,被拒絕的請求會回傳 HTTP 200 並帶有 stop_reason: "refusal" 與 stop_details 物件標示政策領域。除既有的資安分類器外,Opus 5.5 新增生物安全分類器,以及針對誘導模型在回應中重現內部推理的 reasoning_extraction 類別。
Opus 5.5 亦延續 Fable 5.1 引入的 preserved thinking 反蒸餾機制,2026 年 8 月 31 日後建立的 API 帳戶會預設啟用。此機制會檢查 thinking block 之前的 system prompt、tools 或訊息是否曾被修改,若有變動則回傳 400 錯誤。Anthropic 在同日發布的 2026 年 9 月威脅情報報告中揭露了偵測到的非法蒸餾活動。
開發者遷移注意事項
官方文件列出四項會影響既有 Opus 5 程式碼的破壞性變更。
thinking 無法關閉。傳入 thinking: {"type": "disabled"} 或手動 budget_tokens 皆回傳 400。改以 output_config.effort 控制深度,預設值為 medium (Opus 5 為 high)。
不支援強制工具呼叫。tool_choice 的 any 與 tool 類型回傳 400,需改用 auto 搭配 strict tool use 或 structured outputs。
thinking block 綁定模型與對話。Opus 5.5 可讀取 Opus 5 及更早的 Opus、Sonnet、Haiku 的 thinking block,但無法讀取 Fable 或 Mythos 的。
Claude API 與 Google Cloud 上不再接受舊版 computer_20251124 工具,需改用 computer_toolset_20260801。Bedrock 不受影響。
另有一項不會報錯但會改變回應形狀的變化。工具呼叫之間的文字改以 thinking block 回傳,在預設 display: "omitted" 下內容為空,若應用程式將這些文字串流給使用者作為進度更新,會在工具呼叫之間陷入沉默。
文件同時提醒,相同 effort 設定下 Opus 5.5 每回合思考量較 Opus 5 多,尤其在 xhigh 與 max,建議重新掃描 effort 設定並在 max_tokens 預留空間。
可用性
Opus 5.5 已在 Claude API (模型 ID claude-opus-5-5)、Amazon Bedrock (anthropic.claude-opus-5-5)、Google Cloud 與 Microsoft Foundry 上線,並支援零資料保留 (zero data retention) 與符合歐盟 AI 法案的文字浮水印。官方公告未直接列出上下文視窗與最大輸出 token 數,CyberQ 以 Models API 實查,上下文視窗為 1,000,000 token,最大輸出為 128,000 token。
CyberQ 觀點
從公告內容看,Opus 5.5 的核心訴求並非能力上限的突破,而是「以更少的 token 與更低的單價達到 Fable 5.1 等級的產出」。對於以 API 計費運行 agent 工作流的團隊而言,快取讀取降價 60% 加上 token 效率提升,帶來的實際節省可能大於單價降幅。
但有三點需要實測驗證。其一,資安任務分流至 Opus 4.8 的邊界在哪裡。日常的程式碼審查與弱點修補是否會被誤判,對 MSP 與資安團隊的影響最直接。其二,預設 effort 從 high 改為 medium,既有 prompt 在新預設下的品質是否一致。其三,工具呼叫間文字改入 thinking block,對自建 agent 介面的影響程度。
CyberQ 將以自建腳本進行 effort 掃描、Opus 5 對照與破壞性變更驗證,以下是實測結果。
延伸閱讀
Anthropic, Introducing Claude Opus 5.5, 2026-09-22. https://www.anthropic.com/claude-opus-5-5
Claude Platform Docs, What’s new in Claude Opus 5.5. https://platform.claude.com/docs/en/models/opus-5-5/whats-new-opus-5-5







