Anthropic 於 2026 年 7 月 24 日正式推出 Claude Opus 5。作為第五代 Claude 架構的最新成員,Opus 5 的核心訴求非常明確,該公司的策略設計是,以一半的 API 價格,提供逼近頂級模型 Claude Fable 5 的智慧能力。
不過,要理解它的定位,需先認識 Anthropic 目前的產品階層分類,一共有 Haiku(輕量)、Sonnet(中階)、Opus(主力工作機),以及位居其上的 Mythos 級(面向大眾的 Fable 5 與僅限美國官方與 Anthropic 核准組織使用的 Mythos 5)。Opus 5 並非取代旗艦,而是成為日常生產環境的全新主力,它是 Claude Max 的預設模型,也是 Claude Pro 方案中可用的最強模型。要使用到 Claude Max 方案才能夠使用 Fable 5。
根據 Anthropic 官方新聞稿與 Claude 官方技術文件的說明,Opus 5 在多項基準測試中刷出歷史新高的成績。以下是 CyberQ 透過測試資料分析與實測,解析這款模型帶來的技術革新。
基準測試大躍進:以半價達到頂級模型性能
在評價自主程式碼開發能力的 Frontier-Bench v0.1 測試中,Opus 5 取得 43.3% 的解題成功率,不僅是前代 Opus 4.8(21.1%)的兩倍以上,甚至超越了 Anthropic 的頂級旗艦 Fable 5(33.7%)以及競品 GPT-5.6 Sol(34.4%)。這意味著在複雜的自主工程任務中,Opus 5 具備極強的長任務執行能力。

在測驗全新推理與反記憶化能力的 ARC-AGI-3 測試中,Opus 5 更繳出 30.2% 的驚人成績。這項由 ARC Prize 基金會於 2026 年 3 月推出的基準,會將模型投入沒有任何說明與目標的互動式解謎環境,迫使其透過試誤自行推導規則。
CyberQ 觀察,該基準發表當時呢,所有先進模型的得分均不到 1%。對比 GPT-5.6 Sol 的 7.8% 與前代 Opus 4.8 的 1.5%,Opus 5 展現約四倍於次佳模型的推理領先幅度(惟需留意 Fable 5 並未參與此項測試)。此外,Anthropic 也讓 Opus 5 在無工具輔助下挑戰 IMO 2026 全部六道題目,取得達到金牌水準的滿分成績。
在衡量實際經濟價值與知識工作表現的 GDPval-AA v2 人工評測中,Opus 5 以 1,861 的 Elo 積分名列榜首,領先 Fable 5(1,747)與 GPT-5.6 Sol(1,736)。API 輸入價格維持每百萬 Token 5 美元、輸出每百萬 Token 25 美元,與前代 Opus 4.8 完全相同,也就是加量不加價,約為頂級模型成本的一半。
值得肯定的是,Anthropic 並未只挑對自己有利的資料,CyberQ 觀察在 DeepSWE v1.1 代理式編程測試中,GPT-5.6 Sol 以 72.7% 領先 Opus 5 的 68.8%。健康類與法律類基準則分別由 Fable 5 與 Mythos 5 勝出。這些落敗項目同樣被公開揭露,反而提高了整體測試成績的可信度。
實測結果亦佳:具備主動驗證與自主構建工具的能力
在實際測試中,Opus 5 令工程師驚艷的是其判斷力與自主驗證機制並不會輸 Fable 5 太多。
CyberQ 在前端開發測試 Opus 5 ,它展現出類似資深開發者的審慎態度,會在生成介面後自動啟動瀏覽器,模擬桌面與手機等不同螢幕寬度,檢查是否有按鈕遮擋或邊界排版錯誤,並在提交成果前自主修正問題。另外,針對開放原始碼套件管理工具的除錯測試中,某些模型只修正了表面症狀便回報完成,而 Opus 5 則精準定位出深層根因,並解決了連社群修補檔都遺漏的邊界條件。
另外,一家交易公司的工程師分享,在嘗試建置新交易所的即時資料串流時,由於缺乏現成的驗證環境,Opus 5 自動寫出了一套測試架構(Test Harness)來自我校驗解析邏輯是否正確,這是先前的模型即使獲得詳盡規劃也無法完成的任務。
如果是刻意不提供視覺輸入的 3D FreeCAD 重建任務,Opus 5 甚至主動撰寫出專屬的電腦視覺處理流程,直接從原始像素中擷取幾何特徵並完成重建,且能重複成功。相同條件下,沒有任何競爭模型能在五次嘗試內解出,確實展現高度的自主解決問題能力(Agentic Behavior)。
API 機制最佳化思考模式預設開啟,以及努力程度調節
從架構層面來看,Claude Opus 5 的官方技術文件可以看出不少改進。
思考模式(Thinking)預設開啟:模型會根據任務複雜度自行決定是否思考及思考深度。需注意的是,在 xhigh 或 max 等級下嘗試關閉思考將回傳 400 錯誤,思考僅能在 high 以下等級停用。
Effort 參數五段調節:支援 low、medium、high、xhigh、max 五個等級,讓開發者靈活控制計算深度。官方建議編程與代理任務以 xhigh 為起點,low 與 medium 在 Opus 5 上的表現已優於前代模型的同等級設定,適合作為成本與延遲的主要調控手段。
脈絡視窗與輸出上限:脈絡視窗為 100 萬 Token,同步 Messages API 輸出上限達 128K Token。
快取門檻降低:Prompt Caching 最低門檻由 1,024 降至 512 Token,大幅減少短提示情境的重複成本,且無需修改程式碼即可生效。
對話中途動態更換工具(Beta):開發者可在對話進行中變更 Claude 可用的工具,而不會使提示快取失效。
加速模式(Fast Mode,研究預覽):以約 2.5 倍的速度執行,價格為基本費率的兩倍(輸入 $10/輸出 $25×2=$50 每百萬 Token),目前僅在 Claude API 上提供。
另外,CyberQ 有一項提示詞工程上的重要提醒,由於 Opus 5 本身已具備極強的自我校驗能力,官方這次已經明確建議移除過去習慣加入的「請進行最終驗證」等指令,避免造成模型過度驗證而增加不必要的 Token 消耗。
資安與合規角度:防禦性弱點偵測開放,攻擊面向仍受管制

身為資訊安全從業者,特別值得留意 Anthropic 在 Opus 5 安全政策上的調整。與前代相同,Anthropic 刻意未以資安任務訓練 Opus 5,但隨著整體能力提升,其在發現漏洞方面已逼近 Mythos 5 的水準。不過在利用漏洞(將弱點轉化為實際攻擊)方面仍大幅落後,這也符合官方不在高風險雙重用途能力上推進的定位。
在安全防護(Safeguards)設計上,Opus 5 的資安分類器允許原始碼層級的安全弱點偵測(Source-code Vulnerability Discovery),讓企業安全團隊能運用其靜態程式碼分析能力進行防禦性稽核,但同時呢,它也封鎖了三類高風險行為,包括二進位檔弱點掃描、滲透測試,以及漏洞利用程式生成。
與 Fable 5 相比,Opus 5 的分類器攔截頻率預期降低約 85%,可顯著減少合法安全檢視工作遭到無效拒絕的困擾。在 Claude.ai、Claude Code 與 Claude Cowork 中,被分類器攔截的請求預設會自動退回 Opus 4.8 處理,已加入 Cyber Verification Program(CVP)的企業與研究人員,則可立即使用限制較少的 Opus 5 版本。
對齊表現方面,在部署前的自動行為審計中,Opus 5 的整體非對齊行為得分降至 2.3,為 Anthropic 近期模型中的最低水平,其欺瞞行為發生率與被誘導濫用的敏感度也同為最低,展現出更成熟的對齊設計(Alignment)。
比 Fable 5 省錢又堪用可做事
Claude Opus 5 的將高階推理能力轉化為可日常執行的工程工具。對建構複雜 Agent 系統的開發者而言,它以半價提供了逼近 Fable 5 的智慧能力與更強的自主驗證行為。
對重視資安效益比的企業而言,更寬鬆的防禦性稽核空間與大幅降低的誤攔率,也讓合規與安全工作更有效率。在成本意識日益抬頭的企業 AI 市場中,Opus 5 很可能成為未來一段時間的預設選擇。
參考資料
- Introducing Claude Opus 5 — Anthropic
- What’s new in Claude Opus 5 — Claude Platform Docs
- Prompting Claude Opus 5 — Claude Platform Docs
- Claude Opus 5 System Card — Anthropic








