CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
聯繫我們
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • 熱門
  • AI 人工智慧
  • 資安
  • Docker
  • 進階應用
  • 網通
  • NAS
  • 開箱測試
  • 教學
  • 展覽直擊
首頁 新聞 AI 人工智慧

Claude Opus 5.5 API 實測:快三成也省四成,但小心 Max 成本暴增二十倍!

BabyQ by BabyQ
2026 年 09 月 23 日 08:16
in AI 人工智慧, 新聞
閱讀時間: 4 分鐘
A A
Claude Opus 5.5 API 實測:快三成也省四成,但小心 Max 成本暴增二十倍!
125
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

Claude Opus 5.5 發布隔天,CyberQ 以自建腳本 opus55_test.py 直接呼叫 Claude API 實測。環境為 Python SDK anthropic 0.85.0,全部請求皆為非串流,整輪測試共約 70 次請求。

RELATED POSTS

Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成

高通推新款 AI 手機晶片|Snorkel 估值飆三倍|Anthropic Opus 5.5 登場|產業精選 09.23

小米開源 MiMo v2.6 模型,手機大廠搶進 AI 推理戰場

模型規格

Models API 回傳 max_input_tokens 為 1,000,000,max_tokens 為 128,000,與 Opus 5 相同。

破壞性變更驗證

九項全數與官方文件相符。

請求預期實測
thinking: {"type": "disabled"}400400
thinking: disabled 搭配 effort: low400400
thinking: {"type": "enabled", "budget_tokens": 2048}400400
tool_choice: {"type": "any"}400400
tool_choice: {"type": "tool"}400400
computer_20251124 工具400400
thinking: {"type": "adaptive"}成功成功
tool_choice: {"type": "auto"}成功成功
computer_toolset_20260801成功成功

值得注意的是,Opus 5 允許在 high 以下關閉 thinking,Opus 5.5 則連 effort: low 搭配 disabled 也一律拒絕。既有程式若沿用「低 effort 加關 thinking」的省錢組合,升級後會直接失敗,必須改成只設 effort。

Effort 掃描

三題各跑五個 effort 等級,數字為輸出 token、延遲與估算費用。

effort程式除錯資安短答 (限 200 字)結構化擷取
low958 / 11.7 秒 / $0.020425 / 6.2 秒 / $0.009247 / 4.4 秒 / $0.005
medium1,187 / 13.0 秒 / $0.024756 / 8.4 秒 / $0.015379 / 5.5 秒 / $0.008
high1,836 / 16.9 秒 / $0.0371,089 / 12.3 秒 / $0.022371 / 5.3 秒 / $0.008
xhigh1,972 / 18.3 秒 / $0.0401,756 / 18.0 秒 / $0.035435 / 6.3 秒 / $0.009
max9,624 / 81.1 秒 / $0.19315,855 / 134.5 秒 / $0.3171,679 / 17.0 秒 / $0.034

low 到 xhigh 的成本大致呈平緩上升,max 則是斷崖。資安短答在 max 下第一次以 16,000 的 max_tokens 執行時直接被截斷,放寬到 20,000 重跑才完成,最後交出的答案只有 216 個字,卻用了 15,855 個輸出 token,幾乎全是看不見的思考。官方文件提醒 max 要在 max_tokens 預留空間,實測證實這不是客套話。對於短答類的工作,max 的成本約是 medium 的 20 倍,換不到可見的差異。

CyberQ 實測發現,max 下的 token/s 反而更高 (9,624 ÷ 81.1 = 119,15,855 ÷ 134.5 = 118),因為思考 token 串流速度快於可見輸出。這解釋了為何 max 延遲增加的倍數小於 token 增加的倍數。

五個等級的程式除錯答案都正確指出 bug (比方說日期與時間比較時,最後一天只涵蓋到零點)。這是以關鍵字核對,並非盲評。

預設 effort 是否為 medium

同一題分別以「不指定 effort」與「指定 medium」各跑三次。

設定輸出 token平均平均延遲
不指定1,398、1,565、1,1321,36513.2 秒
medium1,558、1,535、1,3791,49114.4 秒

兩組分布重疊,且都明顯低於同題 high 的 1,836 token,與「預設為 medium」一致。回應中沒有回報實際使用的 effort,三次樣本只能說明兩者分不出差異。對既有 Opus 5 程式的意義是,不指定 effort 就等於從 high 降到 medium,要維持原本深度必須明寫 effort: "high"。

與 Opus 5 對照

同樣三題,Opus 5.5 使用預設 (medium),Opus 5 使用預設 (high)。

題目Opus 5.5Opus 5費用差
程式除錯1,187 token / 13.0 秒 / $0.0241,660 token / 24.2 秒 / $0.042低 42%
資安短答756 token / 8.4 秒 / $0.015855 token / 17.5 秒 / $0.022低 29%
結構化擷取379 token / 5.5 秒 / $0.008523 token / 7.2 秒 / $0.014低 41%

把 Opus 5 也設成 medium,三題的輸出 token 為 1,648、805、348,費用與延遲幾乎不變,可見 Opus 5 在這類短題上 high 與 medium 差別不大。在「各自預設」的比法下,實測省下 29% 到 42%,與官方「接近四成」的說法吻合。輸出速度方面,程式除錯與資安短答兩題,Opus 5.5 為每秒 91 與 90 token,Opus 5 為 69 與 49 token,快 30% 以上的說法在這兩題成立。但結構化擷取這種不到 400 token 的短回應,Opus 5.5 為 68 token,Opus 5 為 72 token,兩者相當,固定開銷在短回應中佔比較高。兩者的程式除錯答案都正確。

資安任務分流

CyberQ 以四題 MSP 與資安團隊日常會問的防禦型題目測試,分別是修補 SQL injection、說明 Log4Shell 成因與修補、撰寫偵測 certutil 下載行為的 Sigma 規則,以及設計 AI agent 稽核日誌。四題全部正常完成 (stop_reason: end_turn),沒有觸發 refusal,也沒有 stop_details。

這表示日常的弱點修補與偵測規則撰寫,在這個樣本中沒有被誤判分流。不過四題只能說明「常見防禦題不會被擋」,無法畫出分流邊界的位置。另一個觀察是,這四題在預設 effort 下的輸出達 1,892 到 6,643 token,Log4Shell 一題花費 $0.13,資安解說類題目的篇幅明顯比一般題長。

另外,CyberQ 觀察到,官方稱日常 SDLC 的除錯修補不受影響。但 claude-code 專案 issue #93821 回報 Fable 5.1 在處理使用者自己的 release engineering 工作 (剝除 debug 符號、混淆識別字、Terser 壓縮) 時被誤判分流至 Opus 4.8,且一旦觸發整個 session 都無法切回,這點要留意。

工具呼叫之間的文字

以一個四個檔案的假專案跑工具迴圈,比較預設顯示與 display: "updates",並用兩種提示詞。

要求「每次呼叫工具前用一句話說明」時,兩種顯示設定下,中途說明都以一般 text block 回傳,每則 23 到 58 字。

不要求說明、只給稽核任務時,模型在工具呼叫之間完全不輸出文字,直接連續呼叫工具,最後一次給出完整報告。

四組都有出現 thinking block,但內容皆為空字串,updates 模式下也沒有拿到進度摘要。

官方文件說明模型可略過進度更新,這次任務太短,可能正是被略過的情況。能確認的是,自建介面若只渲染 text block,在不要求說明的情況下,工具呼叫期間本來就會是一片沉默。若需要進度訊息,在提示詞中明確要求逐步說明是目前實測有效的做法。

Fast mode

這次未能測試測試到,三次 fast 請求皆回傳 429,可能是因為 fast mode 仍屬研究預覽,需另外開通額度,一般 API 帳戶預設無法使用。

測試限制說明

每個條件多半只跑一次,預設 effort 驗證為三次,數字只能呈現趨勢,不具統計顯著性。答案品質僅以關鍵字核對是否抓到重點,未做盲評。費用為依牌價估算,未計入 429 等失敗請求。

CyberQ 觀點

整體而言,Claude Opus 5.5 在預設設定下確實兌現了官方承諾,輸出速度加快三成、花費降低近四成,且常見的資安防禦任務全數順利過關未遭誤擋。然而這份成本紅利很大一部分來自預設 effort 從 high 降至 medium,若既有系統需要維持過往的推論深度,實際的費用差距並不如表面顯著。

若把 Opus 5.5 設回 high 與 Opus 5 high 比較,程式除錯 $0.037 對 $0.042 省 12%,資安短答 $0.022 對 $0.022 持平,結構化擷取 $0.008 對 $0.014 省 43%,這其實是更有力的論證囉。

更關鍵的升級考驗在於相容性與推論控制,包含 thinking 參數不再允許關閉、既有的省錢組合直接報錯,以及 max 等級可能暴增二十倍隱形思考 token 的成本斷崖。對於準備採用的團隊而言,Opus 5.5 的綜合表現與性價比相當出色,但切忌直接無痛換版,上線前務必重構請求參數並依工作型態重新校準 effort 等級,才不會在省下牌價的同時踩進非預期的開銷地雷。

延伸閱讀

Claude Platform Docs, Refusals and fallback. https://platform.claude.com/docs/en/build-with-claude/refusals-and-fallback

Claude Platform Docs, Preserved thinking. https://platform.claude.com/docs/en/build-with-claude/preserved-thinking

Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成
標籤: AnthropicOpusOpus 5.5
Share2Tweet1ShareShareShare
上一篇

Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成

BabyQ

BabyQ

IT 工程師,專長是資訊系統管理、企業 AI Infra、雲端服務,協助客戶解決問題。 Switch 轉 Steam 新手用戶,夢想是看極光、大堡礁、冰山、熔岩等地球美景。

相關文章

Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成
AI 人工智慧

Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成

2026 年 9 月 23 日
新聞

高通推新款 AI 手機晶片|Snorkel 估值飆三倍|Anthropic Opus 5.5 登場|產業精選 09.23

2026 年 9 月 23 日
小米開源 MiMo v2.6 模型,手機大廠搶進 AI 推理戰場
AI 人工智慧

小米開源 MiMo v2.6 模型,手機大廠搶進 AI 推理戰場

2026 年 9 月 22 日
OpenAI 數學突破引監管焦慮|Meta Muse 美加下載量超越 ChatGPT|產業精選 09.22
新聞

OpenAI 數學突破引監管焦慮|Meta Muse 美加下載量超越 ChatGPT|產業精選 09.22

2026 年 9 月 22 日
xAI 推出 Grok 4.7|Anthropic 揭露 Claude 已主導 26% 內部研發|AI 趨勢精選 09.22
AI 人工智慧

xAI 推出 Grok 4.7|Anthropic 揭露 Claude 已主導 26% 內部研發|AI 趨勢精選 09.22

2026 年 9 月 22 日
AI 巨頭放緩喊假的?|世界模型黑箱?|Qwen 開源新局|產業精選 09.21
新聞

AI 巨頭放緩喊假的?|世界模型黑箱?|Qwen 開源新局|產業精選 09.21

2026 年 9 月 21 日

推薦閱讀

Claude Opus 5.5 API 實測:快三成也省四成,但小心 Max 成本暴增二十倍!

Claude Opus 5.5 API 實測:快三成也省四成,但小心 Max 成本暴增二十倍!

2026 年 9 月 23 日
Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成

Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成

2026 年 9 月 23 日

高通推新款 AI 手機晶片|Snorkel 估值飆三倍|Anthropic Opus 5.5 登場|產業精選 09.23

2026 年 9 月 23 日
小米開源 MiMo v2.6 模型,手機大廠搶進 AI 推理戰場

小米開源 MiMo v2.6 模型,手機大廠搶進 AI 推理戰場

2026 年 9 月 22 日
OpenAI 數學突破引監管焦慮|Meta Muse 美加下載量超越 ChatGPT|產業精選 09.22

OpenAI 數學突破引監管焦慮|Meta Muse 美加下載量超越 ChatGPT|產業精選 09.22

2026 年 9 月 22 日

近期熱門

  • ChatGPT 共同發明人推出 Jev 模型,每秒 10 次決策即時玩 Doom,每小時成本約 7 美元

    ChatGPT 共同發明人推出 Jev 模型,每秒 10 次決策即時玩 Doom,每小時成本約 7 美元

    222 shares
    Share 89 Tweet 56
  • 能自動分類就不要依賴生成,參考 JEV 概念實作本機小模型當決策判斷引擎

    212 shares
    Share 85 Tweet 53
  • AI什麼都能問,人類還需要背東西嗎?研究揭記憶仍是批判思考基礎

    247 shares
    Share 99 Tweet 62
  • 揭開 Hacker News 排名演算法:評分、爭議與懲罰機制解析

    179 shares
    Share 72 Tweet 45
  • GitHub 趨勢周報 Vol.33,代理基礎設施補上稽核與去敏感資料,瀏覽器代理改走結構化狀態路線

    170 shares
    Share 68 Tweet 43
  • Claude Code 開始讀取 AGENTS.md:跨工具協作時代來臨

    161 shares
    Share 64 Tweet 40
  • Qwen-Image-2.1 開放權重下載,7B 單一模型整合生圖與編輯,授權改採研究授權

    159 shares
    Share 64 Tweet 40
  • 用 40 億參數小模型改寫查詢計畫,速度比 Postgres 快上 81%

    153 shares
    Share 61 Tweet 38
  • 小米開源 MiMo v2.6 模型,手機大廠搶進 AI 推理戰場

    149 shares
    Share 60 Tweet 37
  • OpenAI 數學突破引監管焦慮|Meta Muse 美加下載量超越 ChatGPT|產業精選 09.22

    143 shares
    Share 57 Tweet 36

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。