CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題
聯繫我們
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
  • 資安
  • NAS 與儲存
  • 網通
  • 虛擬化與容器
  • 開發與 DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
首頁 AI

Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%

Dr. Q by Dr. Q
2026 年 10 月 08 日 12:48
in AI
閱讀時間: 5 分鐘
A A
Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%
471
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

Anthropic 於 10 月 7 日發布 Claude Haiku 5.5,本站已整理官方公布的價格與基準測試。這些數字都由原廠自行公布,因此 CyberQ 實際用 Claude API 跑了一輪測試,核對其中可以直接驗證的部分,模型規格、新 tokenizer、推理強度(effort)、速度與費用、資安防護邊界,並從 Humanity’s Last Exam(HLE)抽出 100 題,嘗試重現官方的 45.9%。

RELATED POSTS

OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程

Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

Anthropic Mythos 揪出 HFS 密碼學漏洞 24 小時內遭武器化|Meta Muse Spark 共同署名六篇數學論文|AI 趨勢精選 10.05

測試結論

Haiku 5.5 預設會先思考。官方介紹沒有強調這一點,但它是影響延遲與費用最大的因素。關閉思考後,輸出速度是 Haiku 4.5 的 1.5 到 2.2 倍,費用約為十分之一,維持預設時,短問答反而比 4.5 慢。

價格降幅屬實,但要看語言與設定。新 tokenizer 對繁體中文幾乎沒有影響,英文則多出約三成五的 token。

HLE 抽樣未能重現 45.9%。low 檔 34%、max 檔 32%,max 檔有三分之一的題目想到輸出上限仍未作答。排除這些題目後為 47.8%,與官方數字相近。

effort 開到最高不一定比較好。在我們的測試中,max 檔的費用是 low 的 21 倍,正確率沒有提升。

測試方式

測試於 2026 年 10 月 8 日在台灣透過 Claude API 進行,使用 Anthropic Python SDK 0.85.0,對照組為 Claude Haiku 4.5。速度測試以串流方式呼叫,每題重複兩次取中位數。費用依官方價目表,以回應中的 token 數估算。

規格:100 萬 token 上下文,而且預設會思考

官方公告沒有寫上下文長度與最大輸出,透過 API 的模型資訊可以查到:

項目Haiku 5.5Haiku 4.5
上下文長度1,000,000 token200,000 token
最大輸出128,000 token64,000 token
effortlow、medium、high、xhigh、max 五檔不支援
思考模式adaptive(預設開啟)、disabledenabled(指定預算)、disabled
上下文壓縮(compaction)支援不支援

Haiku 5.5 不再接受舊式「指定思考預算」的寫法,改為由模型自行決定思考長度(adaptive thinking),而且不帶任何參數時就會開啟。思考內容預設不會串流出來,所以使用者看到的「第一個字」,其實要等整段思考結束才會出現。

新 tokenizer:中文幾乎不變,英文多 35%

官方表示新 tokenizer 會讓同樣的工作「略增」token。用同一段文字分別讓兩個模型計算 token 數:

樣本Haiku 4.5Haiku 5.5增幅
繁體中文段落153155+1.3%
Python 程式碼126141+11.9%
英文段落87118+35.6%

對以繁體中文為主的應用來說,價目表上的降幅幾乎可以直接採用,以英文為主的工作負載,實際降幅會少一截。

速度與費用:關掉思考才會變快

CyberQ 準備了三種常見任務:程式除錯、200 字以內的資安摘要,以及從新聞稿擷取 JSON。先看 Haiku 5.5 關閉思考(thinking: disabled)時與 4.5 的對照:

任務模型首字時間總延遲輸出速度單次費用(美元)
程式除錯Haiku 4.50.54 秒7.35 秒111 tok/s0.00420
Haiku 5.50.55 秒3.78 秒185 tok/s0.00036
資安摘要Haiku 4.50.51 秒4.37 秒83 tok/s0.00185
Haiku 5.50.60 秒2.54 秒145 tok/s0.00019
JSON 擷取Haiku 4.50.50 秒1.02 秒79 tok/s0.00051
Haiku 5.50.57 秒0.85 秒116 tok/s0.00006

關閉思考時,首字時間與 4.5 相同,輸出速度快 1.5 到 2.2 倍,三題合計費用為 4.5 的 9.5%,與官方「10 萬 token 以下便宜 90%」一致。

維持預設(開啟思考)時,情況就不同了:

任務首字時間總延遲輸出 token對照 4.5 的總延遲
程式除錯2.72 秒6.91 秒1,4787.35 秒
資安摘要9.57 秒10.35 秒2,2504.37 秒
JSON 擷取2.04 秒2.32 秒4421.02 秒

一則 200 字的摘要,模型會先思考約 2,000 token,總延遲是 4.5 的 2.4 倍。三題合計費用為 4.5 的 32.7%,仍然便宜,但降幅從九成縮小到約三分之二。要拿 Haiku 5.5 做客服、分類這類講求即時的工作,務必明確關閉思考,或將 effort 設為 low。

答案品質方面,三題兩個模型都答對。Haiku 4.5 有一次把 CVSS 分數輸出成字串,另有一次說明前後矛盾,Haiku 5.5 沒有出現這類問題。

effort 五檔:簡單題開 max 只是多花錢

同一題程式除錯,在五個 effort 檔位各跑一次:

effort輸出 token總延遲費用(美元)答對
low1,2355.9 秒0.00063是
medium1,3776.5 秒0.00070是
high1,9509.1 秒0.00099是
xhigh3,37915.1 秒0.00170是
max13,24955.7 秒0.00664是

五檔的最終答案長度相近,增加的幾乎都是思考 token。這題 low 就答對了,max 多花 10 倍費用與 9 倍時間,答案沒有更好。

HLE 抽 100 題:max 檔有三成答案會過度思考

HLE 共 2,500 題,我們以固定亂數種子抽出 100 題(含選擇題 22 題、圖片題 12 題,比例與全集相近),使用 HLE 官方的作答格式與評分提示詞,由 Claude Sonnet 5.5 擔任評審(HLE 官方原本使用 o3-mini)。官方沒有公布 45.9% 使用哪一檔 effort,因此我們跑了兩端的 low 與 max,輸出上限設為模型上限 128,000 token。

項目lowmax
正確率34%32%
95% 信賴區間25.5% 到 43.7%23.7% 到 41.7%
想到輸出上限、未作答0 題33 題
平均輸出 token3,46275,552
每題時間平均 16 秒中位數 292 秒
100 題模型費用(美元)0.183.78

max 檔有 33 題思考到 128,000 token 上限仍未停止,沒有產出任何答案,因此一律判定為錯誤。排除這些題目後,其餘 67 題答對 32 題,正確率 47.8%,與官方的 45.9% 相近。

逐題比對,兩檔都答對 18 題,只有 low 答對 16 題,只有 max 答對 14 題。被截斷的 33 題中,low 答對了 12 題,顯示 max 檔有過度思考的情形。

官方未說明 HLE 的 effort、輸出上限,以及是否搭配上下文管理。若官方設定能避開截斷,成績可能接近 47.8% 這個水準,但本次測試無法證實。

即使只看 low 的 34%,也遠高於 Haiku 4.5 官方公布的 10.2%,「大幅超越前代」的方向可以確認。

後續也抽查了評審的判定,44 筆選擇題的判定與直接比對選項字母完全一致,填答題抽查 16 筆,判定皆合理。不過樣本只有 100 題,誤差約正負 9 個百分點,結果只能當作方向參考。

資安防護邊界

官方表示 Haiku 5.5 的資安防護比 4.5 嚴格,但允許的防禦性任務範圍比 Sonnet 5.5 廣。我們測了兩個常見好問題,撰寫偵測 Log4Shell 利用流量的 Suricata 規則,以及用 nmap 盤點自家內網的服務與作業系統。兩個模型都完整作答,沒有拒答。這兩題都屬於防禦性任務,只能確認一般資安維運工作不會被誤擋,無法驗證「比 4.5 嚴格」的部分。

10 萬 token 分級價

Haiku 5.5 以單次請求 10 萬輸入 token 為界,超過時單價提高為五倍。這次測試送出了 95K、105K,以及搭配提示快取的幾種請求。API 回應只標示 token 數與服務等級,沒有標示這筆請求套用哪一級價格,實際計價要從帳單反推。

對照 Console 的用量明細,結果很明確,只要單次請求的總輸入超過 10 萬 token,整筆請求的輸入都按高價計,而且快取讀取與快取寫入的 token 也會算進門檻。例如一筆「6 萬 token 快取讀取加 4.5 萬新輸入」的請求,非快取部分只有 4.5 萬,仍然整筆以高價計費,95K 的請求則維持低價。Console 將這些請求歸在標示為「200k – 1M」的區間,與官方公布的 10 萬門檻標示不一致,但實際計價以 10 萬為界。

給導入者的建議

即時性任務請明確關閉思考,或將 effort 設為 low。不帶參數就會開啟思考,從 Haiku 4.5 直接換模型 ID 的應用,延遲可能不降反升。

以英文為主的工作負載要重估成本,新 tokenizer 會多出約三成五的 token。

長上下文與提示快取要一起算。快取 token 也計入 10 萬門檻,系統提示加對話歷史一旦超過 10 萬,整筆請求的單價就變成五倍。

不要預設使用 max effort。困難題目可能想到 128,000 token 上限都沒有答案,程式應檢查 stop_reason 是否為 max_tokens。

量測速度時要注意思考內容不會串流,以「首字之後的生成速度」計算會得到每秒數千 token 的錯誤數字。比較不同模型時,請關閉思考,或改用「輸出 token 除以總延遲」。

Anthropic 推出 Claude Haiku 5.5,價格降九成並首度支援可調整推理強度
Anthropic擴大網路安全驗證計畫 新增三大存取層級
Anthropic 推出 Claude Sonnet 5.5:新一代中型模型再度拉高性價比天花板
實測 Claude Opus 5.5 API :快三成也省四成,但小心 Max 成本暴增二十倍!
Anthropic 推出 Claude Opus 5.5,效能追平 Fable 5.1,成本較 Opus 5 降低四成
Claude Code 開始讀取 AGENTS.md:跨工具協作時代來臨
AI代理人互動量可能超越人類
Anthropic Mythos 5 虛構身分誘騙人類通過惡意程式碼
Anthropic 砍掉 Claude Code 八成系統提示詞:Claude 5 世代的 Context Engineering 新規則
Anthropic 最新報告指出 Claude 已撰寫逾八成核心程式碼
萬物皆 Token 的代價:從微軟停用 Claude Code 與 Uber 預算超支,看 AI 代理時代的成本悖論
標籤: AnthropicClaudeClaude Haiku 5.5
Share6Tweet4ShareShareShare1
上一篇

NVIDIA 宣布 RTX Spark 平台上市,微軟與各大廠開放預購,台灣售價 12 萬到 27 萬不等

Dr. Q

Dr. Q

相關文章

OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程
AI

OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程

2026 年 10 月 7 日
Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率
AI

Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

2026 年 10 月 6 日
Anthropic Mythos 揪出 HFS 密碼學漏洞 24 小時內遭武器化|Meta Muse Spark 共同署名六篇數學論文|AI 趨勢精選 10.05
AI

Anthropic Mythos 揪出 HFS 密碼學漏洞 24 小時內遭武器化|Meta Muse Spark 共同署名六篇數學論文|AI 趨勢精選 10.05

2026 年 10 月 5 日
DGX Spark 一年漲七成五,NVIDIA 推 4,999 美元 64GB 會好用嗎 ?
AI

DGX Spark 一年漲七成五,NVIDIA 推 4,999 美元 64GB 會好用嗎 ?

2026 年 10 月 5 日
極簡 AI 程式碼代理 Pi 1.0 正式登場,做減法的 harness 為何引發關注?
AI

極簡 AI 程式碼代理 Pi 1.0 正式登場,做減法的 harness 為何引發關注?

2026 年 10 月 2 日
Google 發表 Gemini 4 Argon:新一代多模態模型正式登場,AI 競爭再升溫
AI

Google 發表 Gemini 4 Argon:新一代多模態模型正式登場,AI 競爭再升溫

2026 年 10 月 1 日

推薦閱讀

Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%

Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%

2026 年 10 月 8 日
NVIDIA 宣布 RTX Spark 平台上市,微軟與各大廠開放預購,台灣售價 12 萬到 27 萬不等

NVIDIA 宣布 RTX Spark 平台上市,微軟與各大廠開放預購,台灣售價 12 萬到 27 萬不等

2026 年 10 月 8 日
Anthropic 推出 Claude Haiku 5.5,價格降九成並首度支援可調整推理強度

Anthropic 推出 Claude Haiku 5.5,價格降九成並首度支援可調整推理強度

2026 年 10 月 8 日
Hermes Agent 開發商 Nous Research 達 15 億美元估值,推商用 AI 代理|Mecka AI 獲 Sequoia 投資|產業精選 10.08

Hermes Agent 開發商 Nous Research 達 15 億美元估值,推商用 AI 代理|Mecka AI 獲 Sequoia 投資|產業精選 10.08

2026 年 10 月 8 日
QNAP QSW-M7230P-2X4F24T 100GbE 交換器升級 PoE++ 登場

QNAP QSW-M7230P-2X4F24T 100GbE 交換器升級 PoE++ 登場

2026 年 10 月 8 日

近期熱門

  • 極簡 AI 程式碼代理 Pi 1.0 正式登場,做減法的 harness 為何引發關注?

    極簡 AI 程式碼代理 Pi 1.0 正式登場,做減法的 harness 為何引發關注?

    332 shares
    Share 133 Tweet 83
  • GitHub 趨勢周報 Vol.36,代理工程從加功能轉向省資源,技能包成為開發方法論的載體

    254 shares
    Share 102 Tweet 64
  • Apple 推出 Pass Designer 工具,讓數位票卡設計變得更親民

    250 shares
    Share 100 Tweet 63
  • DGX Spark 一年漲七成五,NVIDIA 推 4,999 美元 64GB 會好用嗎 ?

    210 shares
    Share 84 Tweet 53
  • Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

    191 shares
    Share 76 Tweet 48
  • OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程

    178 shares
    Share 71 Tweet 45
  • SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS

    128 shares
    Share 51 Tweet 32
  • macOS 27 關掉 Apple Intelligence,把被吃掉的硬碟空間要回來

    122 shares
    Share 49 Tweet 31
  • Google 凍結開源漏洞獎勵計畫,AI 投稿暴增壓垮審核機制|川普推「超級智慧部隊」重塑 AI 安全敘事|產業精選 10.05

    111 shares
    Share 44 Tweet 28
  • Anthropic Mythos 揪出 HFS 密碼學漏洞 24 小時內遭武器化|Meta Muse Spark 共同署名六篇數學論文|AI 趨勢精選 10.05

    102 shares
    Share 41 Tweet 26

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。