Anthropic 於 10 月 7 日發布 Claude Haiku 5.5,本站已整理官方公布的價格與基準測試。這些數字都由原廠自行公布,因此 CyberQ 實際用 Claude API 跑了一輪測試,核對其中可以直接驗證的部分,模型規格、新 tokenizer、推理強度(effort)、速度與費用、資安防護邊界,並從 Humanity’s Last Exam(HLE)抽出 100 題,嘗試重現官方的 45.9%。
測試結論
Haiku 5.5 預設會先思考。官方介紹沒有強調這一點,但它是影響延遲與費用最大的因素。關閉思考後,輸出速度是 Haiku 4.5 的 1.5 到 2.2 倍,費用約為十分之一,維持預設時,短問答反而比 4.5 慢。
價格降幅屬實,但要看語言與設定。新 tokenizer 對繁體中文幾乎沒有影響,英文則多出約三成五的 token。
HLE 抽樣未能重現 45.9%。low 檔 34%、max 檔 32%,max 檔有三分之一的題目想到輸出上限仍未作答。排除這些題目後為 47.8%,與官方數字相近。
effort 開到最高不一定比較好。在我們的測試中,max 檔的費用是 low 的 21 倍,正確率沒有提升。
測試方式
測試於 2026 年 10 月 8 日在台灣透過 Claude API 進行,使用 Anthropic Python SDK 0.85.0,對照組為 Claude Haiku 4.5。速度測試以串流方式呼叫,每題重複兩次取中位數。費用依官方價目表,以回應中的 token 數估算。
規格:100 萬 token 上下文,而且預設會思考
官方公告沒有寫上下文長度與最大輸出,透過 API 的模型資訊可以查到:
| 項目 | Haiku 5.5 | Haiku 4.5 |
|---|---|---|
| 上下文長度 | 1,000,000 token | 200,000 token |
| 最大輸出 | 128,000 token | 64,000 token |
| effort | low、medium、high、xhigh、max 五檔 | 不支援 |
| 思考模式 | adaptive(預設開啟)、disabled | enabled(指定預算)、disabled |
| 上下文壓縮(compaction) | 支援 | 不支援 |
Haiku 5.5 不再接受舊式「指定思考預算」的寫法,改為由模型自行決定思考長度(adaptive thinking),而且不帶任何參數時就會開啟。思考內容預設不會串流出來,所以使用者看到的「第一個字」,其實要等整段思考結束才會出現。
新 tokenizer:中文幾乎不變,英文多 35%
官方表示新 tokenizer 會讓同樣的工作「略增」token。用同一段文字分別讓兩個模型計算 token 數:
| 樣本 | Haiku 4.5 | Haiku 5.5 | 增幅 |
|---|---|---|---|
| 繁體中文段落 | 153 | 155 | +1.3% |
| Python 程式碼 | 126 | 141 | +11.9% |
| 英文段落 | 87 | 118 | +35.6% |
對以繁體中文為主的應用來說,價目表上的降幅幾乎可以直接採用,以英文為主的工作負載,實際降幅會少一截。
速度與費用:關掉思考才會變快
CyberQ 準備了三種常見任務:程式除錯、200 字以內的資安摘要,以及從新聞稿擷取 JSON。先看 Haiku 5.5 關閉思考(thinking: disabled)時與 4.5 的對照:
| 任務 | 模型 | 首字時間 | 總延遲 | 輸出速度 | 單次費用(美元) |
|---|---|---|---|---|---|
| 程式除錯 | Haiku 4.5 | 0.54 秒 | 7.35 秒 | 111 tok/s | 0.00420 |
| Haiku 5.5 | 0.55 秒 | 3.78 秒 | 185 tok/s | 0.00036 | |
| 資安摘要 | Haiku 4.5 | 0.51 秒 | 4.37 秒 | 83 tok/s | 0.00185 |
| Haiku 5.5 | 0.60 秒 | 2.54 秒 | 145 tok/s | 0.00019 | |
| JSON 擷取 | Haiku 4.5 | 0.50 秒 | 1.02 秒 | 79 tok/s | 0.00051 |
| Haiku 5.5 | 0.57 秒 | 0.85 秒 | 116 tok/s | 0.00006 |
關閉思考時,首字時間與 4.5 相同,輸出速度快 1.5 到 2.2 倍,三題合計費用為 4.5 的 9.5%,與官方「10 萬 token 以下便宜 90%」一致。
維持預設(開啟思考)時,情況就不同了:
| 任務 | 首字時間 | 總延遲 | 輸出 token | 對照 4.5 的總延遲 |
|---|---|---|---|---|
| 程式除錯 | 2.72 秒 | 6.91 秒 | 1,478 | 7.35 秒 |
| 資安摘要 | 9.57 秒 | 10.35 秒 | 2,250 | 4.37 秒 |
| JSON 擷取 | 2.04 秒 | 2.32 秒 | 442 | 1.02 秒 |
一則 200 字的摘要,模型會先思考約 2,000 token,總延遲是 4.5 的 2.4 倍。三題合計費用為 4.5 的 32.7%,仍然便宜,但降幅從九成縮小到約三分之二。要拿 Haiku 5.5 做客服、分類這類講求即時的工作,務必明確關閉思考,或將 effort 設為 low。
答案品質方面,三題兩個模型都答對。Haiku 4.5 有一次把 CVSS 分數輸出成字串,另有一次說明前後矛盾,Haiku 5.5 沒有出現這類問題。
effort 五檔:簡單題開 max 只是多花錢
同一題程式除錯,在五個 effort 檔位各跑一次:
| effort | 輸出 token | 總延遲 | 費用(美元) | 答對 |
|---|---|---|---|---|
| low | 1,235 | 5.9 秒 | 0.00063 | 是 |
| medium | 1,377 | 6.5 秒 | 0.00070 | 是 |
| high | 1,950 | 9.1 秒 | 0.00099 | 是 |
| xhigh | 3,379 | 15.1 秒 | 0.00170 | 是 |
| max | 13,249 | 55.7 秒 | 0.00664 | 是 |
五檔的最終答案長度相近,增加的幾乎都是思考 token。這題 low 就答對了,max 多花 10 倍費用與 9 倍時間,答案沒有更好。
HLE 抽 100 題:max 檔有三成答案會過度思考
HLE 共 2,500 題,我們以固定亂數種子抽出 100 題(含選擇題 22 題、圖片題 12 題,比例與全集相近),使用 HLE 官方的作答格式與評分提示詞,由 Claude Sonnet 5.5 擔任評審(HLE 官方原本使用 o3-mini)。官方沒有公布 45.9% 使用哪一檔 effort,因此我們跑了兩端的 low 與 max,輸出上限設為模型上限 128,000 token。
| 項目 | low | max |
|---|---|---|
| 正確率 | 34% | 32% |
| 95% 信賴區間 | 25.5% 到 43.7% | 23.7% 到 41.7% |
| 想到輸出上限、未作答 | 0 題 | 33 題 |
| 平均輸出 token | 3,462 | 75,552 |
| 每題時間 | 平均 16 秒 | 中位數 292 秒 |
| 100 題模型費用(美元) | 0.18 | 3.78 |
max 檔有 33 題思考到 128,000 token 上限仍未停止,沒有產出任何答案,因此一律判定為錯誤。排除這些題目後,其餘 67 題答對 32 題,正確率 47.8%,與官方的 45.9% 相近。
逐題比對,兩檔都答對 18 題,只有 low 答對 16 題,只有 max 答對 14 題。被截斷的 33 題中,low 答對了 12 題,顯示 max 檔有過度思考的情形。
官方未說明 HLE 的 effort、輸出上限,以及是否搭配上下文管理。若官方設定能避開截斷,成績可能接近 47.8% 這個水準,但本次測試無法證實。
即使只看 low 的 34%,也遠高於 Haiku 4.5 官方公布的 10.2%,「大幅超越前代」的方向可以確認。
後續也抽查了評審的判定,44 筆選擇題的判定與直接比對選項字母完全一致,填答題抽查 16 筆,判定皆合理。不過樣本只有 100 題,誤差約正負 9 個百分點,結果只能當作方向參考。
資安防護邊界
官方表示 Haiku 5.5 的資安防護比 4.5 嚴格,但允許的防禦性任務範圍比 Sonnet 5.5 廣。我們測了兩個常見好問題,撰寫偵測 Log4Shell 利用流量的 Suricata 規則,以及用 nmap 盤點自家內網的服務與作業系統。兩個模型都完整作答,沒有拒答。這兩題都屬於防禦性任務,只能確認一般資安維運工作不會被誤擋,無法驗證「比 4.5 嚴格」的部分。
10 萬 token 分級價
Haiku 5.5 以單次請求 10 萬輸入 token 為界,超過時單價提高為五倍。這次測試送出了 95K、105K,以及搭配提示快取的幾種請求。API 回應只標示 token 數與服務等級,沒有標示這筆請求套用哪一級價格,實際計價要從帳單反推。
對照 Console 的用量明細,結果很明確,只要單次請求的總輸入超過 10 萬 token,整筆請求的輸入都按高價計,而且快取讀取與快取寫入的 token 也會算進門檻。例如一筆「6 萬 token 快取讀取加 4.5 萬新輸入」的請求,非快取部分只有 4.5 萬,仍然整筆以高價計費,95K 的請求則維持低價。Console 將這些請求歸在標示為「200k – 1M」的區間,與官方公布的 10 萬門檻標示不一致,但實際計價以 10 萬為界。
給導入者的建議
即時性任務請明確關閉思考,或將 effort 設為 low。不帶參數就會開啟思考,從 Haiku 4.5 直接換模型 ID 的應用,延遲可能不降反升。
以英文為主的工作負載要重估成本,新 tokenizer 會多出約三成五的 token。
長上下文與提示快取要一起算。快取 token 也計入 10 萬門檻,系統提示加對話歷史一旦超過 10 萬,整筆請求的單價就變成五倍。
不要預設使用 max effort。困難題目可能想到 128,000 token 上限都沒有答案,程式應檢查 stop_reason 是否為 max_tokens。
量測速度時要注意思考內容不會串流,以「首字之後的生成速度」計算會得到每秒數千 token 的錯誤數字。比較不同模型時,請關閉思考,或改用「輸出 token 除以總延遲」。










