Anthropic 於 2026 年 10 月 7 日發布 Claude Haiku 5.5,官方定位為該公司歷來最便宜、最快速、能力最強的小型模型。這次更新的重點並非單純的效能微調,而是同時在定價結構、推理強度設定與安全防護政策上做出調整,對於需要大量呼叫、對成本敏感的應用場景影響最為直接。
定位與適用場景
Anthropic 將 Haiku 5.5 鎖定在高流量、成本敏感的工作負載,包括摘要、上下文壓縮(compaction)、資料庫查詢與分類請求。官方特別強調兩種搭配方式,一是作為 Opus 5.5 與 Sonnet 5.5 的子代理(subagent)處理程式開發任務中的局部工作,二是用於即時客服與瀏覽器操作等對延遲敏感的場景。
CyberQ 觀察,以 Terminal-Bench 4.0 衡量的複雜代理式程式開發任務,Sonnet 5.5 與 Opus 5.5 仍是較佳選擇,Haiku 5.5 適合的是範圍較窄、過去因成本考量而難以導入 Claude 的任務。
基準測試表現
官方公布的測試資料如下,GPT-6 Luna 為 Anthropic 自行列出的對照對象,Sonnet 5.5 僅供參考。
| 測試項目 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1(知識工作) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1(知識工作) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 離線子集(電腦操作) | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam(無工具) | 45.9% | 10.2% | 未公布 | 56.9% |
| Humanity’s Last Exam(有工具) | 57.4% | 18.7% | 未公布 | 64.5% |
| Terminal-Bench 4.0(代理式程式開發) | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main(代理式程式開發) | 46.4% | 未公布 | 42.4% | 52.1% |
| Chartography(視覺推理,無工具) | 46.4% | 6.4% | 29.1% | 61.6% |
相較於 Haiku 4.5,電腦操作與多學科推理兩項的提升幅度最大,OSWorld 2.1 從 15.7% 提升至 72.4%,Humanity’s Last Exam 無工具分數從 10.2% 提升至 45.9%。評測方法細節見官方 System Card。
Haiku 5.5 也是 Haiku 系列首款提供可調整推理強度(effort setting)的模型,使用者可依任務需求在成本與智能之間取捨。官方以 OSWorld、GDPval-AA 與 Humanity’s Last Exam 三項測試展示不同強度設定下的準確度與單次成本曲線。
官方頁面引述的早期客戶回饋包括 Asana 觀察到任務完成延遲降低超過 30%、單回合推論速度最高達 2.5 倍,HubSpot 在 CRM 任務評測套件取得 92.8% 的平均分數,AlphaSense 在 400 筆查詢測試中由 Haiku 4.5 的 0.76 提升至 0.84,Box 則回報分數高出 Haiku 4.5 約 11 分且延遲約減半。這些資料均來自各公司提供給 Anthropic 的陳述,尚無第三方獨立驗證。
定價結構改採分級制
CyberQ 認為,這次定價的變化幅度大於效能提升。Haiku 5.5 依提示詞長度分為 10 萬 token 以下與以上兩級,單位為每百萬 token。
| 項目 | Haiku 5.5(≤100k / >100k) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| 快取讀取 | $0.01 / $0.05 | $0.10 | $0.10 |
| 快取寫入 | $0.125 / $0.625 | $1.25 | $2.50 |
| 輸入 token | $0.10 / $0.50 | $1.00 | $2.00 |
| 輸出 token | $0.50 / $2.50 | $5.00 | $10.00 |
依官方說明,10 萬 token 以下的請求價格較 Haiku 4.5 低 90%,超過 10 萬 token 的請求低 50%。Haiku 4.5 約九成請求屬於前者。不過 Haiku 5.5 改用與 Sonnet 5.5、Opus 5.5 相近的新版 tokenizer,同一工作所消耗的 token 數略增,官方將此納入計算後估算平均成本降幅約 75%。實際降幅仍須依各團隊的提示詞長度分布與 token 用量重新評估。
安全防護政策的調整
CyberQ 提醒,對資安領域讀者而言,值得注意的是官方對網路安全防護的描述。Haiku 5.5 的網路安全防護較 Haiku 4.5 嚴格,但比 Anthropic 近期其他模型稍寬鬆,允許的防禦性任務範圍較 Sonnet 5.5 更廣,惟滲透測試等較可能被攻擊方使用的技術仍會被阻擋。生物領域防護則與 Sonnet 5、Sonnet 5.5 及 Opus 5 相同。
Anthropic 表示 Haiku 5.5 在對齊評測上較 Haiku 4.5 有大幅改善,不當行為案例明顯減少,配合濫用的意願也較低,細節見 System Card。需要更廣泛網路安全或生物研究用途的組織,可申請 Cyber Verification Program 與 Life Sciences Verification Program。具體的允許與阻擋清單,官方頁面未逐項列出,待查。
可用性與同步推出的措施
Haiku 5.5 已在 Claude Platform、Amazon Web Services、Google Cloud 與 Microsoft Azure 上線,模型代號為 claude-haiku-5-5,從 Haiku 4.5 轉移可參考官方 遷移指南。
隨此次發布,Anthropic 同步公布三項措施。
第一,Sonnet 5.5 的快取讀取價格由每百萬 token $0.20 降至 $0.10,官方估算多數代理式任務的整體成本因此下降約 20%。
第二,本週起向 Claude Max 與 Team 訂閱用戶提供每月 API 額度,Max 5x 用戶每月 $100、Max 20x 用戶每月 $200,Team 方案依團隊人數最高 $500 共用,可用於任何模型。台灣用戶是否適用相同額度,待查。
第三,Claude Python 與 TypeScript SDK 新增電腦操作與瀏覽器操作的 beta 支援,官方認為 Haiku 5.5 的速度、能力與價格組合特別適合此類任務。
對台灣團隊的意義
CyberQ 認為,從定價來看,Haiku 5.5 的輸入成本已降至每百萬 token $0.10,接近部分地端開源模型的推論成本區間,對於評估雲端 API 與自建推理基礎設施的團隊,成本比較基準需要重新計算。另一方面,官方自己也承認複雜代理式程式開發仍須仰賴 Sonnet 5.5 或 Opus 5.5,實務上較合理的做法是以大型模型擔任主導、Haiku 5.5 處理摘要、壓縮與子任務的分層架構。
官方頁面所有效能資料均由 Anthropic 自行公布,客戶說法亦來自早期測試合作夥伴。真實工作負載下的延遲、成本與準確度,仍有待獨立評測與台灣在地案例驗證。








