不靠單一巨型模型也能贏
日本 AI 新創廠商 Sakana AI 於日前同時推出兩款編排式(orchestration)模型,Fugu Max 與 Fugu Ultra v2,兩者共用同一套編排架構,分別針對成本效率與最高效能最佳化。Fugu Max 定價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,Sakana AI 宣稱輸出價格比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低 40% 至 60%。Fugu Ultra v2 在視覺推論基準 Chartography 取得 48.3 分,高於 Opus 5 的 27.3 分與 Fable 5 的 29.5 分。
一套架構,兩個目標
根據 Sakana AI 的說明,Fugu Max 與 Fugu Ultra v2 並非兩個獨立產品,而是同一套核心編排架構針對兩種任務目標的不同調校。Fugu Max 追求在最低成本下取得最佳輸出,Fugu Ultra v2 則是追求在複雜多步驟任務上達到最高能力。
Sakana AI 在文中提出一個判斷標準,動用數兆參數模型去執行簡單的資料查詢並非智慧,而是浪費。真正影響實務任務的尖端邊界有兩個軸向,一個是能力,另一個是成本。Fugu 系列的定位就是在這個二維平面上,把成本效率的柏拉圖邊界(Pareto frontier)往外推。
Fugu Max,更多模型、更低成本
Fugu Max 的主要變化在於大幅擴充可編排的模型池。透過與 NVIDIA 的合作,模型池納入 NVIDIA Nemotron 系列開放模型,Sakana AI 稱這是至今整合開放權重模型與特化模型數量最多的一版。運作方式是針對每項任務,動態路由至「能解決該任務的最輕量模型」,藉此壓低 token 消耗,同時維持尖端等級的輸出。
Sakana AI 公布的 Fugu Max 效能資料如下(皆為 Sakana AI 自行公布的數字)。
| 基準 | 分數 |
|---|---|
| Terminal Bench 2.1 | 89.5 |
| GPQAD | 95.5 |
| AA-LCR | 83 |
| GDP.pdf | 26 |
| AutomationBench | 49.5 |
| SWEFish | 62.5 |
Sakana AI 宣稱 Fugu Max 在上述六項基準取得整體最高分,並在十項基準中的七項擴展了成本效能的柏拉圖邊界。其中 SWEFish 為 Sakana AI 的內部基準,反映其自身的程式開發挑戰與使用情境,外部無法獨立驗證。
價格方面,每百萬輸入 token 為 2 美元,每百萬輸出 token 為 6 美元。Sakana AI 表示在相近價格帶的尖端模型中,Fugu Max 以比單一模型低二到六倍的成本,達到接近頂級模型的效能。
Fugu Ultra v2,在不依賴閉源尖端模型的前提下推高上限
Fugu Ultra v2 鎖定複雜推論、自主研究、全端軟體開發等高難度工作。Sakana AI 表示其優勢集中在需要持續推論複雜視覺與結構化資料的任務。
| 基準 | Fugu Ultra v2 | 對照數據(Sakana AI 公布) |
|---|---|---|
| Chartography(視覺推論與資料解讀) | 48.3 | Opus 5 為 27.3,Fable 5 為 29.5 |
| DeepSWE(實務軟體工程) | 74.3 | 超越 token 單價高三到五倍的模型 |
整體而言,Sakana AI 宣稱 Fugu Ultra v2 在八項基準中的五項(GDP.pdf、Chartography、SWEFish、DeepSWE、Toolathon)取得最高或並列最高分,在七項基準進入前二名。
這次發布最值得注意的一點,在於 Sakana AI 明確聲明 Fugu Ultra v2 的代理模型池「不包含」Fable 5、Fable 5.1 與 GPT-6-Astra。Sakana AI 同時揭露 Fugu Ultra v2 的訓練截止日期為 2026 年 8 月 28 日。
CyberQ 回顧 6 月推出的 Fugu Ultra v1,當時的訴求是「編排層可以匹敵閉源尖端模型」。到了 v2,訴求進一步變成「不需要把閉源尖端模型放進模型池,也能達到尖端輸出」。這個差異對企業採購與風險管理是有實質意義,本文下方會進一步討論。
為什麼「可替換的模型池」對企業重要
Sakana AI 在發布說明中把這項設計直接連結到供應鏈韌性。其論點是,透過編排一組可替換的開放模型與特化模型,用戶可以避免廠商鎖定(vendor lock-in)、API 被撤銷、地緣政治動盪,以及服務突然中止等風險。
CyberQ 從資安治理與 ITGC 的角度看,這個訴求對應到幾個實務問題。
首先是第三方依賴風險。若企業的 AI 工作流程綁定單一閉源模型供應商,該供應商的服務條款變更、區域限制或停止服務,都會直接成為營運中斷風險。可替換模型池在架構層面提供了替代路徑。
其次為可稽核性。編排式架構的路由決策本身是一個新的稽核對象。哪個任務被送到哪個模型、資料是否離開特定管轄區,這些都需要日誌與治理機制。Sakana AI 的發布說明並未描述路由決策的可觀測性或日誌功能。
最後則是資料落地。Sakana AI 為日本公司,其 API 服務的資料處理地點、是否提供區域部署選項,發布說明中未提及。
API 相容與遷移
兩款模型已透過 Sakana AI 標準的 OpenAI 相容 API 提供。Sakana AI 表示現有 Fugu 用戶升級到 Max 或 Ultra v2 只需改動一行參數,無需遷移,相關技術資料已公布在 arXiv 2606.21228。
Fugu 系列的發展時程
| 時間 | 里程碑 |
|---|---|
| 2026 年 4 月 | Beta 版,驗證多代理編排可作為統一基礎模型運作 |
| 2026 年 6 月 | 正式版與 Fugu Ultra v1,訴求匹敵閉源尖端模型 |
| 2026 年 7 月 | Fugu-Cyber 與 Claude Code 介面,展示資安與程式開發領域的特化 |
| 2026 年 8 月 | Sakana Chat 更新與 NVIDIA 合作,開始整合 Nemotron 開放模型 |
| 2026 年 9 月 | Fugu Max 與 Fugu Ultra v2 |
上述時程摘自 Sakana AI 發布說明。其中 7 月的 Fugu-Cyber 為資安特化版本,某些讀者看到這個,可能就會有興趣吧。
CyberQ 觀點
編排式架構近幾個月成為開放模型陣營對抗閉源巨型模型的主要路線之一。Sakana AI 這次發布的核心主張,在於證明「不把閉源尖端模型放進池子」也能在部分基準取得領先,這個主張若成立,對企業採購策略的影響會大於單一分數的高低。
不過有幾點需要保留。首先,所有基準資料均由 Sakana AI 自行公布,SWEFish 更是內部基準,目前尚無第三方獨立評測。其次,Chartography 對照組所用的 Opus 5 與 Fable 5 測試版本、測試條件與日期,發布說明未載明。第三,編排式架構的實際延遲與尾端延遲(tail latency)是實務部署的關鍵指標,本次發布未提供相關資料。
參考資料
PC Watch,「視覚推論でOpus 5/Fable 5超え。Sakana AI「Fugu Ultra v2」提供開始」,2026 年 9 月 14 日。https://pc.watch.impress.co.jp/docs/news/2140557.html
Sakana AI,「Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier」,2026 年 9 月 11 日。https://sakana.ai/fugu-max-release/
PC Watch,「Fable 5に匹敵、複数AIの力を束ねて実現したSakana AI「Fugu Ultra」」,2026 年 6 月 22 日。https://pc.watch.impress.co.jp/docs/news/2119021.html
Sakana AI 技術報告,arXiv 2606.21228







