中國 AI 新創廠商月之暗面 Moonshot AI 日前發表的 Kimi K3,以 2.8 兆(2.8T)參數、100 萬 token 上下文與原生視覺輸入之姿登場,並承諾在 7 月 27 日前釋出完整權重,屆時將成為人類史上規模最大的開放權重模型。發布後 24 小時內,K3 便以 1,679 分登上 Arena.ai 的 Frontend Code Arena 榜首,將 Claude Fable 5(1,631 分)擠到第二名。另外,著名第三方評測機構 Artificial Analysis 的 Intelligence Index 也給出 57 分,僅次於另外二款閉源雲端 AI 大模型 Claude Fable 5 與 GPT-5.6 Sol。

榜單話題很熱鬧,但對台灣的企業 IT 與自架玩家而言,真正的問題只有兩個,Kimi K3 權重開放之後,地端到底要多少設備才跑得動?以及在蒸餾疑雲與資料主權的考量下,該用什麼架構導入? CyberQ 將依序拆解硬體規格試算、爭議事件現況,以及我們認為最務實的雲地混合導入路線。
一、2.8T 參數的地端現實:權重本身就要 1.4TB 起跳
先做最基本的算術。K3 採用 MoE(Mixture-of-Experts)架構,共 896 個專家、每個 token 僅啟用 16 個,且從監督微調(SFT)階段即以 MXFP4 權重、MXFP8 啟用值進行量化感知訓練(QAT),官方選擇此格式的理由之一,是 NVIDIA Blackwell 與 AMD MI400 等新世代加速器可原生支援。
以每參數約 4 bit 計算,2.8T 參數的權重檔案本身就落在約 1.4TB~1.5TB,這還不含 microscaling 中繼資料、執行期緩衝區、啟用值與 KV Cache。Moonshot 自己的部署指引更直接寫明,建議採用64 顆以上加速器的超級節點(supernode)架構來跑。CyberQ 這邊換算成大家熟悉的規格:
| 部署情境 | 記憶體需求(估算) | 對應硬體 |
|---|---|---|
| K3 原生 MXFP4 | 權重約 1.4~1.5TB+KV Cache 與執行期開銷 | 64 顆以上加速器叢集(官方指引) |
| K3 激進量化(社群預估) | 約 650GB~1TB | 超出所有消費級與工作站上限,含 512GB Mac Studio |
| 參考:DeepSeek-R1 671B Q4 | 約 407GB | 目前社群常見「巨型模型」上限 |
值得注意的是 MoE 的一個常見誤解,稀疏啟用省的是每 token 的運算量,不是儲存空間。896 個專家必須全數常駐於服務叢集的記憶體中,這也讓高速互連(NVLink、InfiniBand)成為部署的一級需求,而非選配。另一個實務細節是,K3 的 KDA(Kimi Delta Attention)架構需要配套的推理核心與快取語意,Moonshot 表示傳統的 prefix caching 無法直接套用,其 vLLM 的 prefill-cache 支援將隨權重一併釋出。所以說,能載入權重的執行環境不等於能正確跑 K3 的執行環境,7 月 27 日正式釋出模型權重相關檔案之後仍需等待推理框架跟上。
CyberQ 指出,這樣一來的結論很清楚,K3 的開源受益者是其實是全球各國的 AI 推理服務供應商、主權 AI 雲、大型雲端服務公司與擁有足夠 GPU 叢集的大型企業。至於個人開發者與中小企業的決策點,實際上只剩 API 可調用,請不要去想用地端來部署 Kimi K3 了,或者,往下看混合架構。
二、「我是 Claude」:蒸餾疑雲的查證現況
K3 登頂 AI 榜單的同時,另一則消息也在社群發酵:有使用者分享的對話截圖顯示,K3 在至少一則流傳的對話中自稱「Claude, an AI assistant made by Anthropic」,Wccftech 據此報導 K3 可能蒸餾自 Anthropic 的 Claude 模型。
這件事需要放進更大的脈絡來看。美國 AI 新創大廠 Anthropic 其實早在 2026 年 2 月就已經公開指控過 DeepSeek、Moonshot 與 MiniMax 三家中國實驗室非法擷取 Claude 的能力以改進自家模型。Tom’s Hardware 的報導進一步指出,Anthropic 當時指控 Moonshot 使用了 340 萬則 Claude 對話進行蒸餾訓練,而 K3 如今的評測分數,恰好落在該指控所點名模型的幾分之內。中國方面則稱相關指控毫無根據。
不過就查證立場而言,有三點必須說清楚:
目前的證據屬於軼事性質。流傳的自我認同對話為個案,Moonshot 未證實,第三方也無法系統性復現。
模型自稱其他模型,不必然等於蒸餾。這是因為網路訓練語料中充斥大量 AI 生成內容(含 Claude 的輸出),語料污染同樣可能導致身分混淆,這在過去 Gemini、DeepSeek 等模型上都發生過類似案例。
反過來說,7 月 27 日該公司權重釋出後,其實也不會終結市場上的爭議。畢竟蒸餾痕跡難以從權重本身直接鑑識,這場羅生門短期內不會有定論。
CyberQ 認為,對企業導入者而言,這條爭議線的實際意義不在道德判斷,而在合規風險。若貴公司與美系模型供應商簽有服務條款,或處於受出口管制、智財審查敏感的產業,在正式技術報告與授權條款(K3 預告採 Modified MIT)落地前,建議將 K3 視為待觀察而非可承諾的選項。
三、務實解:雲地混合路由建議,本地跑前代模型、雲端呼叫旗艦
既然 K3 的地端門檻是叢集等級,CyberQ 認為業界實際的落地形態,會是混合雲路由(hybrid routing),敏感個資與小型任務留在本地、大型專案與深度推理才打到雲端。具體分工架構如下。
本地層跑 Kimi K2.6 / K2.7 Code
Moonshot 前代的 K2.6(4 月釋出)與 K2.7 Code(6 月 12 日釋出)同為 1T 總參數、32B 啟用的 MoE 架構,採 Modified MIT 授權且原生 INT4 QAT,是目前開放權重中地端可行性最高的旗艦級選項。K2.7 Code 相較 K2.6 減少約 30% 的推理 token 用量,Kimi Code Bench v2 提升 21.8%。
但這裡要誠實修正一個常見的樂觀估計,市場上有人討論說幾張卡即可跑,對 K2.7 Code 而言仍偏樂觀。我們在業界實測整理的規格如下:
| 配置等級 | 規格 | 適用情境 |
|---|---|---|
| 生產級 FP8 | 8× H200 SXM5(約 1,128GB VRAM) | 企業多人併發、256K 全上下文 |
| 生產級 INT4 | 4× B200,或 6× B200(FP8) | 企業部署、預留 KV Cache 空間 |
| 原生 INT4 權重 | 約 605~630GB | 檔案大小參考 |
| 玩家級極限 | Unsloth 2-bit 量化約 325GB:4× RTX 3090+256GB RAM,或 384GB DDR5 純 CPU 機 | 單人低速推理、概念驗證 |
也就是說,本地層的合理定位是「中型企業以 4~8 張資料中心級 GPU 服務內部團隊」,或玩家以 CPU offload 方式低速驗證。若你的公司在這領域的本地 AI 需求僅止於個資去識別化、文件初篩、程式碼補全等輕量任務,其實不必堅持 1T 級模型,用 32B~120B 級的開放模型(搭配單張 RTX 6000 Ada 或雙卡工作站)在延遲與維運成本上往往是更理性的選擇,這也是筆者在客戶端實際採用的配置邏輯。
預算不夠的公司或小型團隊,則可以採用 redis 大神開發打包的 DS4 專案,跑地端的 DeepSeek V4 Flash 模型,擔任較小任務的地端算力核心,重要的任務再吃雲端 API 來處理。
雲端層:K3 / Claude API 處理長程任務
當任務進入大型專案重構、長程 agentic coding、需要一次吃下整個 monorepo 的範疇時,再路由到雲端旗艦。K3 的主場正是長程任務,官方 SWE Marathon 拿下 42.0 全場第一(Claude Fable 5 為 35.0),Artificial Analysis 的長時程知識工作評測 AA-Briefcase 亦僅次於 Fable 5。不過呢,單次推理的智力上限則仍由 Claude Fable 5 與 GPT-5.6 Sol 領先,兩者可依任務性質並存於路由規則中。
成本引擎採用自動 Context Caching 讓 Agent 工作負載省下八成
混合架構能否划算,關鍵在雲端這一段的帳單,而 K3 的計價結構恰好對 Agent 工作負載友善。官方費率為 輸入 $3.00/M token(cache miss)、$0.30/M token(cache hit)、輸出 $15.00/M token,快取為全自動、無需設定快取 ID,且 1M 上下文全程單一費率、不分級距。
快取命中價格是未命中的十分之一(90% 折扣),這對「同一程式碼庫repo、同一批文件反覆對話」的 Swarm/Agent 場景是決定性的。CyberQ 以一個實際試算為例,Agent 在同一 session 內十次送出相同的 80 萬 token 前綴,無快取需 $24.00,有快取則首次 $2.40 加九次命中共 $2.16,合計 $4.56,省下約 81%。
如果從業界著名的 AI 雲端 API 服務 OpenRouter 觀測到的資料來看, K3 上線首週流量,快取命中率甚至高達 93%。
但有三個帳單陷阱,提醒必須納入路由設計:
首先是輸出才是拖台錢大戶。 K3 目前強制開啟最高推理強度(reasoning_effort 僅支援 max),Artificial Analysis 實測其輸出 token 用量約為受測模型平均的 2 倍以上,配上 $15/M 的輸出單價,長篇推理可能吃掉快取省下的全部費用。請務必限制 max_tokens 並以「每完成任務成本」而非「每 token 單價」追蹤。
其次是切換模型快取即失效。 Moonshot 文件明載 session 中途切換模型會使既有快取失效,混合路由的切換點應設在任務邊界,而非對話中途。
再來是前綴必須穩定。 系統提示、工具 schema、repo 摘要等固定內容應維持逐字一致,任何動態插值都會讓後續內容快取全數 miss。
四、觀察與建議
CyberQ 認為,這次的定價已說明 Moonshot 的戰略轉向。 依 Artificial Analysis 的每任務成本階梯計算,DeepSeek $0.04、GLM-5.2 $0.32、K3 $0.94、GPT-5.6 Sol $1.04、Claude Opus 4.8 $1.80,K3 的定價其實接近是美國一線閉源模型,而非中國同行的低價策略。配合 Moonshot 拆解 VIE 結構、傳出籌備赴中國香港上市籌資的節奏,「中國模型=低價搶量」的敘事可能只適用於階梯下半段。
7 月 27 日是真正的檢查點。目前所有 K3 的測試資料皆來自官方自報或 API 存取,無法在權重公開前獨立驗證。市場關注的 62 tokens/s 的偏慢輸出速度究竟是 serving 問題還是 2.8T 的架構代價,也要等更多第三方部署後才有答案。CyberQ 建議企業讀者把採購評估排在 8 月中旬之後,屆時技術報告、授權條款、vLLM/SGLang 支援與獨立復現應已到位。
混合架構的重點不是模型,是路由治理。敏感資料判定規則、任務規模門檻、快取前綴規範、成本歸戶,這四件事寫進路由層的價值,遠高於追逐任何單一模型的榜單名次。CyberQ 建議,由於從新的快速發展到成熟期期間,我們用的 AI 模型可能每季都會換,因此你最好是先把 AI 工程的治理框架留下來,一定會再反覆驗證使用到的。
推薦延伸閱讀:
- Moonshot AI — Kimi K3 官方發布、Kimi K3 定價頁
- Tom’s Hardware — Moonshot 釋出 2.8T 參數 Kimi K3
- Wccftech — Kimi K3 在至少一則對話中自稱 Claude
- Fortune — Moonshot Kimi K3 與蒸餾指控背景
- Artificial Analysis — Kimi K3 獨立評測
- Hugging Face 社群 — Kimi K3 MXFP4 架構解析
- Tokios — K3 地端硬體現實分析
- Spheron — Kimi K2.7 Code 自架部署指南
- RunAIHome — K2.7 Code 地端 VRAM 需求
- Verdent — Kimi K3 API 快取試算








