CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
聯繫我們
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • 熱門
  • AI 人工智慧
  • 資安
  • Docker
  • 進階應用
  • 網通
  • NAS
  • 開箱測試
  • 教學
  • 展覽直擊
首頁 新聞 AI 人工智慧

Kimi K3 開源倒數 1.4TB 權重誰跑得動?「自稱 Claude」爭議下,雲地混合是企業務實解

Chen Glenn by Chen Glenn
2026 年 07 月 19 日 19:00
in AI 人工智慧, 新聞
閱讀時間: 6 分鐘
A A
Kimi K3 開源倒數 1.4TB 權重誰跑得動?「自稱 Claude」爭議下,雲地混合是企業務實解
5.5k
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

中國 AI 新創廠商月之暗面 Moonshot AI 日前發表的 Kimi K3,以 2.8 兆(2.8T)參數、100 萬 token 上下文與原生視覺輸入之姿登場,並承諾在 7 月 27 日前釋出完整權重,屆時將成為人類史上規模最大的開放權重模型。發布後 24 小時內,K3 便以 1,679 分登上 Arena.ai 的 Frontend Code Arena 榜首,將 Claude Fable 5(1,631 分)擠到第二名。另外,著名第三方評測機構 Artificial Analysis 的 Intelligence Index 也給出 57 分,僅次於另外二款閉源雲端 AI 大模型 Claude Fable 5 與 GPT-5.6 Sol。

RELATED POSTS

Netflix 5.87億美元收購 AI 電影公司|黃仁勳訪日簽下日本生態系大單|產業精選 07.20

Linus Torvalds 親自定調:Linux 不是反 AI 專案,不滿者可自行 Fork

新版 Kimi引發中國低價 AI 模型影響市場的憂慮|美國數款電動車退場|產業精選 07.19

榜單話題很熱鬧,但對台灣的企業 IT 與自架玩家而言,真正的問題只有兩個,Kimi K3 權重開放之後,地端到底要多少設備才跑得動?以及在蒸餾疑雲與資料主權的考量下,該用什麼架構導入? CyberQ 將依序拆解硬體規格試算、爭議事件現況,以及我們認為最務實的雲地混合導入路線。


一、2.8T 參數的地端現實:權重本身就要 1.4TB 起跳

先做最基本的算術。K3 採用 MoE(Mixture-of-Experts)架構,共 896 個專家、每個 token 僅啟用 16 個,且從監督微調(SFT)階段即以 MXFP4 權重、MXFP8 啟用值進行量化感知訓練(QAT),官方選擇此格式的理由之一,是 NVIDIA Blackwell 與 AMD MI400 等新世代加速器可原生支援。

以每參數約 4 bit 計算,2.8T 參數的權重檔案本身就落在約 1.4TB~1.5TB,這還不含 microscaling 中繼資料、執行期緩衝區、啟用值與 KV Cache。Moonshot 自己的部署指引更直接寫明,建議採用64 顆以上加速器的超級節點(supernode)架構來跑。CyberQ 這邊換算成大家熟悉的規格:

部署情境記憶體需求(估算)對應硬體
K3 原生 MXFP4權重約 1.4~1.5TB+KV Cache 與執行期開銷64 顆以上加速器叢集(官方指引)
K3 激進量化(社群預估)約 650GB~1TB超出所有消費級與工作站上限,含 512GB Mac Studio
參考:DeepSeek-R1 671B Q4約 407GB目前社群常見「巨型模型」上限

值得注意的是 MoE 的一個常見誤解,稀疏啟用省的是每 token 的運算量,不是儲存空間。896 個專家必須全數常駐於服務叢集的記憶體中,這也讓高速互連(NVLink、InfiniBand)成為部署的一級需求,而非選配。另一個實務細節是,K3 的 KDA(Kimi Delta Attention)架構需要配套的推理核心與快取語意,Moonshot 表示傳統的 prefix caching 無法直接套用,其 vLLM 的 prefill-cache 支援將隨權重一併釋出。所以說,能載入權重的執行環境不等於能正確跑 K3 的執行環境,7 月 27 日正式釋出模型權重相關檔案之後仍需等待推理框架跟上。

CyberQ 指出,這樣一來的結論很清楚,K3 的開源受益者是其實是全球各國的 AI 推理服務供應商、主權 AI 雲、大型雲端服務公司與擁有足夠 GPU 叢集的大型企業。至於個人開發者與中小企業的決策點,實際上只剩 API 可調用,請不要去想用地端來部署 Kimi K3 了,或者,往下看混合架構。


二、「我是 Claude」:蒸餾疑雲的查證現況

K3 登頂 AI 榜單的同時,另一則消息也在社群發酵:有使用者分享的對話截圖顯示,K3 在至少一則流傳的對話中自稱「Claude, an AI assistant made by Anthropic」,Wccftech 據此報導 K3 可能蒸餾自 Anthropic 的 Claude 模型。

這件事需要放進更大的脈絡來看。美國 AI 新創大廠 Anthropic 其實早在 2026 年 2 月就已經公開指控過 DeepSeek、Moonshot 與 MiniMax 三家中國實驗室非法擷取 Claude 的能力以改進自家模型。Tom’s Hardware 的報導進一步指出,Anthropic 當時指控 Moonshot 使用了 340 萬則 Claude 對話進行蒸餾訓練,而 K3 如今的評測分數,恰好落在該指控所點名模型的幾分之內。中國方面則稱相關指控毫無根據。

不過就查證立場而言,有三點必須說清楚:

目前的證據屬於軼事性質。流傳的自我認同對話為個案,Moonshot 未證實,第三方也無法系統性復現。

模型自稱其他模型,不必然等於蒸餾。這是因為網路訓練語料中充斥大量 AI 生成內容(含 Claude 的輸出),語料污染同樣可能導致身分混淆,這在過去 Gemini、DeepSeek 等模型上都發生過類似案例。

反過來說,7 月 27 日該公司權重釋出後,其實也不會終結市場上的爭議。畢竟蒸餾痕跡難以從權重本身直接鑑識,這場羅生門短期內不會有定論。

CyberQ 認為,對企業導入者而言,這條爭議線的實際意義不在道德判斷,而在合規風險。若貴公司與美系模型供應商簽有服務條款,或處於受出口管制、智財審查敏感的產業,在正式技術報告與授權條款(K3 預告採 Modified MIT)落地前,建議將 K3 視為待觀察而非可承諾的選項。


三、務實解:雲地混合路由建議,本地跑前代模型、雲端呼叫旗艦

既然 K3 的地端門檻是叢集等級,CyberQ 認為業界實際的落地形態,會是混合雲路由(hybrid routing),敏感個資與小型任務留在本地、大型專案與深度推理才打到雲端。具體分工架構如下。

本地層跑 Kimi K2.6 / K2.7 Code

Moonshot 前代的 K2.6(4 月釋出)與 K2.7 Code(6 月 12 日釋出)同為 1T 總參數、32B 啟用的 MoE 架構,採 Modified MIT 授權且原生 INT4 QAT,是目前開放權重中地端可行性最高的旗艦級選項。K2.7 Code 相較 K2.6 減少約 30% 的推理 token 用量,Kimi Code Bench v2 提升 21.8%。

但這裡要誠實修正一個常見的樂觀估計,市場上有人討論說幾張卡即可跑,對 K2.7 Code 而言仍偏樂觀。我們在業界實測整理的規格如下:

配置等級規格適用情境
生產級 FP88× H200 SXM5(約 1,128GB VRAM)企業多人併發、256K 全上下文
生產級 INT44× B200,或 6× B200(FP8)企業部署、預留 KV Cache 空間
原生 INT4 權重約 605~630GB檔案大小參考
玩家級極限Unsloth 2-bit 量化約 325GB:4× RTX 3090+256GB RAM,或 384GB DDR5 純 CPU 機單人低速推理、概念驗證

也就是說,本地層的合理定位是「中型企業以 4~8 張資料中心級 GPU 服務內部團隊」,或玩家以 CPU offload 方式低速驗證。若你的公司在這領域的本地 AI 需求僅止於個資去識別化、文件初篩、程式碼補全等輕量任務,其實不必堅持 1T 級模型,用 32B~120B 級的開放模型(搭配單張 RTX 6000 Ada 或雙卡工作站)在延遲與維運成本上往往是更理性的選擇,這也是筆者在客戶端實際採用的配置邏輯。

預算不夠的公司或小型團隊,則可以採用 redis 大神開發打包的 DS4 專案,跑地端的 DeepSeek V4 Flash 模型,擔任較小任務的地端算力核心,重要的任務再吃雲端 API 來處理。

雲端層:K3 / Claude API 處理長程任務

當任務進入大型專案重構、長程 agentic coding、需要一次吃下整個 monorepo 的範疇時,再路由到雲端旗艦。K3 的主場正是長程任務,官方 SWE Marathon 拿下 42.0 全場第一(Claude Fable 5 為 35.0),Artificial Analysis 的長時程知識工作評測 AA-Briefcase 亦僅次於 Fable 5。不過呢,單次推理的智力上限則仍由 Claude Fable 5 與 GPT-5.6 Sol 領先,兩者可依任務性質並存於路由規則中。

成本引擎採用自動 Context Caching 讓 Agent 工作負載省下八成

混合架構能否划算,關鍵在雲端這一段的帳單,而 K3 的計價結構恰好對 Agent 工作負載友善。官方費率為 輸入 $3.00/M token(cache miss)、$0.30/M token(cache hit)、輸出 $15.00/M token,快取為全自動、無需設定快取 ID,且 1M 上下文全程單一費率、不分級距。

快取命中價格是未命中的十分之一(90% 折扣),這對「同一程式碼庫repo、同一批文件反覆對話」的 Swarm/Agent 場景是決定性的。CyberQ 以一個實際試算為例,Agent 在同一 session 內十次送出相同的 80 萬 token 前綴,無快取需 $24.00,有快取則首次 $2.40 加九次命中共 $2.16,合計 $4.56,省下約 81%。

如果從業界著名的 AI 雲端 API 服務 OpenRouter 觀測到的資料來看, K3 上線首週流量,快取命中率甚至高達 93%。

但有三個帳單陷阱,提醒必須納入路由設計:

首先是輸出才是拖台錢大戶。 K3 目前強制開啟最高推理強度(reasoning_effort 僅支援 max),Artificial Analysis 實測其輸出 token 用量約為受測模型平均的 2 倍以上,配上 $15/M 的輸出單價,長篇推理可能吃掉快取省下的全部費用。請務必限制 max_tokens 並以「每完成任務成本」而非「每 token 單價」追蹤。

其次是切換模型快取即失效。 Moonshot 文件明載 session 中途切換模型會使既有快取失效,混合路由的切換點應設在任務邊界,而非對話中途。

再來是前綴必須穩定。 系統提示、工具 schema、repo 摘要等固定內容應維持逐字一致,任何動態插值都會讓後續內容快取全數 miss。


四、觀察與建議

CyberQ 認為,這次的定價已說明 Moonshot 的戰略轉向。 依 Artificial Analysis 的每任務成本階梯計算,DeepSeek $0.04、GLM-5.2 $0.32、K3 $0.94、GPT-5.6 Sol $1.04、Claude Opus 4.8 $1.80,K3 的定價其實接近是美國一線閉源模型,而非中國同行的低價策略。配合 Moonshot 拆解 VIE 結構、傳出籌備赴中國香港上市籌資的節奏,「中國模型=低價搶量」的敘事可能只適用於階梯下半段。

7 月 27 日是真正的檢查點。目前所有 K3 的測試資料皆來自官方自報或 API 存取,無法在權重公開前獨立驗證。市場關注的 62 tokens/s 的偏慢輸出速度究竟是 serving 問題還是 2.8T 的架構代價,也要等更多第三方部署後才有答案。CyberQ 建議企業讀者把採購評估排在 8 月中旬之後,屆時技術報告、授權條款、vLLM/SGLang 支援與獨立復現應已到位。

混合架構的重點不是模型,是路由治理。敏感資料判定規則、任務規模門檻、快取前綴規範、成本歸戶,這四件事寫進路由層的價值,遠高於追逐任何單一模型的榜單名次。CyberQ 建議,由於從新的快速發展到成熟期期間,我們用的 AI 模型可能每季都會換,因此你最好是先把 AI 工程的治理框架留下來,一定會再反覆驗證使用到的。


推薦延伸閱讀:

  • Moonshot AI — Kimi K3 官方發布、Kimi K3 定價頁
  • Tom’s Hardware — Moonshot 釋出 2.8T 參數 Kimi K3
  • Wccftech — Kimi K3 在至少一則對話中自稱 Claude
  • Fortune — Moonshot Kimi K3 與蒸餾指控背景
  • Artificial Analysis — Kimi K3 獨立評測
  • Hugging Face 社群 — Kimi K3 MXFP4 架構解析
  • Tokios — K3 地端硬體現實分析
  • Spheron — Kimi K2.7 Code 自架部署指南
  • RunAIHome — K2.7 Code 地端 VRAM 需求
  • Verdent — Kimi K3 API 快取試算
Thinking Machines 開源 Inkling:975B 多模態模型測試成績與企業部署解析
DeepSeek降價75%引爆市場|Robotaxi最後通牒|產業精選 07.13
大語言模型地端 AI 選型指南 – 2026 下半年版
Gemini 個人化影像生成免費|DeepSeek DSpark 開源加速推論|Claude Code 需關注供應鏈攻擊|產業精選 06.30 上
Anthropic 怒控 DeepSeek 等三家中國廠商發動蒸餾攻擊竊取 Claude 技術
新版 Kimi引發中國低價 AI 模型影響市場的憂慮|美國數款電動車退場|產業精選 07.19
100GbE NFS over RDMA 實戰,直連 DGX Spark 執行 DS4 大型模型突破 AI 推理儲存瓶頸
ds4 實作指引,128GB 記憶體機器搭配 NAS + Ollama 建立可落地的地端推論工作流
前 Google 執行長施密特憂心各國將因成本考量轉向採用中國開源 AI 模型
晶片禁令下的軟體突圍,矽谷新創為何轉向擁抱中國AI模型 ?
標籤: Arena.aiKimi K3Moonshot AI地端AI月之暗面開放模型
Share66Tweet42ShareShareShare12
上一篇

Linus Torvalds 親自定調:Linux 不是反 AI 專案,不滿者可自行 Fork

下一篇

Netflix 5.87億美元收購 AI 電影公司|黃仁勳訪日簽下日本生態系大單|產業精選 07.20

Chen Glenn

Chen Glenn

開發工程師,目前在北台灣的科技業任職。

相關文章

新聞

Netflix 5.87億美元收購 AI 電影公司|黃仁勳訪日簽下日本生態系大單|產業精選 07.20

2026 年 7 月 20 日
Linus Torvalds 親自定調:Linux 不是反 AI 專案,不滿者可自行 Fork
AI 人工智慧

Linus Torvalds 親自定調:Linux 不是反 AI 專案,不滿者可自行 Fork

2026 年 7 月 19 日
新聞

新版 Kimi引發中國低價 AI 模型影響市場的憂慮|美國數款電動車退場|產業精選 07.19

2026 年 7 月 19 日
Claude Fable 5 訂閱新制正式上路:Max 內含 50% 額度,Pro 改點數制並獲 100 美元補貼
AI 人工智慧

Claude Fable 5 訂閱新制正式上路:Max 內含 50% 額度,Pro 改點數制並獲 100 美元補貼

2026 年 7 月 18 日
新聞

Capital One開源AI漏洞獵人|Databricks估值衝刺1880億美元|產業精選 07.18

2026 年 7 月 18 日
Thinking Machines 開源 Inkling:975B 多模態模型測試成績與企業部署解析
AI 人工智慧

Thinking Machines 開源 Inkling:975B 多模態模型測試成績與企業部署解析

2026 年 7 月 17 日
下一篇

Netflix 5.87億美元收購 AI 電影公司|黃仁勳訪日簽下日本生態系大單|產業精選 07.20

GitHub 趨勢周報 Vol.24:AI 代理生態加速成熟,從書籍、框架到 SDK 全面落地

推薦閱讀

GitHub 趨勢周報 Vol.24:AI 代理生態加速成熟,從書籍、框架到 SDK 全面落地

2026 年 7 月 20 日

Netflix 5.87億美元收購 AI 電影公司|黃仁勳訪日簽下日本生態系大單|產業精選 07.20

2026 年 7 月 20 日
Kimi K3 開源倒數 1.4TB 權重誰跑得動?「自稱 Claude」爭議下,雲地混合是企業務實解

Kimi K3 開源倒數 1.4TB 權重誰跑得動?「自稱 Claude」爭議下,雲地混合是企業務實解

2026 年 7 月 19 日
Linus Torvalds 親自定調:Linux 不是反 AI 專案,不滿者可自行 Fork

Linus Torvalds 親自定調:Linux 不是反 AI 專案,不滿者可自行 Fork

2026 年 7 月 19 日

新版 Kimi引發中國低價 AI 模型影響市場的憂慮|美國數款電動車退場|產業精選 07.19

2026 年 7 月 19 日

近期熱門

  • 微軟發布 Windows 11 重大更新 KB5101650 導入時間點還原與螢幕色調進階護眼,修補多達 571 項安全漏洞

    微軟發布 Windows 11 重大更新 KB5101650 導入時間點還原與螢幕色調進階護眼,修補多達 571 項安全漏洞

    226 shares
    Share 90 Tweet 57
  • 深度推理的 Token 燃燒戰:從 Gemini 3.5 Pro 洩漏、Fable 5 三度延期到 OpenAI 緊急解限,透視大模型的配額焦慮

    241 shares
    Share 96 Tweet 60
  • Linus Torvalds 親自定調:Linux 不是反 AI 專案,不滿者可自行 Fork

    219 shares
    Share 88 Tweet 55
  • 打造頂級私有音樂雲:利用開源套件在 QNAP NAS 上完美部署 Roon Server

    217 shares
    Share 87 Tweet 54
  • Kimi K3 開源倒數 1.4TB 權重誰跑得動?「自稱 Claude」爭議下,雲地混合是企業務實解

    166 shares
    Share 66 Tweet 42
  • 日本 Mercari 用員工無法自行修改的設定檔,安全控管全團隊的 Claude Code 使用

    151 shares
    Share 60 Tweet 38
  • Thinking Machines 開源 Inkling:975B 多模態模型測試成績與企業部署解析

    141 shares
    Share 56 Tweet 35
  • Claude Fable 5 訂閱新制正式上路:Max 內含 50% 額度,Pro 改點數制並獲 100 美元補貼

    134 shares
    Share 54 Tweet 34
  • GitHub 趨勢周報 Vol.23:從開發工具、交易導師到對抗 AI 劣質設計的風格指南

    133 shares
    Share 53 Tweet 33
  • 新版 Kimi引發中國低價 AI 模型影響市場的憂慮|美國數款電動車退場|產業精選 07.19

    118 shares
    Share 47 Tweet 30

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。