DeepSeek 除了推出我們剛測試過的 DeepSeek Harness 外,也將官方 API 的 deepseek-v4-pro 端點切換至正式版 DeepSeek-V4-Pro-0813,結束了自 4 月 24 日以來將近四個月的預覽期。這次發布延續 DeepSeek 一貫的安靜上線風格,官網僅短暫掛出一段聲明,提到模型 Agent 能力顯著增強,隔日聲明便已撤下。
值得注意的是,對現有開發者而言,本次升級算是無痛升級的,除了它的 API 模型名稱維持 deepseek-v4-pro 不變,既有整合可直接自動切換到 0813 後端外,價格也暫時維持原狀。但 DeepSeek 官方已預告近期將有明顯的漲價,這點對正在評估導入的團隊是重要評估喔。
CyberQ 整理了 V4 Pro 0813 的規格與跑分表現,與目前開放權重陣營的三大巨頭 Kimi K3、GLM-5.2,以及 NVIDIA 傳出正在訓練的兆級參數 Nemotron 4 進行比較,最後也給大家我們對於這波大型開放模型浪潮,對雲端服務與大型企業地端 AI 市場影響的觀察。
DeepSeek V4 Pro 0813 規格重點
架構:MoE 混合專家,總參數 1.6 兆,每 token 啟用約 490 億,採 384 個路由專家加一個共享專家
預訓練資料量超過 32 兆 token,採混合注意力架構 (Compressed Sparse Attention 與 Heavily Compressed Attention) 以降低長上下文推論成本
上下文視窗 1,048,576 token(1M),最大輸出 384K token
支援 thinking 與 non-thinking 模式、JSON 輸出、工具呼叫、Responses API、Anthropic API 格式、chat prefix completion 與 FIM
授權採用開放權重,且是 MIT License,權重已上架 Hugging Face
定價是輸入每百萬 token 0.435 美元(cache miss)、0.003625 美元(cache hit),輸出每百萬 token 0.87 美元
併發限制為 Pro 端點 500,Flash 端點 2,500
明顯缺點是不支援視覺輸入,社群對此評價兩極
測試整體智商能力平平,但 Agent 能力有大幅增加暴衝
CyberQ 觀察,從中立的 Artificial Analysis Intelligence Index 來看,V4 Pro 0813 得分 53,與智譜 6 月發布的 GLM-5.2 持平,落後 Kimi K3(57,max 模式 60),也落後 OpenAI GPT-5.6 系列的中階 Terra 模型。以整體智商能力來看,本次更新的成績只能說還好。
但拆開看 Agent 相關基準,0813 相較 2026 年 4 月預覽版,其進步很顯著噢:
| 基準測試 | 預覽版 | 0813 正式版 |
|---|---|---|
| DeepSWE | 12.8 | 62.7 |
| CyberGym | 52.7 | 83.3 |
| Terminal Bench 2.1 | 72.1 | 87.9 |
從測試成績來看,0813 在 Terminal Bench 2.1、CyberGym、DeepSWE 與 AutomationBench 等基準上甚至超越 Claude Opus 4.8,以接近 Claude Fable 5 的 Agent 表現,價格卻只有人家的約六十分之一。特別值得資安圈注意的是,研究人員對其在 CyberGym 等資安相關任務的表現印象深刻,這與 DeepSeek 聲明強調的 Agent 能力增強是有呼應到的。
DeepSeek 這次的策略可能是把資源灌注在 agentic coding 與自動化任務上,直接瞄準 Claude Code、Codex 這類程式開發的 AI 代理工作流。官方文件也同步補上 Codex (Responses API) 與 Claude Code (Anthropic 相容端點) 的接入指南,看懂的人就知道項莊舞劍,意在沛公,意圖不言可喻。
六款大模型比較 – Kimi K3、DeepSeek V4 Pro、Qwen3.8-Max、GLM-5.2、Inkling 與即將登場的 Nemotron 4
已上線的五個可實際評估的開放模型
| Kimi K3 | DeepSeek V4 Pro 0813 | Qwen3.8-Max | GLM-5.2 | Inkling | |
|---|---|---|---|---|---|
| 開發商 | Moonshot AI | DeepSeek | 阿里巴巴 Qwen | 智譜 AI | Thinking Machines Lab |
| 總參數 | 2.8 兆 | 1.6 兆 | 2.4 兆 | 7,440 億 | 9,750 億 |
| 啟用參數 | 16/896 專家(未公布確切數) | 約 490 億 | 約 950 億 | 約 400 億 | 約 410 億 |
| 上下文 | 1M | 1M | 1M(API),開放權重版縮減 | 1M | 1M |
| 多模態 | 原生視覺 | 純文字 | API 版支援影像與影片,開放權重版只有純文字 | 純文字 | 原生文字、影像、音訊 |
| AA Index | 57(max 60) | 53 | 未列入(廠商自報基準為主) | 約 53 | 美系開放模型最高分 |
| API 定價(輸入/輸出,每百萬 token) | 2.8 / 14 美元 | 0.435 / 0.87 美元 | 2 / 6 美元 | 中間價位 | 依託管平台而定 |
| 授權 | 開放權重 | 開放權重(MIT) | 自訂 Qwen3.8-Max License(含收益分成條款) | 開放權重 | 開放權重(Apache 2.0) |
仍訓練中待推出的 NVIDIA Nemotron 4
| Nemotron 4(依 The Information 與路透報導) | |
|---|---|
| 開發商 | NVIDIA |
| 總參數 | 旗艦版至少 1 兆,約為 Nemotron 3 Ultra 的兩倍 |
| 時程 | 訓練尚未完成,最快 2026 年秋季上線 |
| 授權 | 預期開放,條款未定 (NVIDIA 過往連權重、資料集與訓練配方皆開放) |
| 投入 | Nemotron 相關雲端運算預算至 2028 會計年度上限 70 億美元 |
| 定位 | 對標中美最強開放模型,美國原產的兆級開放替代方案 |
表格資料均以近期公開資訊為準,Nemotron 4 規格屬媒體報導而非官方發布,讀者評估時請以正式發布內容為準。
CyberQ 觀察這幾個模型如下 :
Kimi K3 是能力強者,但真的貴
K3 以 2.8 兆參數成為史上最大的開放權重模型,中國 AI 新創月之暗面 Moonshot 稱之為首個「3T 級」開放模型,採 Kimi Delta Attention 與 Attention Residuals 架構,原生支援視覺功能。它在 AA Index 排名全體模型第四,超越 Claude Opus 4.8,僅次於 Claude Fable 5 與 GPT-5.6 Sol,並在 Arena.ai 網站上的 Frontend Code Arena 這類人類偏好程式開發基準登上第一。YouTube 上多數實測評比中,也顯示 K3 的實際執行成果確實優於 DeepSeek V4 Pro 0813,這與基準資料一致。但它的輸出每百萬 token 14 美元的定價,是 V4 Pro 的 16 倍,真的貴。
DeepSeek 絕對是價格破壞者
V4 Pro 0813 的定位,CyberQ 認為是夠強且便宜到有機會改變經濟模型。它低到 0.87 美元的輸出價格搭配極低的 cache hit 成本,讓高流量推論的財務模型徹底改觀。從第三方如 OpenRouter 平台的資料來看,DeepSeek 在 7 月時的 token 消耗量已僅次於 Anthropic,足見市場確實會用腳投票,選便宜又好用的方案是可預期的,關鍵任務用 Claude API ,基礎任務用 DeepSeek 來省錢也是不少公司的策略。不過 CyberQ 要提醒讀者,該公司官方已預告漲價,現在的價格優勢其實是有時間限制的囉。
Qwen3.8-Max 是利基強者,但「開放」打了折扣
前陣子發表的 Qwen3.8-Max (2.4 兆參數、95B 啟用),在 OSWorld-Verified 電腦操作基準拿下 86.1,超越 GPT-5.6 Sol Max 與 Fable 5,PaperBench 研究也以 93.0 居冠,是開放陣營中唯一在特定 Agent 利基直接壓過閉源尖端模型的選手。
但在較難灌水的 DeepSWE 上僅 56.6,程式開發實力約和 DeepSeek V4 Pro 同級而不如 K3。更大的爭議在於授權,8 月 12 日上架 Hugging Face 的開放權重版 (Qwen3.8-2.4T-A95B) ,居然被拿掉視覺輸入與 1M 上下文功能,同時授權是採用收益分潤條款的自訂授權,承諾的 27B 版本亦未如期出現,要等到 8 月 15 日才放出來,社群批評說這是 Qwen 旗艦留雲端、開放給閹割版的混合策略。企業評估導入時,務必區分 API 版與開放權重版的能力落差。
GLM-5.2 是速度與工程效率兼顧
智譜推出這款模型的 744B 總參數是中國三大開放模型中最小的,但 Artificial Analysis 實測吞吐量約 168 token/s,非常快喔,幾乎是 K3 與 V4 Pro(各約 62 token/s) 的三倍,在 SWE-bench Pro 上也居三者之首。這款模型,對延遲敏感的應用而言仍是務實選項。
Nemotron 4 可說是賣鏟子的大商人親自下場挖礦演出
NVIDIA 正在訓練 Nemotron 4 家族,旗艦版本預期至少 1 兆參數,約為現役 Nemotron 3 Ultra(550B 總參數、55B 活躍參數) 的兩倍,最快 2026 年秋季底上線,且 Nemotron 相關雲端運算預算至 2028 會計年度上限高達 70 億美元。與中國實驗室不同的是,NVIDIA 過往連權重、資料集與訓練配方都以開放授權上架 Hugging Face,並在 2026 年 3 月發起 Nemotron Coalition,集結法國的 Mistral AI、美國的Perplexity、Reflection AI 等夥伴共推開放尖端模型。
對雲端 AI 服務市場的影響
CyberQ 認為,如此一來,token 價格戰將進入第二階段。 DeepSeek V4 Flash 在 2026 年 7 月已因極端成本效率震撼矽谷,如今 Pro 正式版以接近 Fable 5 等級的 Agent 表現搭配只有約六十分之一的價格上線,對按 token 計費的閉源 API 絕對是直接的定價壓力。美國閉源廠商的護城河,將被迫往最高階能力與企業信任兩端去收縮,中間地帶的通用推論市場預期會加速商品化。
再來是預期推論代管 (inference hosting) 成為新戰場,CyberQ 指出,開放權重讓 OpenRouter、DeepInfra 這類聚合平台與各家推論供應商能同台競價,模型本身不再是獨占資產,勝負轉移到吞吐量、延遲、快取策略與工具呼叫準確率。OpenRouter 甚至已針對工具呼叫準確率推出 Exacto 路由模式,顯示市場需求已細分,業界其實也樂觀其成。
最後是Agent 工作流的模型可替換性大增。可觀察到 V4 Pro 同時支援 OpenAI Responses API 與 Anthropic API 格式,Claude Code、Codex 等既有程式開發 AI 代理幾乎可以無痛切換到 V4 Pro。對雲端服務商而言,客戶的轉換成本正在快速下降,這會反映在議價能力上。
對大型企業地端 AI 市場的影響
CyberQ 認為,這幾個影響是值得思考的。
一、MIT 授權加上兆級能力,地端部署的能力天花板大幅上修。
過去企業地端部署往往只能選擇 70B 到 200B 級模型,與尖端閉源模型存在明顯落差。如今 1.6 兆參數、Agent 表現直逼 Fable 5 的模型以 MIT 授權開放,金融、醫療、政府等受監管產業,第一次能在完全掌控資料主權的前提下,取得接近那些雲端先進模型的能力。
二、但開放不等於跑得動,硬體門檻是新的分水嶺。
可怕的是 1.6 兆參數即使以 FP8 量化,權重本身就需要 TB 級記憶體,而 2.8 兆的 K3 那更不用說了。這類模型的地端部署已不是單機工作站能夠處理的,而是多節點、高速互連的資料中心工程。以 NVIDIA DGX Spark 為例,在 128GB 統一記憶體下,能透過動態量化實戰的是 MiniMax-H3 這類規模的模型,但 V4 Pro 這種大模型的全量權重則需要 NVL72 等級的機櫃或 NVIDIA 高階顯卡多卡的伺服器叢集。
CyberQ 認為地端 AI 市場將明確分層,中小企業與部門級應用落在 100B 至 300B 級 (如 V4 Flash 的 284B ,13B 活躍參數)。而兆級全量部署,則是大型企業與主權 AI 專案的專屬市場。對 QNAP AI NAS、DGX Spark 、Mac M5 這類邊緣推論硬體而言,反而是 Flash 級與蒸餾模型生態的利多。
三、NVIDIA 的算盤打得很精,開放模型是 GPU 需求的放大器。
NVIDIA Nemotron 4 的策略邏輯很直白,免費的高品質開放模型用來降低企業導入 AI 的門檻,而各家公司導入之後,你還是要買 NVIDIA 的硬體與 CUDA 生態,模型免費送你,但是鏟子照賣,且愈大的開放模型愈需要愈大的機櫃喔。
對主權 AI 買家與成本敏感的企業而言,Nemotron 4 還多了一層意義,它是一個「美國原產」的兆級開放替代方案,不必在中國模型與閉源 API 租金之間二選一。這對各國的政府標案與敏感科技業、金融業採購尤其關鍵,過往「開放權重等於中國模型」的採購疑慮,2026年秋季底之後可能出現新解法。
四、資安治理的兩面刃。
這次 DeepSeek V4 Pro 在 CyberGym 上的高分對藍隊自動化、弱點驗證與 SOC agent 是好消息,但同等能力呢,也是落入攻擊方手中喔,所以整體風險自然也同步上升。英國 AI Security Institute 7 月的研究,即在量測開放權重模型與尖端閉源模型在網路攻防能力上的差距,所以問題不在開放模型是否危險,而在任一時點的雙方差距有多大。
CyberQ 認為,對導入地端 Agent 的企業而言,ISO 27001 情境下的模型存取控制、行為稽核與工具權限治理,將從加分題變成必考題。
延伸觀察,看美中開放模型對抗的新格局
開放權重的競爭除了先進實驗室之間的較勁,地緣分界也是既定格局發展之一。中國陣營由 Kimi K3、DeepSeek V4 Pro 與 GLM-5.2 佔據能力榜前段,美國陣營則以 Thinking Machines Lab 於 7 月推出的 Inkling (975B 總參數、41B 啟用,Apache 2.0 授權,原生多模態) 作為目前得分最高的美系開放模型回應,而 NVIDIA 秋冬之際的 Nemotron 4 將是下一張牌。
CyberQ 觀察,Inkling 在編碼與 Agent 基準仍明顯落後中國三強,但以 token 效率、可調推理力度與微調生態來說,是可以走差異化路線的。對主權 AI 買家與受監管產業,「美國原產的兆級開放模型」正在從無到有,形成一個新的採購選項,這條戰線的其他想法,我們將另文探討。
能力越大,責任越大,治理缺口的代價越高
DeepSeek V4 Pro 0813 當然不是 AI 跑分冠軍,市場上的實測也普遍認為 Kimi K3 的執行成果更好。但這次更新真正的訊息是,開放權重陣營已經有能力用六十分之一的價格,提供接近尖端等級的 AI Agent 表現,而且居然還是 MIT 授權,使用的彈性大很多。當 NVIDIA 也準備推出兆級大型開放模型,2026 下半年的競爭主軸育齊聚焦在那些開放模型的生態系,能吃下各國企業的 AI 算力預算了。
CyberQ 建議,對企業而言,現在就用 DeepSeek V4 Pro 目前的低價窗口做 PoC,漲價前先想辦法把評估資料跑完。接著,地端規劃分兩層,邊緣與部門級用 Flash 級模型,兆級需求等 Nemotron 4 條款明朗再決策。最後,請記得將 AI Agent 的權限治理與稽核機制一併納入導入範圍,能力愈強的模型,其治理缺口的代價勢必比較高。








