能力全面超越前代預覽版
中國的 DeepSeek 在 2026 年 7 月 31 日在 Hugging Face 平台上以 MIT 授權釋出開放權重模型「DeepSeek V4 Flash」(版本號 DeepSeek-V4-Flash-0731)。該模型允許全球開發者與企業免費進行商業使用、修改與二次分發。該公司也開放了 DeepSeek V4 Flash 正式版應用程式介面的公開測試。開發者無須更改呼叫方式,只要將模型名稱設定為 deepseek v4 flash 即可體驗最新版本。本次發布的正式版在 9 項 Agent 代理相關的基準測試中,全面超越了先前發布的進階版「DeepSeek V4 Pro」預覽版,同時在公開的 8 項基準資料對比中,全面擊敗開源競爭對手 GLM-5.2。
這款模型的結構與 DeepSeek V4 Flash DSpark 完全相同,皆附帶了投機解碼模組,也就是用來加速大語言模型生成速度、降低推論延遲的技術。我們從下方的表格中可觀察到,儘管其啟動的參數數量遠少於 V4 Pro 預覽版,但在各項評測中表現依然勝出,可見這個最新版本的表現大幅超越先前的 V4 Pro 預覽版。在 Terminal Bench 測試中取得82.7分,NL2Repo 達到54.2分,而在 Toolathlon 驗證中也拿下70.3分的亮眼成績。

Photo Credit by https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
DeepSeek V4 Flash 採用專家混合(MoE)架構,總參數規模為 2,840 億,但在推論執行時僅啟動約 130 億參數。雖然 Hugging Face 平台顯示的總參數量為 3,040 億,其額外增加的 200 億參數來自於直接整合至模型 Checkpoint 中的 DSpark 投機解碼模組。DSpark 能在不改變生成內容品質的前提下,藉由預測後續 Token 來大幅提升生成速度。該模型支援高達 100 萬 Token 的上下文長度,官方建議在設定高推論強度時預留 38.4 萬 Token 的最大輸出空間。
針對上述公開評測表中的程式碼代理任務,官方是採用即將發布的 DeepSeek Harness 最小模式作為代理框架進行測試。在設定上採用了最大推論力度,並將溫度參數設為1,top p 參數設為0.95。
另外表格中標註的 DSBench FullStack 是內部專屬的全端開發測試集,而 DSBench Hard 則是專門用來測試高難度程式碼代理問題的內部測試集。
低成本與高效能兼具挑戰業界大廠
至於在跨模型的實際效能比較上,我們參考第三方評測機構 Artificial Analysis 針對 DeepSeek V4 Flash 0731 與 Google Gemini 3.6 Flash 的詳細分析內容。

Photo Credit by Artificial Analysis
從整體規格對比來看,兩款模型在智慧指數上皆拿到 50 分的高分,且同樣具備高達一百萬個 Token 約 1,500 頁 A4 文件的上下文長度與推理能力。至於在價格與功能定位上則展現出明顯差異,DeepSeek 每百萬 Token 價格僅需 0.06 美元,遠低於 Gemini 的 1.16 美元,並提供開源權重,Gemini 則是額外支援了影像輸入能力。

Photo Credit by Artificial Analysis
若我們再進一步觀察智慧與速度以及單次任務成本的評測圖表,在中間的輸出速度圖表中,Gemini 3.6 Flash 以每秒 220 個 token 的生成速度佔據優勢,DeepSeek V4 Flash 0731 則為每秒 62 個 token。但在最右側的單次任務加權成本圖表上,DeepSeek 展現了極大的經濟效益,每項任務成本僅0.03美元,相較於 Gemini 的 0.56 美元以及其他的頂尖閉源模型,DeepSeek 較能為需要進行大規模部署的公司節省顯著的營運開支。
| 測試項目 / 評比指標 | DeepSeek V4 Flash | GLM-5.2 (開源競品) | 表現與對比評析 |
| 業務自動化 (AutomationBench Public) | 25.1 分 | 12.9 分 | 得分呈現接近兩倍的顯著領先 |
| 工具操作能力 (Toolathlon-Verified) | 70.3 分 | 59.9 分 | 在複雜工具呼叫與操作場景優勢明確 |
| 開源模型對比 (8 項共通指標) | 8 勝 0 敗 | 0 勝 8 敗 | 在所有有資料對比的項目中全數勝出 |
| 自家 Pro 預覽版對比 (9 項 Agent 指標) | 全數超越 V4 Pro 預覽版 | – | 以五分之一體積成功反超自家高階預覽模型 |
| 頂級商業模型對比 (Claude Opus 4.8) | 未達 Claude Opus 4.8 | – | 距離頂尖閉源商業大廠模型仍有成長空間 |
在地端部署 DeepSeek V4 Flash
在硬體需求與部署方面,官方預設的 vLLM 部署參考架構需要 1 節點搭載 4 基 NVIDIA GB300(單卡搭載 288GB HBM3e 記憶體)。針對個人開發者與區域端點執行需求,社區組織 Unsloth 在發布隔日即推出 GGUF 格式的量化版本,其中最小的 1-bit(UD-IQ1_S)量化版體積僅約 82.5 GB,3-bit 量化版(約 103 GB)則可在 110 GB 的記憶體環境下平穩執行,大幅降低了在地化部署的門檻。
CyberQ 已經在地端的 NVIDIA DGX Spark GB10 上部署了這款模型,確實是可以使用,和我們之前測試 DS4 跑得動 DeepSeek V4 Flash 預覽版類似。
CyberQ 本次更新模型指令的範例為二個不同大小版本 :
hf download schlaflos/DeepSeek-V4-Flash-0731-antirez-ds4-GGUF DeepSeek-V4-Flash-0731-Layers37-42Q4KExperts-OtherExpertLayersIQ2XXSGateUp-Q2KDown-AProjQ8-SExpQ8-OutQ8-imatrix.gguf DeepSeek-V4-Flash-0731-DSpark-support.gguf –local-dir /mnt/nas/AIModels/ds4/gguf
hf download Rednalreden/DeepSeek-V4-Flash-0731-dwarfstar-q2-gguf DeepSeek-V4-Flash-0731-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8-imatrix.gguf –local-dir /mnt/nas/AIModels/ds4/gguf
下載好後,執行的指令範例為 :
./ds4-server –ctx 100000 –kv-disk-dir /var/lib/ds4-kv –kv-disk-space-mb 131072 –kv-cache-continued-interval-tokens 2048 –model /mnt/nas/AIModels/ds4/gguf/DeepSeek-V4-Flash-0731-Layers37-42Q4KExperts-OtherExpertLayersIQ2XXSGateUp-Q2KDown-AProjQ8-SExpQ8-OutQ8-imatrix.gguf –mtp /mnt/nas/AIModels/ds4/gguf/DeepSeek-V4-Flash-0731-DSpark-support.gguf –mtp-draft 1 –host 0.0.0.0 –cuda –warm-weights
DeepSeek V4 Flash 規格與部署設定對照表
| 規格與設定項目 | 詳細說明與技術參數 |
| 模型完整名稱 | DeepSeek-V4-Flash-0731 |
| 開源授權條款 | MIT License(允許商業用途、自由修改與再分發) |
| 模型架構 | MoE 專家混合架構(總參數 2,840 億,推論啟用 130 億) |
| 平台顯示參數 | 3,040 億(已預先整合約 200 億參數的 DSpark 投機解碼模組) |
| 上下文長度 | 1,000,000 Token(100 萬 Token) |
| 官方權重體積 | 約 167 GB(採 FP4 與 FP8 混合精度格式) |
| Unsloth 量化版本 | 1-bit (UD-IQ1_S) 約 82.5 GB、3-bit 約 103 GB(需求記憶體 110 GB)、4-bit 約 155.1 GB、8-bit 約 161.9 GB |
| 推論強度機制 | 提供 low、high、max 三種強度等級 |
| 建議推論參數 | Temperature 建議設為 1.0;top_p 在 Agent 應用設為 0.95,其餘應用設為 1.0 |
| 提示詞構建方式 | 未附帶 Jinja 對話樣板,需透過 encoding 資料夾中的 Python 程式碼建構 Prompt |
| 官方參考執行環境 | 單一節點配置 4 基 NVIDIA GB300 晶片,搭配 vLLM 執行架構 |
CyberQ 觀點
在人工智慧技術快速演進的今日,開源與封閉模型的競爭日益白熱化。值得注意的是,DeepSeek 在維持模型規模的前提下,僅僅透過重新訓練,便成功讓 Flash 版本的能力大幅躍進,甚至還是以超低的價格,接近業界主流的頂尖閉源模型表現,儘管離最尖端的 Opus、Fable 還有一大段距離,可是對於成績較一般的主流封閉模型來說,用戶可能會選擇用 DeepSeek 來省錢的比例會更過高,連帶著部署地端 AI 去跑 DeepSeek V4 Flash 就更有誘因了。
但是 DeepSeek 的影響力能否真正跨出開放權重模型的同溫層,撼動 AI 商業版圖?關鍵還是將取決於其在企業端實際部署的穩定性、多模態能力的擴充進度,以及背後龐大算力供應的續航力。
對台灣在地企業而言,DeepSeek V4 Flash 0731 的問世無疑是提供了一個極具吸引力的 AI 應用的切入點。如何善用這類低成本且具備高度擴展性的開源模型來加速內部工作流程自動化,已經很多開發團隊在實作和進行中了,也請靜待我們的更多實測和應用。
DeepSeek V4 Flash 官方權重下載頁面
DeepSeek V4 Flash 0731 官方 Hugging Face 儲存庫
Unsloth GGUF 量化版本下載頁面
若希望透過 llama.cpp 或 vLLM 在一般工作站與本地伺服器環境執行,建議直接選擇 Unsloth 處理好的 GGUF 格式。該儲存庫包含從最小 1-bit(UD-IQ1_S,約 82.5 GB)到 8-bit(約 161.9 GB)等格式。若設備記憶體足夠,3-bit 版(約 103 GB,建議配置 110 GB 以上記憶體)能提供相當平衡的品質與執行速度。
Unsloth GGUF 量化版 Hugging Face 儲存庫
官方發布的完整模型權重檔採用 MIT 授權,包含完整 3,040 億參數(本體 2,840 億加上預先整合的 DSpark 投機解碼模組),檔案總大小約 167 GB。本次釋出的正式版並未附帶常見的 Jinja 格式對話樣板(chat template),而是將提示詞構建邏輯改放在儲存庫內 encoding 資料夾中的 Python 腳本,地端載入推論時需改呼叫該程式碼來處理 Prompt。
首圖由 Nano Banana AI 生成,配圖由 CyberQ 自組地端 AI 生成








