CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
聯繫我們
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • 熱門
  • AI 人工智慧
  • 資安
  • Docker
  • 進階應用
  • 網通
  • NAS
  • 開箱測試
  • 教學
  • 展覽直擊
首頁 新聞 AI 人工智慧

DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI

BabyQ by BabyQ
2026 年 08 月 01 日 19:20
in AI 人工智慧, 新聞
閱讀時間: 5 分鐘
A A
DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI
525
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

能力全面超越前代預覽版

中國的 DeepSeek 在 2026 年 7 月 31 日在 Hugging Face 平台上以 MIT 授權釋出開放權重模型「DeepSeek V4 Flash」(版本號 DeepSeek-V4-Flash-0731)。該模型允許全球開發者與企業免費進行商業使用、修改與二次分發。該公司也開放了 DeepSeek V4 Flash 正式版應用程式介面的公開測試。開發者無須更改呼叫方式,只要將模型名稱設定為 deepseek v4 flash 即可體驗最新版本。本次發布的正式版在 9 項 Agent 代理相關的基準測試中,全面超越了先前發布的進階版「DeepSeek V4 Pro」預覽版,同時在公開的 8 項基準資料對比中,全面擊敗開源競爭對手 GLM-5.2。

RELATED POSTS

FCC 擴大設備禁令海外先進機器人與電源逆變器入列

AI Agent 失控連環爆:OpenAI 與 Anthropic 模型雙雙突破隔離|Thinking Machines 縮小模型受矚目|產業精選 08.01

Anthropic安全評估出包 三款Claude模型誤駭三家組織系統

這款模型的結構與 DeepSeek V4 Flash DSpark 完全相同,皆附帶了投機解碼模組,也就是用來加速大語言模型生成速度、降低推論延遲的技術。我們從下方的表格中可觀察到,儘管其啟動的參數數量遠少於 V4 Pro 預覽版,但在各項評測中表現依然勝出,可見這個最新版本的表現大幅超越先前的 V4 Pro 預覽版。在 Terminal Bench 測試中取得82.7分,NL2Repo 達到54.2分,而在 Toolathlon 驗證中也拿下70.3分的亮眼成績。

Photo Credit by https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

DeepSeek V4 Flash 採用專家混合(MoE)架構,總參數規模為 2,840 億,但在推論執行時僅啟動約 130 億參數。雖然 Hugging Face 平台顯示的總參數量為 3,040 億,其額外增加的 200 億參數來自於直接整合至模型 Checkpoint 中的 DSpark 投機解碼模組。DSpark 能在不改變生成內容品質的前提下,藉由預測後續 Token 來大幅提升生成速度。該模型支援高達 100 萬 Token 的上下文長度,官方建議在設定高推論強度時預留 38.4 萬 Token 的最大輸出空間。

針對上述公開評測表中的程式碼代理任務,官方是採用即將發布的 DeepSeek Harness 最小模式作為代理框架進行測試。在設定上採用了最大推論力度,並將溫度參數設為1,top p 參數設為0.95。

另外表格中標註的 DSBench FullStack 是內部專屬的全端開發測試集,而 DSBench Hard 則是專門用來測試高難度程式碼代理問題的內部測試集。

低成本與高效能兼具挑戰業界大廠

至於在跨模型的實際效能比較上,我們參考第三方評測機構 Artificial Analysis 針對 DeepSeek V4 Flash 0731 與 Google Gemini 3.6 Flash 的詳細分析內容。

Photo Credit by Artificial Analysis

從整體規格對比來看,兩款模型在智慧指數上皆拿到 50 分的高分,且同樣具備高達一百萬個 Token 約 1,500 頁 A4 文件的上下文長度與推理能力。至於在價格與功能定位上則展現出明顯差異,DeepSeek 每百萬 Token 價格僅需 0.06 美元,遠低於 Gemini 的 1.16 美元,並提供開源權重,Gemini 則是額外支援了影像輸入能力。

Photo Credit by Artificial Analysis

若我們再進一步觀察智慧與速度以及單次任務成本的評測圖表,在中間的輸出速度圖表中,Gemini 3.6 Flash 以每秒 220 個 token 的生成速度佔據優勢,DeepSeek V4 Flash 0731 則為每秒 62 個 token。但在最右側的單次任務加權成本圖表上,DeepSeek 展現了極大的經濟效益,每項任務成本僅0.03美元,相較於 Gemini 的 0.56 美元以及其他的頂尖閉源模型,DeepSeek 較能為需要進行大規模部署的公司節省顯著的營運開支。

測試項目 / 評比指標DeepSeek V4 FlashGLM-5.2 (開源競品)表現與對比評析
業務自動化 (AutomationBench Public)25.1 分12.9 分得分呈現接近兩倍的顯著領先
工具操作能力 (Toolathlon-Verified)70.3 分59.9 分在複雜工具呼叫與操作場景優勢明確
開源模型對比 (8 項共通指標)8 勝 0 敗0 勝 8 敗在所有有資料對比的項目中全數勝出
自家 Pro 預覽版對比 (9 項 Agent 指標)全數超越 V4 Pro 預覽版–以五分之一體積成功反超自家高階預覽模型
頂級商業模型對比 (Claude Opus 4.8)未達 Claude Opus 4.8–距離頂尖閉源商業大廠模型仍有成長空間

在地端部署 DeepSeek V4 Flash

在硬體需求與部署方面,官方預設的 vLLM 部署參考架構需要 1 節點搭載 4 基 NVIDIA GB300(單卡搭載 288GB HBM3e 記憶體)。針對個人開發者與區域端點執行需求,社區組織 Unsloth 在發布隔日即推出 GGUF 格式的量化版本,其中最小的 1-bit(UD-IQ1_S)量化版體積僅約 82.5 GB,3-bit 量化版(約 103 GB)則可在 110 GB 的記憶體環境下平穩執行,大幅降低了在地化部署的門檻。

CyberQ 已經在地端的 NVIDIA DGX Spark GB10 上部署了這款模型,確實是可以使用,和我們之前測試 DS4 跑得動 DeepSeek V4 Flash 預覽版類似。

CyberQ 本次更新模型指令的範例為二個不同大小版本 :

hf download schlaflos/DeepSeek-V4-Flash-0731-antirez-ds4-GGUF DeepSeek-V4-Flash-0731-Layers37-42Q4KExperts-OtherExpertLayersIQ2XXSGateUp-Q2KDown-AProjQ8-SExpQ8-OutQ8-imatrix.gguf DeepSeek-V4-Flash-0731-DSpark-support.gguf –local-dir /mnt/nas/AIModels/ds4/gguf

hf download Rednalreden/DeepSeek-V4-Flash-0731-dwarfstar-q2-gguf DeepSeek-V4-Flash-0731-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8-imatrix.gguf –local-dir /mnt/nas/AIModels/ds4/gguf

下載好後,執行的指令範例為 :

./ds4-server –ctx 100000 –kv-disk-dir /var/lib/ds4-kv –kv-disk-space-mb 131072 –kv-cache-continued-interval-tokens 2048 –model /mnt/nas/AIModels/ds4/gguf/DeepSeek-V4-Flash-0731-Layers37-42Q4KExperts-OtherExpertLayersIQ2XXSGateUp-Q2KDown-AProjQ8-SExpQ8-OutQ8-imatrix.gguf –mtp /mnt/nas/AIModels/ds4/gguf/DeepSeek-V4-Flash-0731-DSpark-support.gguf –mtp-draft 1 –host 0.0.0.0 –cuda –warm-weights

DeepSeek V4 Flash 規格與部署設定對照表

規格與設定項目詳細說明與技術參數
模型完整名稱DeepSeek-V4-Flash-0731
開源授權條款MIT License(允許商業用途、自由修改與再分發)
模型架構MoE 專家混合架構(總參數 2,840 億,推論啟用 130 億)
平台顯示參數3,040 億(已預先整合約 200 億參數的 DSpark 投機解碼模組)
上下文長度1,000,000 Token(100 萬 Token)
官方權重體積約 167 GB(採 FP4 與 FP8 混合精度格式)
Unsloth 量化版本1-bit (UD-IQ1_S) 約 82.5 GB、3-bit 約 103 GB(需求記憶體 110 GB)、4-bit 約 155.1 GB、8-bit 約 161.9 GB
推論強度機制提供 low、high、max 三種強度等級
建議推論參數Temperature 建議設為 1.0;top_p 在 Agent 應用設為 0.95,其餘應用設為 1.0
提示詞構建方式未附帶 Jinja 對話樣板,需透過 encoding 資料夾中的 Python 程式碼建構 Prompt
官方參考執行環境單一節點配置 4 基 NVIDIA GB300 晶片,搭配 vLLM 執行架構

CyberQ 觀點

在人工智慧技術快速演進的今日,開源與封閉模型的競爭日益白熱化。值得注意的是,DeepSeek 在維持模型規模的前提下,僅僅透過重新訓練,便成功讓 Flash 版本的能力大幅躍進,甚至還是以超低的價格,接近業界主流的頂尖閉源模型表現,儘管離最尖端的 Opus、Fable 還有一大段距離,可是對於成績較一般的主流封閉模型來說,用戶可能會選擇用 DeepSeek 來省錢的比例會更過高,連帶著部署地端 AI 去跑 DeepSeek V4 Flash 就更有誘因了。

但是 DeepSeek 的影響力能否真正跨出開放權重模型的同溫層,撼動 AI 商業版圖?關鍵還是將取決於其在企業端實際部署的穩定性、多模態能力的擴充進度,以及背後龐大算力供應的續航力。

對台灣在地企業而言,DeepSeek V4 Flash 0731 的問世無疑是提供了一個極具吸引力的 AI 應用的切入點。如何善用這類低成本且具備高度擴展性的開源模型來加速內部工作流程自動化,已經很多開發團隊在實作和進行中了,也請靜待我們的更多實測和應用。

DeepSeek V4 Flash 官方權重下載頁面

DeepSeek V4 Flash 0731 官方 Hugging Face 儲存庫

Unsloth GGUF 量化版本下載頁面

若希望透過 llama.cpp 或 vLLM 在一般工作站與本地伺服器環境執行,建議直接選擇 Unsloth 處理好的 GGUF 格式。該儲存庫包含從最小 1-bit(UD-IQ1_S,約 82.5 GB)到 8-bit(約 161.9 GB)等格式。若設備記憶體足夠,3-bit 版(約 103 GB,建議配置 110 GB 以上記憶體)能提供相當平衡的品質與執行速度。

Unsloth GGUF 量化版 Hugging Face 儲存庫

官方發布的完整模型權重檔採用 MIT 授權,包含完整 3,040 億參數(本體 2,840 億加上預先整合的 DSpark 投機解碼模組),檔案總大小約 167 GB。本次釋出的正式版並未附帶常見的 Jinja 格式對話樣板(chat template),而是將提示詞構建邏輯改放在儲存庫內 encoding 資料夾中的 Python 腳本,地端載入推論時需改呼叫該程式碼來處理 Prompt。

首圖由 Nano Banana AI 生成,配圖由 CyberQ 自組地端 AI 生成

DeepSeek降價75%引爆市場|Robotaxi最後通牒|產業精選 07.13
Anthropic 怒控 DeepSeek 等三家中國廠商發動蒸餾攻擊竊取 Claude 技術
Kimi K3 開源倒數 1.4TB 權重誰跑得動?「自稱 Claude」爭議下,雲地混合是企業務實解
100GbE NFS over RDMA 實戰,直連 DGX Spark 執行 DS4 大型模型突破 AI 推理儲存瓶頸
標籤: DeepSeek V4 FlashGemini 3.6 FlashLLM推論成本大語言模型評測投機解碼
Share6Tweet4ShareShareShare1
上一篇

FCC 擴大設備禁令海外先進機器人與電源逆變器入列

BabyQ

BabyQ

IT 工程師,專長是資訊系統管理、企業 AI Infra、雲端服務,協助客戶解決問題。 Switch 轉 Steam 新手用戶,夢想是看極光、大堡礁、冰山、熔岩等地球美景。

相關文章

FCC 擴大設備禁令海外先進機器人與電源逆變器入列
新聞

FCC 擴大設備禁令海外先進機器人與電源逆變器入列

2026 年 8 月 1 日
新聞

AI Agent 失控連環爆:OpenAI 與 Anthropic 模型雙雙突破隔離|Thinking Machines 縮小模型受矚目|產業精選 08.01

2026 年 8 月 1 日
Anthropic安全評估出包 三款Claude模型誤駭三家組織系統
AI 人工智慧

Anthropic安全評估出包 三款Claude模型誤駭三家組織系統

2026 年 7 月 31 日
新聞

Apple 庫存翻倍備戰供應鏈短缺|GPT-5.6 Luna 降價 80%|Reddit財報顯AI衝擊|產業精選 07.31

2026 年 7 月 31 日
新聞

Zuckerberg 預測個人 AI 代理五年內普及|微軟 AI 投資兩樣情|產業精選 07.30

2026 年 7 月 30 日
微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析
新聞

微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

2026 年 7 月 30 日

推薦閱讀

DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI

DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI

2026 年 8 月 1 日
FCC 擴大設備禁令海外先進機器人與電源逆變器入列

FCC 擴大設備禁令海外先進機器人與電源逆變器入列

2026 年 8 月 1 日

AI Agent 失控連環爆:OpenAI 與 Anthropic 模型雙雙突破隔離|Thinking Machines 縮小模型受矚目|產業精選 08.01

2026 年 8 月 1 日
Anthropic安全評估出包 三款Claude模型誤駭三家組織系統

Anthropic安全評估出包 三款Claude模型誤駭三家組織系統

2026 年 7 月 31 日
QNAP AI NAS Edge AI 方案與自建 DGX Spark 地端 LLM 架構比較

QNAP AI NAS Edge AI 方案與自建 DGX Spark 地端 LLM 架構比較

2026 年 7 月 31 日

近期熱門

  • 告別隨意寫程式!Matt Pocock 推出 grill-me 技能,讓 AI 成為最嚴苛的架構審查官

    告別隨意寫程式!Matt Pocock 推出 grill-me 技能,讓 AI 成為最嚴苛的架構審查官

    370 shares
    Share 148 Tweet 93
  • GitHub 趨勢周報 Vol.25:去中心化通訊與AI代理工具

    172 shares
    Share 69 Tweet 43
  • 微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

    171 shares
    Share 68 Tweet 43
  • 梁文鋒近 4 小時閉門會議紀要外洩:解密 DeepSeek 的 AGI 藍圖與融資暫停風波

    147 shares
    Share 59 Tweet 37
  • Claude 對話意外被 Google 索引外流、微軟推 AI 資安平台|產業精選 07.28

    120 shares
    Share 48 Tweet 30
  • 實戰指南:HDP Recovery Media Creator 打造 ISO 還原媒體,NAS 虛擬機沙盒完成 0 錯誤演練

    112 shares
    Share 45 Tweet 28
  • 實戰指南:Tailscale + QNAP 打造免網管跨國協作圈與檔案分享

    127 shares
    Share 51 Tweet 32
  • Anthropic 砍掉 Claude Code 八成系統提示詞:Claude 5 世代的 Context Engineering 新規則

    98 shares
    Share 39 Tweet 25
  • FCC 擴大設備禁令海外先進機器人與電源逆變器入列

    89 shares
    Share 36 Tweet 22
  • Zuckerberg 預測個人 AI 代理五年內普及|微軟 AI 投資兩樣情|產業精選 07.30

    89 shares
    Share 36 Tweet 22

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。