CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
聯繫我們
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • 熱門
  • AI 人工智慧
  • 資安
  • Docker
  • 進階應用
  • 網通
  • NAS
  • 開箱測試
  • 教學
  • 展覽直擊
首頁 進階應用 AI 應用實戰

在兩台 DGX Spark 上跑 DeepSeek-V4-Flash:DSpark 值得開,最高加速 57 %

BabyQ by BabyQ
2026 年 08 月 19 日 21:00
in AI 應用實戰
閱讀時間: 4 分鐘
A A
在兩台 DGX Spark 上跑 DeepSeek-V4-Flash:DSpark 值得開,最高加速 57 %
4.7k
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

如果你在 GB10 上用 vLLM 跑 DeepSeek-V4-Flash,投機解碼應該開。CyberQ 在雙機 GB10 中測試到的加速是 1.44–1.57 倍,代價之一是延遲變得不可預測。但這篇要講的重點並不是開投機解碼加速這件事,而是我們碰到官方版不支援,改用社群配方,但社群配方沒寫的兩個坑,以及一個我們自己記錄在案後,又被推翻的預測。

RELATED POSTS

GB10 上的模型權重該放 SSD 還是 NAS?儲存路徑測試大作戰

DeepSeek-V4-Flash-0731 在 GB10 上的取樣/投機解碼實測

實測 Qwen3.8-27B,在 DGX Spark 上的投機解碼到底能快多少?

CyberQ 本次測試的硬體是兩台 DGX Spark(GB10,sm_121,每台 128GB 統一記憶體),中間一條 QSFP28 DAC 直連,實測 iperf3 99.0 Gbit/s、NCCL all-reduce busbw 12.19 GB/s(線速的 97.5%)。
兩台跑 vLLM 的跨機 TP=2,模型是官方 deepseek-ai/DeepSeek-V4-Flash-0731,167 GB / 48 shards。

實測數值參考

同一支 bench、同一組協定(/v1/completions、貪婪、ignore_eos 固定 800 token、暖機一次後取三次),只切換投機解碼:

組態decode 中位數組內散布draft 接受率
無投機26.57 tok/s0.96%—
DSpark(5 draft tokens)× 4 次重跑38.28 / 39.97 / 40.34 / 41.656–27%30.2–37.7%
DSpark,第一次執行69.3036.5%64.8%

那個 69.30 是離群值,不要拿它規劃容量,重跑四次之後,典型值穩定落在 38–42,接受率 30–38%。加速倍率約莫是 1.44–1.57 倍,而不是首次量到的 2.61 倍。

值得注意的是散布,無投機那組測試成績的散布只有 0.96%,而投機組是 6–27%。CyberQ 實測認為,模型本身的解碼速度非常穩定,所有的不確定性都來自 draft 接受率,而草稿模型提出資料在主模型的接受率取決於生成內容的可預測性。所以投機解碼開起來後我們獲得的並不是更穩定更快速,而是平均跑起來更快、但單次則不保證的效果。

對互動式對話如 Open WebUI 這種介面來說,開這個是划算的,但對需要可預測延遲的批次工作,得自己再權衡一下。

一般的 vLLM 跑不起來

CyberQ 原本用vllm/vllm-openai 映像(0.26.1rc1),這款映像在同樣兩台機器上跑 Qwen3-235B-A22B、Mistral-Small-4-119B、Qwen3.8-27B 都沒問題,跨機 TP=2 一切正常。但 DeepSeek-V4 起不來,能力檢查說支援,編譯好的 kernel 說不支援。

改用社群版本才能跑

官方版的開不起來,因此換成有 sm_121 kernel 的映像就可以,社群上至少有三組專案是做出來的:

來源映像回報
MiaAI-Labghcr.io/anemll/dspark-vllm-gx10:0.1.1單聊 62–83 tok/s
hazyumpshazyumps/deepseek-v4-flash-gb10:sm121-cu130-…(jasl/vllm fork)40–60 tok/s
elsungaidendle94/sparkrun-vllm-ds4-gb10:production-v2~41 tok/s 單流

CyberQ 後來選用 MiaAI-Lab 的方案,它的關鍵在recipe/overlay/vllm/models/deepseek_v4/nvidia/sm120.py,用覆蓋檔換掉整個模型實作,並且 DeepGEMM 走執行期 JIT 編譯而非預編的 sm90/sm100 二進位。

值得一提的是,把三家的數字跟我們的重跑並排之後,elsung 的 ~41 最接近我們的典型值,而 62–83 那個範圍對應到我們的離群值。這不是說誰的好誰的不好,而是說這個工作負載的變異就是這麼大,單次量測在這裡沒有意義。

配方沒寫但會踩到的兩個坑

一、docker save | ssh docker load 會丟掉 registry digest。

配方的 .env 用 digest 釘住映像,這是對的做法,兩台跑不同版本是最難查的故障。
但如果你像我們一樣,是在一台上 docker pull 之後用 docker save | ssh … docker load送到第二台(這樣可省一次網際網路的下載),那台的映像只會保留 image ID,不會有 RepoDigests,於是啟動腳本開起來後會報 No such image 的錯誤。

因此要確認兩台的 image ID 一致(docker images --no-trunc)之後改用 tag 即可。

二、JIT 快取不能放在共用儲存上。

compose 把 VLLM_CACHE_ROOT 寫死在 HF cache 掛載點裡面(/cache/huggingface/vllm-cache)。這在「每台各有一份 HF cache」的前提下沒問題。
但我們為了不重複存放 167 GB,把 HF cache 放在共用的 NFS 上,結果兩個 rank
同時 JIT 編譯到同一個目錄,worker 會掛在這裡:

RuntimeError: Assertion error (/workspace/.deps/deepgemm-src/csrc/apis/../jit_kernels/impls/../../jit/compiler.hpp:147): runtime != nullptr

而搶贏的 head 活得好好的,只是接下來每 60 秒印一次
No available shared memory broadcast block found。
這是比較難找出問題的一種 error 型態,GB10 的雙機 AI 算力叢集變成只起來一半。

解法呢,需要把 JIT 快取改成每台本機目錄(我們用 /jitcache 加一個 bind mount),編完各約 6.6 MB。兩台日誌裡的 Profiling CUDA graph memory 那行必須一模一樣,跑起來才是正確的。

一個要更正的預測

我們先前在同一組 GB10 雙機硬體叢集上測了三款不同廠商的 LLM 模型,本來有歸納出一條兩項式:

每 token 時間 = 權重位元組 / 518 GB/s + 層數 × 0.217 ms

係數只用 Qwen3.8-27B 與 Mistral-Small-4 兩點解出,而 Qwen3-235B-A22B 完全沒有參與擬合,預測 24.0 對實測 23.83,誤差 0.7%。518 GB/s 正好是兩台 GB10 記憶體頻寬的總和。

在量測 DeepSeek-V4-Flash 之前,我們用它推出無投機應該有 35.1 tok/s(活躍位元組 9.93 GB/token 是拆 safetensors 標頭算的,routed experts 是 NVFP4,但 attention 與 shared experts 在 quantization_config.ignore 裡、沒有量化)。

結果實測是 26.57 tok/s,高估 24.3%。

若保留每層 0.217 ms 的項反推,這款的等效頻寬只有 351 GB/s,是前三款模型的 68%。可能的原因我們沒有逐一驗證,這款跑在不同的 vLLM build(anemll 的 0.25.2.dev0,而係數是在 0.26.1rc1 上擬合的),MLA 與 hyper-connection 的每層計算不是純頻寬項能夠描述的,活躍位元組的估算也可能低於 MoE 實際的記憶體存取量。

誠實說明這條算式在同一款映像、三種架構上內插準到 0.7%,換 build 又換架構之後高估 24%。它是同組態下的內插工具,不是跨 build 的預測工具。

所以,該開投機加速嗎?

確實在這個架構該開,1.44–1.57 倍是實際有加速的,而且不需要額外記憶體(draft 模型只有 96 個參數張量,出廠就附在 checkpoint 裡),這點和之前做另一個模型測試的情況又不太一樣,但如果要成功實作起來,請照著這幾點做:

不要用單次量測規劃容量。我們第一次量到 2.61 倍,重跑四次都是 1.5 倍左右。接受率從 30% 到 65% 都出現過。

無投機的基準也要量。沒有它,你不知道投機到底幫你換到多少加速效益,也無法判斷某次變慢是接受率掉了還是別的問題。

注意延遲的可預測性。 投機把散布從 1% 拉到 6–27%。互動式對話划算,需要穩定延遲的場景要自己權衡。

量測要用同一支腳本、同一組協定。 這篇所有數字都出自同一支 bench,這是跨組態比較能成立的唯一前提。

DeepSeek-V4-Flash-0731 在 GB10 上的取樣/投機解碼實測
GB10 上的模型權重該放 SSD 還是 QNAP NAS?儲存路徑測試大作戰
實測 Qwen3.8-27B,在 DGX Spark 上的投機解碼到底能快多少?
DeepSeek Harness 開發者預覽版 + GB10 本機模型的 Agentic 實戰
DGX Spark 實戰 Muse-Glimmer-30B:NVFP4 + DFlash 讓本地 AI Agent 速度提升 6 倍
DGX Spark + NAS 實測 Muse-Glimmer-30B 跑 AIME 2026 對照 Meta 官方數字
大語言模型地端 AI 選型指南 – 2026 下半年版
解放 16GB VRAM 臨界點!Windows 11 實測 llama.cpp 跑 Qwen 3.6 27B 的 MTP 加速
部署 Hermes Agent 實戰,24 小時不間斷的地端自動化 AI 助理
ds4 實作指引,128GB 記憶體機器搭配 NAS + Ollama 建立可落地的地端推論工作流
100GbE NFS over RDMA 實戰,直連 DGX Spark 執行 DS4 大型模型突破 AI 推理儲存瓶頸
標籤: AIDeepSeekDeepSeek V4 FlashDGX SparkMTPNVIDIAvLLM雙機 GB10
Share56Tweet35ShareShareShare10
上一篇

GB10 上的模型權重該放 SSD 還是 NAS?儲存路徑測試大作戰

下一篇

Stripe 收購 OpenRouter 的真實盤算|Waymo 平價自駕車全面開放|產業精選 08.20

BabyQ

BabyQ

IT 工程師,專長是資訊系統管理、企業 AI Infra、雲端服務,協助客戶解決問題。 Switch 轉 Steam 新手用戶,夢想是看極光、大堡礁、冰山、熔岩等地球美景。

相關文章

GB10 上的模型權重該放 SSD 還是 NAS?儲存路徑測試大作戰
AI 應用實戰

GB10 上的模型權重該放 SSD 還是 NAS?儲存路徑測試大作戰

2026 年 8 月 19 日
DeepSeek-V4-Flash-0731 在 GB10 上的取樣/投機解碼實測
AI 代理

DeepSeek-V4-Flash-0731 在 GB10 上的取樣/投機解碼實測

2026 年 8 月 16 日
實測 Qwen3.8-27B,在 DGX Spark 上的投機解碼到底能快多少?
AI 應用實戰

實測 Qwen3.8-27B,在 DGX Spark 上的投機解碼到底能快多少?

2026 年 8 月 16 日
DeepSeek Harness 開發者預覽版 + GB10 本機模型的 Agentic 實戰
AI 應用實戰

DeepSeek Harness 開發者預覽版 + GB10 本機模型的 Agentic 實戰

2026 年 8 月 14 日
同量級速度卻差 14 倍?LTX-2.5 與 MiniMax-H3 在 DGX Spark 上的 ComfyUI 部署實測
AI 應用實戰

同量級速度卻差 14 倍?LTX-2.5 與 MiniMax-H3 在 DGX Spark 上的 ComfyUI 部署實測

2026 年 8 月 13 日
DGX Spark 實戰 Muse-Glimmer-30B:NVFP4 + DFlash 讓本地 AI Agent 速度提升 6 倍
AI 代理

DGX Spark 實戰 Muse-Glimmer-30B:NVFP4 + DFlash 讓本地 AI Agent 速度提升 6 倍

2026 年 8 月 12 日
下一篇

Stripe 收購 OpenRouter 的真實盤算|Waymo 平價自駕車全面開放|產業精選 08.20

WordPress 7.1 正式發布,回應式樣式與瀏覽器端媒體處理登場

WordPress 7.1 正式發布,回應式樣式與瀏覽器端媒體處理登場

推薦閱讀

WordPress 7.1 正式發布,回應式樣式與瀏覽器端媒體處理登場

WordPress 7.1 正式發布,回應式樣式與瀏覽器端媒體處理登場

2026 年 8 月 20 日

Stripe 收購 OpenRouter 的真實盤算|Waymo 平價自駕車全面開放|產業精選 08.20

2026 年 8 月 20 日
在兩台 DGX Spark 上跑 DeepSeek-V4-Flash:DSpark 值得開,最高加速 57 %

在兩台 DGX Spark 上跑 DeepSeek-V4-Flash:DSpark 值得開,最高加速 57 %

2026 年 8 月 19 日
GB10 上的模型權重該放 SSD 還是 NAS?儲存路徑測試大作戰

GB10 上的模型權重該放 SSD 還是 NAS?儲存路徑測試大作戰

2026 年 8 月 19 日

Cursor 挑戰 GitHub 霸主地位|產業精選 08.19

2026 年 8 月 19 日

近期熱門

  • 實測 Qwen3.8-27B,在 DGX Spark 上的投機解碼到底能快多少?

    實測 Qwen3.8-27B,在 DGX Spark 上的投機解碼到底能快多少?

    261 shares
    Share 104 Tweet 65
  • DeepSeek Harness 開發者預覽版 + GB10 本機模型的 Agentic 實戰

    195 shares
    Share 78 Tweet 49
  • DeepSeek V4 Pro 0813 正式版上線:跑分輸 Kimi K3,卻可能改寫雲端與地端 AI 的成本結構

    177 shares
    Share 71 Tweet 44
  • AI代理人互動量可能超越人類

    153 shares
    Share 61 Tweet 38
  • 在兩台 DGX Spark 上跑 DeepSeek-V4-Flash:DSpark 值得開,最高加速 57 %

    141 shares
    Share 56 Tweet 35
  • GitHub 趨勢周報 Vol.28:DeepSeek Harness 五日破十五萬星,插件生態一週成形

    140 shares
    Share 56 Tweet 35
  • 算力即權力?從「每焦耳智慧」看 AI 的集權迷思與去中心化未來

    139 shares
    Share 56 Tweet 35
  • DeepSeek-V4-Flash-0731 在 GB10 上的取樣/投機解碼實測

    128 shares
    Share 51 Tweet 32
  • Google推出Gemini 3.7 Flash模型 提升程式開發與AI代理效能

    121 shares
    Share 48 Tweet 30
  • GB10 上的模型權重該放 SSD 還是 NAS?儲存路徑測試大作戰

    106 shares
    Share 42 Tweet 27

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。