128GB 版一年內從 3,999 漲到 6,950 美元,兩台 64GB 組叢集是否划算?附雙機實測
Nvidia 於 2026 年 10 月 2 日宣布 DGX Spark 新增 64GB 統一記憶體版本,10 月 23 日起由 Acer、ASUS、Dell、Gigabyte、HP 與 MSI 六家合作夥伴獨家銷售,起價 4,999 美元(NVIDIA Blog)。同日,The Register 報導 Nvidia 將 128GB 版本售價調高至 6,950 美元,較一年前 3,999 美元的上市價高出近 75%。
新版本沿用 GB10 Grace Blackwell 超級晶片、DGX OS 與完整的 NVIDIA AI 軟體堆疊,單機可執行最高約 1,000 億參數的模型。兩台透過內建 ConnectX-7 網卡以 QSFP 線直連,再由 NVIDIA Sync Cluster Assistant 組成叢集後,記憶體合併為 128GB,模型支援上限提升至約 2,000 億參數(NVIDIA Blog)。
換言之,記憶體減半的新款,售價仍比 2025 年 128GB 版本的上市價高出 1,000 美元。對已經在本地部署 LLM 、地端 AI 的開發者而言,這則消息的重點並非新產品本身,而是 DRAM 供應吃緊已經直接反映在終端硬體的規格與定價上。本文末段有 DGX Spark 雙機實測心得與 64GB 採購和使用建議。
DGX Spark 規格與售價對照
兩個版本除了記憶體與儲存容量,其餘規格相同。CyberQ 認為,記憶體頻寬維持 273 GB/s 不變,代表 Nvidia 採用的是較低容量的 LPDDR5X 顆粒,而非減少顆粒數量。
| 項目 | DGX Spark 64GB | DGX Spark 128GB |
|---|---|---|
| 統一記憶體 | 64GB LPDDR5X | 128GB LPDDR5X |
| 記憶體頻寬 | 273 GB/s | 273 GB/s |
| 處理器 | GB10 Grace Blackwell 超級晶片,20 核 Arm CPU(聯發科) | 同左 |
| 儲存 | 128GB 版的一半 | 4TB SSD(Founders Edition) |
| 網路 | ConnectX-7,200 GbE,可叢集至 4 台 | 同左 |
| 單機模型上限 | 約 1,000 億參數 | 約 2,000 億參數 |
| 銷售通路 | 僅限 Acer、ASUS、Dell、Gigabyte、HP、MSI | Nvidia 直營與合作夥伴 |
| 上市日期 | 2026 年 10 月 23 日 | 2025 年 10 月 15 日 |
| 官方起價 | 4,999 美元 | 6,950 美元(2026 年 10 月 2 日起) |
以上資料來源為 NVIDIA Blog 與 The Register。128GB 版本 4TB SSD 規格引自 tbreak。
CyberQ 觀察 DGX Spark 128GB 版本已經調整價格至少兩次,市售價格前陣子更是水漲船高,即便是設備的二手價格仍維持不錯的狀態。
| 時間 | 128GB 版本售價 | 說明 |
|---|---|---|
| 2025 年 1 月 | 約 3,000 美元 | CES 公布 Project Digits 概念時的預期價格(The Register) |
| 2025 年 10 月 | 3,999 美元 | Founders Edition 上市價 |
| 2026 年 2 月 | 4,699 美元 | 調漲 18%,Nvidia 歸因於全產業記憶體供應限制(TipRanks 引述) |
| 2026 年 10 月 | 6,950 美元 | 較上市價高出近 75%(The Register) |
Tom’s Hardware 的報導另指出,市面上有現貨的 128GB GB10 系統實際成交價約在 7,000 至 9,000 美元之間,且 4,999 美元的新款定價在記憶體與儲存價格快速變動下未必能維持。
價格背後的記憶體荒
Nvidia 這次調價的時間點,正好落在 Micron 公布 2026 會計年度財報的隔天。根據 The Register 的說法,Micron 執行長 Sanjay Mehrotra 在法說會上表示,明年將生產的記憶體大多已經售出,客戶將支付比今年高出許多的價格。他進一步指出,2027 與 2028 年的需求仍將超過供給,產業緊俏程度會比 2026 年更嚴重,且公司目前看不到供需何時能恢復平衡。
財報數字反映了這個趨勢。Micron 第四季營收 542.5 億美元,去年同期為 113 億美元。全年營收 1,332 億美元,去年為 374 億美元。以 HBM 為主的雲端記憶體事業部第四季毛利率達 83%,去年同期為 59%。核心資料中心事業部毛利率達 90%,去年同期為 41%(The Register)。
Micron 計畫在 2028 年讓新廠投產,新財年上半年資本支出預計 250 億美元,但高層坦言新產能短期內無法改善供應或壓低價格。Mehrotra 也提到 HBM 需求成長速度快於伺服器 DRAM,Micron 正與 Nvidia 合作開發業界首款客製化 HBM4E,將用於下一代 GPU 與 NVLink Fusion 平台。
換句話說,記憶體廠的產能正優先流向資料中心的 HBM 與伺服器 DRAM。DGX Spark 使用的 LPDDR5X 屬於行動與邊緣裝置用途,在這波排擠效應下,Nvidia 以減半容量維持入門價位,屬於可預期的因應方式。同一週,The Register 也報導 2GB 版本的 Raspberry Pi 4 售價已從原本的 35 美元漲至 67.5 美元,顯示記憶體供應吃緊繼續擴大到整個消費性與開發板市場。
64GB 能跑什麼,叢集的算盤怎麼打
Nvidia 在這篇 NVIDIA Blog 的論點是,260 億至 350 億參數級的開放模型已足以驅動本地代理工作,並以 Qwen 3.8 27B 為例(The Register)。官方部落格列出的開箱即用軟體包括 NVIDIA Agent Toolkit、CUDA-X 函式庫、Nemotron 開放模型,以及 Ollama、vLLM、PyTorch、llama.cpp 與 LM Studio 等推論框架。Blender 也將提供預建安裝程式。
CyberQ 實測指出,Qwen 3.8 27B 與 Nemotron 3.5 Lightning 30B-A3B 等熱門模型確實能在 64GB 內執行,但這類模型多數在 16GB VRAM 的獨立顯示卡上也能跑,且效能更好,官方公告並未提及這一點。另外,64GB 版本因容量限制,較不適合微調等需要大量記憶體的工作負載。
叢集方面,Nvidia 宣稱兩台 64GB 直連後記憶體頻寬加倍,以 Qwen 3.8 27B 測試可達單機 1.7 倍效能。2026 10月底推出的 NVIDIA Sync Model Launcher 將可一鍵下載並啟動 Qwen3.8 27B,並自動設定 OpenCode 連接該模型。vLLM 服務、OpenClaw 本地 LLM 與多台 DGX Spark 分散式工作負載等 64GB 專用 playbook 則標示為即將推出。過去雙機設定需在 CLI 手動調整 vLLM 或 TensorRT-LLM 啟動參數,新工具的用法正是要簡化此流程。
但兩台 64GB 疊回 128GB 來跑的話其實並不划算。
| 方案 | 總記憶體 | 總價 | 每 GB 單價 |
|---|---|---|---|
| 一台 DGX Spark 128GB | 128GB | 6,950 美元 | 約 54.3 美元 |
| 兩台 DGX Spark 64GB | 128GB | 9,998 美元 | 約 78.1 美元 |
| 一台 DGX Spark 64GB | 64GB | 4,999 美元 | 約 78.1 美元 |
| 去年上市的 128GB 版本 | 128GB | 3,999 美元 | 約 31.2 美元 |
單價為本文依官方起價換算。兩台 64GB 的總價比一台 128GB 高出約 3,048 美元,換來的是兩顆 GB10 的運算力與加倍的頻寬,而非更便宜的記憶體。Hardware Busters 與 Mindstudio 均指出,64GB 版本的每 GB 成本反而高於 128GB 版本,叢集方案只對先買一台、日後再擴充的使用者有吸引力。
對台灣本地 AI 開發者的意義
以 4,999 美元起價粗估,64GB 版本在台灣的入手門檻約為新台幣 15 萬至 16 萬元。此為依近期匯率換算的參考值,匯率、台灣通路定價、關稅與營業稅仍需要觀察,六家合作夥伴中有四家(Acer、ASUS、Gigabyte、MSI)為台灣廠商,台灣市場的實際售價與上市時程也等官方公布。
對於在 2025 年就以 3,999 美元買到 128GB 版本的早期使用者而言,手上這台機器的帳面價值在一年內上漲近 75%。對於現在才要進場的團隊,CyberQ 歸納,選擇則變成以下三種。
1、以 4,999 美元購入 64GB 版本,執行 300 億參數級模型與代理工作,日後視需求再加一台。
2、以 6,950 美元購入 128GB 版本,單機即可執行約 2,000 億參數模型,每 GB 成本較低。
3、轉向 AMD 平台。The Register 指出 AMD 新推出的 Gorgon Halo SoC 記憶體配置從約 32GB 到 192GB(Ryzen AI Max+ 495),搭載該晶片的系統售價目前低於 128GB 版 DGX Spark,但該媒體多次實測顯示 GB10 的 GPU 在 AI 工作上效能明顯較高(The Register)。
這波調價也牽動 Nvidia 2026 年秋季即將推出的 RTX Spark 筆電與迷你電腦。這些產品使用同一顆 GB10 晶片,但定位為一般用途的 Windows PC。在 DGX Spark 定價逼近 7,000 美元的情況下,同樣具備 128GB 記憶體的 RTX Spark 筆電售價可能更高,Nvidia 預計會提供記憶體容量較低的版本給價格敏感的買家。NVIDIA Blog 則確認,RTX Spark 架構的 Windows PC 將於 10 月由 Acer、ASUS、Dell、HP、Lenovo、Microsoft 與 MSI 推出。
綜合來看,Micron美光的記憶體供需展望看得出來確定在 2028 年之前記憶體不會變便宜。對正在評估地端 AI、本地 LLM 基礎建設的企業與開發者,等待降價的策略在未來兩年內可能不成立,反而是現在以可接受的規格進場、再透過叢集擴充的路線較為務實。
CyberQ 實測:兩台 128GB 叢集究竟如何 ? 新款 64GB 機型夠不夠用 ?
CyberQ 目前以兩台 DGX Spark(128GB)直連組成叢集,作為地端 LLM 的測試與日常服務環境,以下幾點是CyberQ 實際使用後的觀察。
Nvidia 官方宣稱的「兩台 1.7 倍」與本機 1.83 倍一致
decode 受記憶體頻寬限制,TP 把每台要掃的權重減半;all-reduce 每層每 token 只約 10 KB,提醒讀者,必須用 TP,PP 只有 1.02 倍。
「27B 在 16GB 顯示卡上也能跑」需要加條件
Qwen3.8-27B 的 q4_k_m 實際是 15.65 GiB(16.8 GB),已超過 16GB VRAM,幾乎沒有 KV 空間,要更低位元才放得進,而 4 位元以下繁中劣化約為英文的 1.7 到 2 倍。
「64GB 單機約 1,000 億參數」要附量化條件
本機 Mistral 119B FP8 每台需 56.6 GiB 權重,Qwen3-235B NVFP4 每台約 66 GiB;兩台 64GB 合計 128GB 也跑不了後者。換言之,兩台 64GB 的實際容量上限低於一台 128GB 加一台 128GB 的組合,且比單台 128GB 多付 OS 與執行期開銷兩份。
叢集加速是真的,但要用對切法
以 Qwen3.8-27B FP8 實測,單機 decode 為每秒 8.08 token,兩台以張量平行(TP=2)合體後為 14.80 token,約 1.83 倍,與 Nvidia 宣稱的 1.7 倍相符,KV cache 容量則增加為 2.38 倍。原因是 GB10 的解碼受記憶體頻寬限制,權重拆到兩台後每台每個 token 只需讀一半權重。但若改用管線平行(PP=2),速度只有 1.02 倍,幾乎沒有加速。一般「張量平行留在機內、跨機才用管線平行」的經驗法則,在 GB10 上並不成立。
200 GbE 不是插上就有
常見的 QSFP28 線材上限為 100G,換成 200G 線材後,ConnectX-7 的單一實體埠在系統中會分成兩個各走 PCIe Gen5 x4 的介面,每半上限約 112 Gb/s,必須兩半都設定並讓 NCCL 同時使用,all-reduce 頻寬才從 13.9 GB/s 提升到 24.1 GB/s。另一個陷阱是若通訊誤走一般網路而非 RoCE,系統不會報錯,只會慢五到十倍。不過以筆者目前的推論負載實測來看,線材升級到 200G 後速度並未改變,因為兩台 GB10 的瓶頸在運算而非互連,只做雙機推論的使用者,若手邊有 100G 線材已經足夠,買 200G 線材當然更好。Nvidia 即將推出的 Sync Model Launcher 與叢集 playbook,正是在處理這類過去必須手動調整的細節。
128GB 的價值在於能跑兩台合體才放得下的模型
CyberQ 測試用的 GB10 叢集上實際跑過 Qwen3-235B-A22B(NVFP4,每台約 66 GiB 權重,每秒約 24 token)與 Mistral-Small-4-119B(FP8,每台約 57 GiB,每秒約 49 token),目前日常代理工作的後端則是雙機執行的 DeepSeek V4.1 Flash 2-bit 版本,單路約每秒 42 到 44 token。這幾顆模型的單台權重都超過或逼近 64GB,換成兩台 64GB 並無法執行。兩台 64GB 疊出的 128GB,在容量上並不等於一台 128GB,更遠不及兩台 128GB。
統一記憶體沒有安全邊際
128GB 機型實際可供 CUDA 使用約 121.6 GiB。大模型常駐後,筆者的機器經常只剩 7 到 8 GiB 可用,連第二顆 27B 的 4 位元版本都放不下。一旦你跑的推論引擎設定超過記憶體限制,機器不會觸發一般的 OOM 機制,而是整台停擺,網路仍能 ping 通但無法登入,只能手動斷電重開,容器的記憶體上限也無法防範,因為 GPU 的統一記憶體配置不計入容器的記憶體機制。64GB 機型的可用空間更少,CyberQ 預期這類風險只會更高。
64GB 對日常推論是否足夠?
由於手上沒有 64GB 的機型,以下為依實測換算的判斷。以 Qwen3.8-27B 為例,FP8 權重就佔 27.8 GB,約為 64GB 的四成多,剩餘空間扣除系統後約 30 GB 上下可給 KV cache 與執行期,單人或小團隊的代理工作可行。但速度是另一個問題,27B 這類密集模型在 GB10 單機上 FP8 解碼每秒僅約 8 token,開啟 MTP 投機解碼也只有約 15 token,處理長提示時尤其吃力(12,000 token 提示需約 21 秒)。
相較之下,30B 級的 A3B 混合專家模型(每個 token 只啟用約 30 億參數)在同一台單機上可達每秒約 53 token。因此若選擇 64GB 版本,筆者建議以 Nemotron 3.5 Lightning 30B-A3B 這類 MoE 模型為主力,而非密集的 27B。至於微調,筆者在 128GB 上以 QLoRA 微調 27B 時曾一度因批次過大導致整台停擺,後來調整批次後才解決,因此,同等工作在 64GB 上可操作的空間絕對是更小,The Register「 64GB 較不適合微調」的判斷與 CyberQ 實測經驗一致。
電費不是瓶頸,硬體才是。 以插座電表實測,兩台模型常駐、無請求時合計約 109 瓦,雙機滿載推論約 328 瓦,長時間滿載時需注意散熱。整體而言,電費相對於硬體攤提微不足道,真正的成本在於記憶體容量,而這正是本次漲價的核心。







