生成式 AI 從雲端走向地端,已經不只是趨勢口號。隨著 GDPR、台灣個資法等法規對敏感資料的要求日趨嚴格,加上企業對 AI 推論成本與資料主權的重視,「在自己的機房跑 LLM」正快速成為中小企業與工作室的實際需求。QNAP 在 2026 年陸續發表的 QAI-h1290FX Edge AI 儲存伺服器,以及較小型的 AI NAS、新版 Qsirch 與 RAG 等軟體布局,也確認了地端 AI 市場 NAS 不但不會缺席,也會是資料結構的要角。

CyberQ 近期測試了 QNAP 官方 AI NAS 方案的定位與規格,並與另一條路線,NVIDIA DGX Spark 搭配既有 NAS 的運算與儲存分離自建架構,進行比較,協助讀者評估哪一種部署方式更適合自身情境。
QNAP 的地端 AI 佈局從儲存設備到 AI 基礎設施
QNAP 之前推備份復原、Edge AI、主動資安、智慧監控與影音工作流。其中 Edge AI 自然是近年的焦點之一,QNAP 明確將 NAS 的角色從檔案儲存與備份設備,要定位為企業地端 AI 應用的核心基礎設施。
QAI-h1290FX:企業級 Edge AI 儲存伺服器

2026 年近期的 QAI-h1290FX 是 QNAP 目前規格最高的 Edge AI 產品,鎖定私有 LLM、RAG 檢索增強生成與生成式 AI 工作負載,重點規格如下:
處理器:AMD EPYC 7302P 16 核心 32 執行緒伺服器級處理器
記憶體:128 GB RDIMM DDR4 ECC,最高可擴充至 1 TB
儲存:12 個 U.2 NVMe/SATA SSD 插槽的全快閃架構
GPU:可選配 NVIDIA RTX PRO 6000 Blackwell Max-Q 工作站繪圖卡,最高 96GB GPU 記憶體,支援 CUDA、TensorRT 與 Transformer Engine 加速。最高算力達 3511 AI TOPS (FP4)、333 TFLOPS (RT Core)。另有 RTX PRO 4500 Blackwell,32GB GDDR7 ECC、896 GB/s 頻寬、200W,適合約 300 億參數以下模型。

網路:雙 25GbE 加雙 2.5GbE,,並可升級至 100GbE
作業系統:基於 ZFS 的 QuTS hero,並預載 AnythingLLM、Ollama 等 AI 應用範本

這類產品的目標是開箱即用,該公司推出的機器內含 NVIDIA GPU 顯示卡,並已經安裝好對應的驅動程式模組和 NAS 系統結合,減少自組 GPU 工作站、安裝工具與設定複雜環境的門檻,讓使用者開箱即可部署 AI 模型,同時完整掌控資料、不依賴雲端。
許多用戶自己跑 NVIDIA 卡在 NAS 上需要的設定和 AI 工具搭配,這款產品等於是做好了底層結構和整合,帶回去部署是開箱安裝後就能開始跑推論或訓練任務,資料集與模型權重檔案可放在 NAS 上的硬碟或 SSD 中,透過儲存池與 RAID 提高效能與資料穩固性。
小型 AI NAS 有 Intel Panther Lake 加持
QNAP 的緊湊型 8-bay 與 6-bay AI NAS 則走另一條產品線,搭載 Intel Core Ultra Series 3 處理器(Core Ultra X7 358H,Panther Lake 架構),配備 32GB DDR5 記憶體,平台 AI 算力達 180 TOPS,定位是讓中小企業以單機完成地端 LLM 部署與 AI 助理應用。
軟體層面同樣是這波佈局的重點:
QuAgent:AI Chat Agent,讓管理者以自然語言指令調度 NAS 任務。
Qsirch 7.1.0:導入 AI 語意搜尋,涵蓋所有媒體與文件格式,影音內容可自動轉錄逐字稿並全文檢索。
FileTiers:跨裝置自動分層儲存,將溫冷資料從高效能 SSD 層動態遷移至大容量 NAS 或雲端,優化長期 TCO。
此外,QNAP 也為 Qfile Pro、QuMagie 與 Qmanager 三款行動 App 導入裝置端 AI 助理,所有 AI 運算在行動裝置本地處理,不將個人資料傳送至第三方雲端。
另一條路線:DGX Spark + NAS 的運算儲存分離架構
QNAP 官方方案的思路是「All-in-One」,運算與儲存整合在同一台設備。但對於已經擁有 NAS 的使用者,另一條路線是購入專用 AI 運算裝置,讓既有 NAS 專職模型與資料集儲存,兩者以高速網路串接。

NVIDIA DGX Spark 正是這條路線目前最具代表性的選擇:
核心:GB10 Grace Blackwell 超級晶片,整合 Blackwell GPU(第五代 Tensor Core)與 20 核心 Arm Grace CPU
記憶體:128GB LPDDR5x 一致性統一記憶體,CPU 與 GPU 透過 NVLink-C2C 共享定址
算力:FP4 精度下最高 1 PFLOP(利用稀疏性之理論值)
模型規模:單機可執行最高 2,000 億參數模型;透過 ConnectX-7 200GbE 串接兩台,可挑戰 405B 等級模型,NVIDIA 官方有提出四機堆疊的方案,社群也有人多機串聯使用。
其他:4TB NVMe 儲存、240W 功耗、1.13 公升機身,美國定價 3,999 美元,實際市場售價普遍高於此數,預載 DGX OS 與完整 NVIDIA AI 軟體堆疊
實務架構:NAS 作為模型儲存後端
DGX Spark 內建的 4TB NVMe 或 1TB NVMe SSD 對於動輒數十 GB 起跳的模型權重與訓練資料集而言相當緊繃,這正是 NAS 發揮價值之處。實務上的建議架構如下:
模型倉庫集中化:將 GGUF、Safetensors 等模型檔案統一存放於 NAS,DGX Spark 透過 NFS 掛載存取,多台推論裝置共用同一份模型庫,避免重複下載與版本混亂。
開機順序處理:NFS 掛載建議透過 systemd mount unit 管理,明確宣告網路相依性,避免開機時網路尚未就緒導致掛載失敗。
快取策略:高頻使用的模型可同步一份至本機 NVMe 作為熱資料,NAS 保留完整版本庫作為冷資料,概念上與 QNAP FileTiers 的分層思維一致。
網路頻寬:模型載入屬於大檔循序讀取,10GbE 是基本門檻,若 NAS 具備 25GbE 或更高介面,載入 70B 等級模型的等待時間可明顯縮短。

CyberQ 實測以 GB10 跑 DS4 這種 DeepSeek V4 Flash 的大模型,從 QNAP NAS 用 10GbE 來讀取模型檔案是可行的,如果要更快就需要 25GbE 或 100GbE 網卡與線材、交換器等等,機器少可以線材直連,機器多就需要交換器了。
路線怎麼選?
| 比較面向 | QNAP AI NAS(QAI-h1290FX) | DGX Spark + NAS 分離架構 |
|---|---|---|
| 部署複雜度 | 低,開箱即用,預載 AI 範本 | 中,需自行整合網路與儲存 |
| GPU 記憶體 | 選配 RTX PRO 6000 最高 96GB | 128GB 統一記憶體 |
| 生態系 | QuTS hero + QNAP App 生態 | 完整 NVIDIA AI 軟體堆疊 |
| 擴充彈性 | 單機整合,儲存擴充強 | 可串接第二台 Spark 擴大模型規模 |
| 適合對象 | 重視資料治理與管理介面的企業 IT | AI 開發者、已有 NAS 的進階使用者 |
簡要而言,如果組織需要的是會跑 AI 的儲存設備,重視 ZFS 資料保護、快照備份與統一管理介面,QNAP 官方 AI NAS 是阻力最小的路徑。如果需求核心是 AI 開發與推論等為主,且手上已有堪用的 NAS,DGX Spark 分離架構能以較低預算取得更純粹的 AI 運算體驗與 NVIDIA 原生工具鏈。
實測上,統一記憶體裝得下不等於跑得快。DGX Spark 的 128GB 讓你能載入 120B 級模型,但輸出速度受限於頻寬,RTX PRO 6000 的 96GB 雖然容量較小,卻有近 7 倍的頻寬,在能放進 VRAM 的模型上速度明顯領先,跑起來的速度差異會很大。
Ollama 單請求推論(RTX PRO 6000 ),gpt-oss:120b (MXFP4) 90 tokens/秒、約 63GB VRAM;deepseek-r1:70b (q4_K_M) 24 tokens/秒、約 41GB;qwen3:32b (q4_K_M) 46 tokens/秒、約 21GB;qwen3:8b (q4_K_M) 172 tokens/秒。
vLLM 並發吞吐,以 DeepSeek-R1-Distill-Qwen-7B 測試,1 執行緒 79 tokens/秒、5 執行緒總計 410 tokens/秒、20 執行緒 810 tokens/秒、50 執行緒 850 tokens/秒(平均每執行緒降至 17 tokens/秒)
另外,要說明一下,小型 AI NAS 平台 AI 算力達 180 TOPS是 Panther Lake 的 INT8 平台總和(NPU+GPU+CPU),而 QAI 的 3511 TOPS 與 DGX Spark 的 1 PFLOP 都是 FP4,三者不可直接相比,實際應用上的輕重也有不小差異。
再來是我們市場上熱門的選項,自組 x86 + RTX 5090(32GB GDDR7、~1.8TB/s)的性價比路線高,但如果需要放更多資料和模型,同樣也是要搭配一台 NAS。以及 Mac Studio 大統一記憶體路線,也可以跑很多不錯的地端模型,但在資料儲存方面,你會發現也會有採購 NAS 的需求和空間。
CyberQ 建議
2026 年的地端 AI 市場正在快速分化,NAS 廠商向上整合運算,AI 硬體廠商向下觸及桌面。對台灣的中小企業與技術工作者而言,這是難得的甜蜜點,無論選擇哪條路線,以百萬元以內的預算建構具備資料主權又比單機相對高速許多的私有 LLM 環境,已經是完全可行的方案。精打細算的公司,購買 AI 小型工作站加上 NAS 的費用也約莫 30 萬元以內可以做好一整套,許多公司也透過這樣的方式進行自己的專案。可以參考 Ardge 的 AI 產品、以及 Spes 的客製化 NAS 方案。
以合規性來看,存取控制與稽核軌跡的部分,QuTS hero 有完整的使用者權限模型與系統日誌,DGX OS 是一台 Linux 主機,稽核要素需自己處理並搭配適當方案。而靜態資料保護可以使採用 ZFS 快照、WORM 不可變資料夾對抗勒索軟體,Spark 本機 NVMe 無此機制,因此一定要搭配一台 NAS 來使用會比較適合。再來是模型與資料集的版本治理,誰動過模型權重、何時、有無留痕跡,是之後要處理的重點。
最後就是,實體隔離的保護,如上面我們照片所示,Spark 體積小、可上鎖機櫃甚至攜出,資產管理時要留意。
建議讀者從自身的資料治理需求與既有設備出發做選擇,而非單看算力數字,選適當的設備做分流,也是一條路,投資這些硬體在內部合規、機敏資料參與開發,以及地端 AI 都有適當的實作方式。
Q1:DGX Spark 和 AI NAS 哪個跑 LLM 比較快?
沒有單一答案,要看「模型類型」與「哪一個階段」。
LLM 推論分成兩個階段:讀取提示詞的 prefill(受算力限制)與逐字輸出的 decode(受記憶體頻寬限制)。使用者感受到的「打字速度」主要來自 decode,因此記憶體頻寬往往比 TOPS 數字更能決定體感。
兩者的頻寬差距相當懸殊。QAI-h1290FX 選配的 RTX PRO 6000 Blackwell Max-Q 具備 96GB GDDR7 ECC 與 1,792 GB/s 記憶體頻寬;DGX Spark 的 128GB LPDDR5x 統一記憶體則約為 273 GB/s,差距接近 7 倍。
實際數據也反映了這件事。QNAP 官方公布的 Ollama 實測中,deepseek-r1:70b (q4_K_M) 達 24 tokens/秒、qwen3:32b (q4_K_M) 達 46 tokens/秒、gpt-oss:120b (MXFP4) 達 90 tokens/秒。而 CyberQ 對 DGX Spark 的實測則顯示,密集型模型(Dense Model)速度並不理想,但 MoE 架構模型如 GPT-OSS-120B、Nemotron 3 Super 120B 可達約 40–60 tokens/秒。
因此結論可以這樣歸納:
跑得動 vs 跑得快:DGX Spark 的 128GB 統一記憶體讓它裝得下更大的模型,但輸出速度受記憶體頻寬拖累,RTX PRO 6000 雖然只有 96GB,但在能塞進 VRAM 的模型上速度明顯領先。
模型架構是關鍵變數:DGX Spark 在 MoE 模型上表現遠優於密集模型,因為 MoE 每次只啟動部分參數,對頻寬相對友善。密集型 70B 模型則是 GPU 方案的強項。
多人並發是另一個角度:QAI 搭配 vLLM 時,以 DeepSeek-R1-Distill-Qwen-7B 測試,5 個執行緒總計可達 410 tokens/秒,20 個執行緒達 810 tokens/秒,適合當成部門級共用服務,DGX Spark 則更偏向單人或少數 Agent 的開發用途。
兩組數據來自不同單位、不同推論引擎與測試條件(QNAP 為短提示詞 Ollama 測試,NVIDIA 官方為 128K 長上下文 Agent 負載),僅供量級參考,不宜當成同基準對照。
Q2:地端 LLM 最低要多少預算?
以 2026 年台灣市場行情,中小型企業購置的產品類別,可分成三個級距,大型公司就買 NVIDIA 伺服器或機櫃了:
入門(約 15–30 萬) DGX Spark +既有 NAS
DGX Spark (4TB PCIe Gen 5 SSD)目前 MSRP 為 4,699 美元,OEM 版本如 ASUS Ascent GX10、MSI EdgeXpert 則以降配為 1TB/2TB PCIe Gen 4 SSD 的方式,落在 3,999 美元價位帶,台灣市售價格十幾萬元到二十萬元不等。若已有 10GbE 以上的 NAS 作為模型倉庫,只需再加上網路線材與交換器成本即可成局。適合開發者、小型工作室,以及以 AI Agent 為主要用途的團隊。
中階 QAI-h1290FX + RTX PRO 4500
RTX PRO 4500 Blackwell 具備 32GB GDDR7 ECC、896 GB/s 頻寬、200W 功耗,適合約 300 億參數以下的模型與 RAG 流程。對多數中小企業而言,內部知識庫問答、文件檢索、會議轉錄這類需求,32GB VRAM 已相當充裕,是性價比最合理的切入點,如果需要價格,請洽經銷商詢價。
進階 QAI-h1290FX + RTX PRO 6000 Blackwell Max-Q
96GB VRAM 可負擔 70B 級密集模型與多模型並行,搭配 vLLM 可服務數十位使用者。適合要把地端 LLM 當成正式內部服務營運的組織,如果需要價格,請洽經銷商詢價。
編列預算時,容易被忽略但務必納入的項目:
儲存:模型權重動輒數十 GB 起跳,多版本並存時 TB 級容量是基本盤
網路:10GbE 為基本門檻,25GbE 或 100GbE 會顯著縮短大模型載入時間
電力與散熱:DGX Spark 的 GB10 晶片 TDP 僅 140W,整機供電上限 240W;GPU 伺服器方案則需評估機房配電與空調
保固與在地支援:QAI-h1290FX 享有 5 年標準保固。DGX Spark 在台灣多透過代理或平行輸入管道取得,RMA 路徑需事先確認。對企業採購而言,這項差異的實質成本往往高於帳面價差。
Q3:70B 模型需要多少 VRAM?
取決於量化精度。粗估公式為「參數量 × 每參數位元組數」,再加上 KV cache 與執行時期額外開銷:
| 精度 | 每參數位元組 | 70B 模型權重約需 | 實務建議 VRAM |
|---|---|---|---|
| FP16/BF16 | 2 bytes | 約 140 GB | 需多卡或分散式架構 |
| INT8/FP8 | 1 byte | 約 70 GB | 96 GB 級距勉強可行 |
| 4-bit(Q4_K_M 等) | 約 0.5 byte | 約 35–40 GB | 48 GB 以上較從容 |
實測也可作為對照,deepseek-r1:70b 以 q4_K_M 量化執行時,VRAM 使用量約 41GB。同一份測試中,qwen3:32b (q4_K_M) 約需 21GB、gemma3:27b (q4_K_M) 約需 19GB、8B 級模型約需 7GB。
需要額外留意的重點:
不要把 VRAM 抓到剛好。上表僅為模型權重,KV cache 會隨上下文長度與並發數線性成長。長文件摘要或多人同時使用時,額外需求可能達數 GB 至十數 GB。若打算跑 32K 以上的上下文,建議在權重需求之上預留三成以上餘裕。
量化會影響品質。4-bit 量化在多數應用中差異可接受,但在程式碼生成、數學推理與精確資訊擷取這類任務上,退化較為明顯。導入前務必以自家的實際資料做驗證,不要只看 benchmark 分數。
MoE 模型的帳要分開算。像 GPT-OSS-120B 這類混合專家模型,總參數雖達 120B,但每次生成僅啟動約 5B 參數,因此權重仍需完整載入記憶體,運算量卻遠低於同尺寸的密集模型。這也是它在 DGX Spark 這類高容量、低頻寬平台上表現特別好的原因。











