CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題
聯繫我們
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
  • 資安
  • NAS 與儲存
  • 網通
  • 虛擬化與容器
  • 開發與 DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
首頁 AI

OpenFaaS 為何買下四台 DGX Spark?從資料控制到無交換器叢集的地端 AI 實戰

BabyQ by BabyQ
2026 年 10 月 09 日 09:05
in AI, 新聞
閱讀時間: 3 分鐘
A A
OpenFaaS 為何買下四台 DGX Spark?從資料控制到無交換器叢集的地端 AI 實戰
2.5k
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

企業採購地端 AI 設備,理由未必來自每百萬 token 的成本比較。OpenFaaS 創辦人 Alex Ellis 在 2026 年 9 月 15 日的部署紀錄中,說明團隊如何從 RTX 工作站逐步走向四台 DGX Spark,他們需要處理不能交給第三方的資料,也希望在自己掌控的環境中執行產品安全測試。這筆投資的評估基準,是工作能否完成,以及資料與服務的控制權。

RELATED POSTS

GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造

16.9 MB 就能跑語音轉文字?Whistle 輕量模型受矚目

FBI 與美國特勤局警告 FortiBleed 攻擊持續進行|OpenAI 開除安全研究員風波延燒|產業精選 10.09

這個需求有具體的業務背景。Ellis 在較早的Alex Ellis 前篇部署紀錄文章中提到,OpenFaaS 透過診斷工具蒐集客戶 Kubernetes 安裝環境的完整快照,再交由隔離環境中的地端模型協助分析。這類資料直接涉及客戶環境,不能只因雲端模型提供資料保留選項,就認定適合傳送。從部署角度看,資料是否離開企業,以及離開後如何保存,是兩個需要分別判斷的問題。

不過,資料控制只能解釋為何需要地端 AI,設備規模仍須由模型與工作負載決定。OpenFaaS 原先使用 RTX PRO 6000 Blackwell 搭配 Qwen 27B 級模型,Ellis 也記錄過代理在任務中反覆輸出、無法自行脫困的情況。因此,生成速度夠快,仍不能保證代理能可靠地完成長時間工作。評估模型時,工具呼叫、錯誤恢復與人工介入需求,必須與 tok/s 一起觀察。

他接著透過朋友的雙機 DGX Spark 環境測試 DeepSeek V4 Flash 0731,確認符合需求後才採購。原文提到,前兩台配備 4TB SSD 的設備,在英國的購入成本接近一萬英鎊,這是當時的雙機價格。之後增加到四台,則是為了拓展大型模型與內部紅隊測試能力。團隊最終讓不同模型測試自家產品,作者表示,過程中發現並修補了不同嚴重程度的漏洞。

理解這次擴充,需要先看 NVIDIA DGX Spark 的記憶體架構。本案例使用每台 128GB 統一記憶體的 GB10 系統,CPU 與 GPU 共用記憶體,NVIDIA 公布的記憶體頻寬為 273GB/s,並提供 ConnectX-7 高速網路介面。四台的標稱記憶體總和為 512GB,但分散在各節點,模型必須透過支援多節點的推論引擎配置,還須留下作業系統、執行階段與快取所需空間。

這也說明了大容量與高速度之間的取捨。多節點可以讓原本單機放不下的模型進入可部署範圍,同時也引入節點間通訊。選擇硬體時,必須同時確認權重能否容納、上下文需要多少快取,以及推論過程的運算與資料交換成本。只把四台的容量相加,還不足以判斷模型是否實用。

OpenFaaS 的四機部署採用直接接線的 RoCE 環狀拓樸,每個節點連接兩個相鄰節點,透過 TP4 張量平行共同提供推論服務。其公開的 switchless-nccl 專案指出,原版 NCCL 的部分連線方式會嘗試連接環中沒有直接線路的節點,因此需要修補通訊行為,並明確使用 Ring 演算法。這讓四機叢集可以省去高速交換器,但也讓部署依賴特定拓樸與設定。

這套方式有明確的適用範圍。switchless-nccl 要求所有 vLLM 程序載入相同的修補版函式庫,並正確配置網路介面位址與 RoCE 識別資訊,專案也明言,交換器網路與雙節點直連應使用原版 NCCL。對企業而言,省下交換器支出後,仍要承擔軟體版本、節點設定與後續驗證的維護工作。

效能則是另一個需要仔細閱讀的部分。Ellis 開發的 RigMark 將文字、程式碼、可預測輸出、提示詞處理與同時請求分開測試,並記錄模型、量化、推論引擎與測試設定。它的定位是推論服務基準測試,完整代理任務的正確性與完成率,仍需要另外驗證。尤其使用推測式解碼時,草稿模型提出的 token 被主模型接受多少,會隨生成內容改變,單一速度數字很難涵蓋所有工作。

到了 10 月 7 日的 NVIDIA 論壇討論,讀者詢問不同部署配方的同時使用人數為何差異很大。Ellis 回覆,模型量化、引擎與測試方式各不相同,並指出目前使用 RiNGSiDE 配方,文字生成約為 60 tok/s、prefill 約為 5,000 tok/s。他也表示,仍採用雙機 DeepSeek V4 Flash 0731 與四機 GLM-5.3-Flash 兩種設定,這些數字與選擇都是他的部署經驗。對於更大的完整 GLM-5.3 與 DeepSeek V4.1 Flash,他認為前者的 NVFP4 配置無法放進四機,後者在其工作中未帶來足夠增益,因此延續現有模型

RiNGSiDE 的公開測試紀錄與方法提供了更清楚的測試條件。以下為 2026 年 9 月 26 日四機 TP4 測試窗口的結果,使用 RedHatAI 的 GLM-5.3-Flash-NVFP4 權重與 DFlash2 草稿模型,RigMark 推理強度設為 low,各項數字取兩次測試的中位數。這些結果出自專案維護者的紀錄,並非本文另行實測。

測試項目公開結果判讀重點
單路文字生成61.7 tok/s此測試提示下的文字輸出速度
單路程式碼生成105.3 tok/s生成內容不同,速度也有明顯差異
單路可預測結構化輸出145.4 tok/s應作為特定工作負載的結果
64K 提示詞冷處理首 token 延遲12.87 秒反映長輸入開始回應前的等待時間
16 路短程式碼請求整體吞吐量345.8 tok/s是所有請求的合計吞吐量

因此,能否支援 16 人需要拆成更具體的容量問題。RiNGSiDE 確實公布了 16 路短請求測試,但這與 16 個完整、長時間的代理工作階段不同。專案預設上下文上限為 262,144 tokens,另有較長上下文實驗;其文件特別說明,--max-num-seqs 16 是排程上限,不能據此認定有足夠 KV cache 同時容納 16 個滿長度請求,也不能保證各種負載下的延遲。

對程式代理來說,輸入處理往往尤其重要。Ellis 較早公開的一組四機 TP4 使用紀錄涵蓋 476 次請求,提示詞 token 與完成輸出 token 的比例約為 58:1。這是特定部署的使用樣本,但也提供了有用的觀察,代理反覆讀取程式碼、工具結果與對話內容時,prefill 和前綴快取重用會直接影響操作感受。只比較輸出 tok/s,可能忽略大部分等待時間的來源。

當這些模型開始供團隊共同使用,部署也就進入服務管理階段。Ellis 在前篇部署紀錄文章介紹 Toilgate,用來集中呈現模型與管理存取,他將身分、權限、用量、模型路由與電力監測列為地端 AI 的運維問題。這使硬體投資的評估範圍更完整,除了模型能跑多快,還要考慮誰能使用、如何更新,以及服務是否足以讓同事依賴。

公開配方本身也有導入限制。RiNGSiDE 部署限制 文件說明,實測使用的映像與原生二進位元件並未公開散布,自行重建後需要重新驗證,其 DFlash2 草稿模型另採非商業用途授權,API 則預設沒有驗證與 TLS。這些都是評估該配方能否進入企業環境的實際條件,不能由跑分結果代替。

CyberQ 認為,從這個案例可以歸納出的採購方法,是先選定需要地端處理的工作,再驗證模型品質、延遲、容量與維護成本。單人短任務、多位同事共同使用,以及長上下文代理,需要不同的測試條件。四台 DGX Spark 能提供多少價值,最終仍取決於企業能否把這些條件落實成穩定、可管理的工作流程。

DGX Spark 一年漲七成五,NVIDIA 推 4,999 美元 64GB 會好用嗎 ?
DGX Spark 中小企業地端 AI 部署實戰,從 1 台到 4 台怎麼配
NVIDIA 宣布 RTX Spark 平台上市,微軟與各大廠開放預購,台灣售價 12 萬到 27 萬不等
標籤: DGX SparkOpenFaaSRoCE 環狀拓樸企業 AI 採購資料控制
Share30Tweet19ShareShareShare5
上一篇

16.9 MB 就能跑語音轉文字?Whistle 輕量模型受矚目

下一篇

GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造

BabyQ

BabyQ

IT 工程師,專長是資訊系統管理、企業 AI Infra、雲端服務,協助客戶解決問題。 Switch 轉 Steam 新手用戶,夢想是看極光、大堡礁、冰山、熔岩等地球美景。

相關文章

GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造
AI

GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造

2026 年 10 月 9 日
16.9 MB 就能跑語音轉文字?Whistle 輕量模型受矚目
新聞

16.9 MB 就能跑語音轉文字?Whistle 輕量模型受矚目

2026 年 10 月 9 日
新聞

FBI 與美國特勤局警告 FortiBleed 攻擊持續進行|OpenAI 開除安全研究員風波延燒|產業精選 10.09

2026 年 10 月 9 日
Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%
AI

Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%

2026 年 10 月 8 日
NVIDIA 宣布 RTX Spark 平台上市,微軟與各大廠開放預購,台灣售價 12 萬到 27 萬不等
新聞

NVIDIA 宣布 RTX Spark 平台上市,微軟與各大廠開放預購,台灣售價 12 萬到 27 萬不等

2026 年 10 月 8 日
Anthropic 推出 Claude Haiku 5.5,價格降九成並首度支援可調整推理強度
新聞

Anthropic 推出 Claude Haiku 5.5,價格降九成並首度支援可調整推理強度

2026 年 10 月 8 日
下一篇
GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造

GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造

推薦閱讀

GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造

GitHub 趨勢周報 Vol 37 少寫程式碼成為代理工程的主張 技能包從工程擴散到行銷與製造

2026 年 10 月 9 日
OpenFaaS 為何買下四台 DGX Spark?從資料控制到無交換器叢集的地端 AI 實戰

OpenFaaS 為何買下四台 DGX Spark?從資料控制到無交換器叢集的地端 AI 實戰

2026 年 10 月 9 日
16.9 MB 就能跑語音轉文字?Whistle 輕量模型受矚目

16.9 MB 就能跑語音轉文字?Whistle 輕量模型受矚目

2026 年 10 月 9 日

FBI 與美國特勤局警告 FortiBleed 攻擊持續進行|OpenAI 開除安全研究員風波延燒|產業精選 10.09

2026 年 10 月 9 日
Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%

Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%

2026 年 10 月 8 日

近期熱門

  • Apple 推出 Pass Designer 工具,讓數位票卡設計變得更親民

    251 shares
    Share 100 Tweet 63
  • 極簡 AI 程式碼代理 Pi 1.0 正式登場,做減法的 harness 為何引發關注?

    333 shares
    Share 133 Tweet 83
  • OpenAI 一次釋出 722 份 AI 數學手稿,首度採用與數學社群協商後的揭露流程

    224 shares
    Share 90 Tweet 56
  • DGX Spark 一年漲七成五,NVIDIA 推 4,999 美元 64GB 會好用嗎 ?

    211 shares
    Share 84 Tweet 53
  • GitHub 趨勢周報 Vol.36,代理工程從加功能轉向省資源,技能包成為開發方法論的載體

    254 shares
    Share 102 Tweet 64
  • Reflection 發表開放權重模型 Beam,501B MoE 主打推論效率

    191 shares
    Share 76 Tweet 48
  • QNAP QSW-M7230P-2X4F24T 100GbE 交換器升級 PoE++ 登場

    148 shares
    Share 59 Tweet 37
  • Claude Haiku 5.5 API 實測:關掉思考才真的又快又便宜,HLE 抽樣未重現 45.9%

    136 shares
    Share 54 Tweet 34
  • Hermes Agent 開發商 Nous Research 達 15 億美元估值,推商用 AI 代理|Mecka AI 獲 Sequoia 投資|產業精選 10.08

    135 shares
    Share 54 Tweet 34
  • SGS、資策會與大映科技聯手合作 AI 網路封包分析系統 ANMAS

    128 shares
    Share 51 Tweet 32

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
  • AI
    • AI 代理
    • AI 應用實戰
  • 資安
    • ISO 合規
  • NAS 與儲存
  • 網通
    • 10GbE
    • 100GbE
  • 虛擬化與容器
    • Docker
    • 虛擬化
  • 開發與 DevOps
    • DevOps
  • 科技產業
  • 企業解決方案
  • 教學與評測
    • 開箱評測
    • 選購指南
    • 展覽直擊
    • DR.Q 快問快答
    • 專題

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。