Meta Superintelligence Labs(MSL)於 2026 年 8 月 10 日正式開源 Muse Glimmer 30B,以 Apache 2.0 授權釋出完整權重。這款 300 億參數的稠密多模態模型自 Meta 旗艦模型 Muse Spark 蒸餾而來,明確鎖定一個過去被雲端 API 壟斷的場景,完全可在消費級硬體上離線執行的自主 AI Agent。
Meta 執行長 Mark Zuckerberg 同時預告,尖端等級的基礎模型 Muse Spark 1.2 權重也將在近期開源。在 OpenAI 與 Anthropic 持續以封閉 API 為主的市場格局下,Meta 再次把「開放權重」當作差異化武器。
聚焦 Agent 專用模型
Muse Glimmer 的訓練與評測目標非常聚焦,官方列出的核心能力全部圍繞 Agent 工作流:
端到端任務完成:在 DeepSearch QA、MCP-Atlas、SWE-Bench 等全流程基準上訓練與驗證,涵蓋多輪需求解析、寫程式與除錯
可靠工具呼叫:在長工作流中依照精確 schema 穩定呼叫函式
多步推理與失敗恢復:工具呼叫失敗或回傳異常時,模型會診斷錯誤並重試,而非直接中斷
多模態輸入:內建約 18 億參數的 ViT-G/14 感知編碼器,可交錯理解文字、截圖、圖表與文件
可控推理強度:透過系統提示詞設定 low、medium、high、xhigh 四檔,在品質與速度間取捨
架構面採用 52 層稠密 Transformer,注意力以「三層區域搭配一層全域」的模式排列,滑動視窗 2048,GQA 比例 16:1,上下文長度 131,072 tokens 起跳,支援超過 100 種語言。知識截止日為 2026 年 1 月 4 日。
量化與推測解碼:塞進 24GB 的工程細節
本地部署最現實的問題是記憶體。全精度版本需要超過 55GB,Meta 透過約 4-bit 量化將語言模型壓到 20GB 以下,讓模型本體、KV cache、感知編碼器與推測解碼草稿模型可以同時塞進 24GB 或 32GB 的記憶體範圍。官方宣稱量化在 15 項基準的平均退化僅 0.2%(K-Quant-Dynamic)至 1.0%(K-Quant-17GB)。
速度方面,Muse Glimmer 隨附一個基於 DFlash 區塊擴散架構的輕量草稿模型,一次前向傳遞即可提案 16 個 token 的區塊,再由主模型平行驗證。官方在 K-Quant-17GB 設定下的實測數據:
| 硬體 | 無推測解碼 (tok/s) | DFlash 加速後 (tok/s) | 加速倍率 |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M5 Max | 26.6 | 50.2 | 1.8x |
| Apple M4 Max | 23.7 | 37.8 | 1.5x |
生態系支援的速度也值得注意。發布當天 Ollama 0.32.7 已納入支援,Unsloth 隨即釋出 GGUF 量化版本,NVIDIA 確認可在 GeForce RTX 5090、DGX Spark、DGX Station 與 Jetson 上全本地執行,並提供 NIM 容器、SGLang 與 vLLM 部署選項。AMD 也同步發布在 Ryzen AI Max+ 與 Radeon AI PRO R9700 上以 llama.cpp Vulkan 後端執行的初步數據。對 DGX Spark 這類 128GB 統一記憶體的裝置而言,甚至可以直接跑 BF16 全精度版本進行微調實驗。
基準測試:同級領先但非全面壓制
Meta 以 Gemma4-31B 與 Qwen3.6-27B 的思考模式作為對照組。在 Agent 類基準上 Muse Glimmer 明顯領先,MCP Atlas 拿下 75.5 分,大幅超越 Gemma4-31B 的 54.2 與 Qwen3.6-27B 的 62.5。DeepSearch QA 為 74.6 分,AIME 2026 數學推理達 94.7 分,SWE-Bench Pro 以 51.2 分居冠。
不過官方數據並未全面壓制對手。Qwen3.6-27B 在 SWE-Bench Verified(77.2 對 76.0)、OSWorld-Verified、TerminalBench 2.1 等基準仍然領先,GPQA Diamond 則由 Gemma4-31B 拿下最高分。安全性基準上,Muse Glimmer 在 Siren AgentDojo 的提示注入攻擊成功率為 28.4%,略高於 Gemma4-31B 的 25.6%。
值得肯定的是,Meta 這次的模型卡片誠實揭露了這些互有勝負的結果,並在準備度(Preparedness)章節說明 Muse Glimmer 因整體能力低於 Muse Spark,在生化、網路安全與失控風險上均評為中等或以下。
CyberQ 觀點:本地 Agent 賽道正式成形
Muse Glimmer 的發布印證了 2026 年開源模型的一個明確走向:從通用聊天模型轉向垂直優化的 Agent 模型,並以本地部署為第一優先。這背後有三個市場動力:
資料主權與隱私:Agent 系統接觸的使用者情境遠多於傳統聊天機器人,涵蓋檔案、行事曆、郵件與螢幕內容。本地執行讓敏感資料不出裝置,Meta 甚至將「適當資訊流」原則直接訓練進模型權重,這對受個資法規約束的企業環境是關鍵賣點。
消費級硬體的推理能力到位:RTX 5090、Apple M 系列、AMD Ryzen AI Max+ 與 DGX Spark 等平台,讓 30B 級模型以每秒數十至數百 token 的速度執行成為現實。推測解碼技術(如 DFlash)進一步縮小了本地與雲端的體驗差距。
授權策略的競爭:Apache 2.0 沒有 Llama 時代備受批評的自訂授權限制,企業可以直接商用、微調與再散布。這一步明顯是衝著 Qwen 與 Gemma 生態系而來。
對台灣的企業 IT 與資安團隊而言,這類模型的實務意義在於,導入 AI Agent 不再必然等於把內部資料送上雲端。搭配 MCP 工具生態與適當的護欄設計(Meta 也建議對不可逆操作加上人工確認),本地 Agent 已具備進入合規敏感環境試點的條件。
實際部署品質與官方資料是否相符,仍需要獨立實測驗證。CyberQ 後續已經在 DGX Spark 與 RTX 平台上進行本地部署測試,請參考這一篇 DGX Spark + NAS 實測 Muse-Glimmer-30B 跑 AIME 2026 對照 Meta 官方數字。
參考資料
Muse Glimmer 30B 模型卡片(Hugging Face)
NVIDIA Technical Blog:Run Local Agentic AI Workflows with Meta’s Muse Glimmer
AMD Blog:Run Meta Muse Glimmer 30B on AMD Ryzen AI Max and Radeon GPUs
Phoronix:Meta Publishes Muse Glimmer As 30B Open Agentic Model








