阿里巴巴 Qwen 團隊於日前發表 Qwen3.8 家族後,市場經過一週多的等待,開放權重終於在本週開放下載了,至於親民的 27B 版本會比較晚, Qwen 直接先把旗艦端上桌,Qwen3.8-2.4T-A95B 的完整權重與官方 FP8 量化版已同步上架 Hugging Face。
CyberQ 觀察,這可是 Qwen 系列首次將 Max 級模型開放釋出,在過去呢, Qwen3.7-Max 以前的所有 Max 級模型都是維持 API 專屬才能用,如今在 3.8 時代就正式開放權重給大家下載,可部署在企業級地端 AI 伺服器上。
至於多數開發者真正等待的較小型模型 Qwen3.8-27B,官方確認仍會開放權重,但釋出時間延後,目前沒有明確日期。本文整理已上架的 2.4T 模型完整規格與基準數據、跑得動它需要什麼等級的硬體、社群量化生態的現況,以及它與 Kimi K3、DeepSeek V4 Flash 的三方格局。
已經先上架的內容兩個官方 repo
Hugging Face 的 Qwen 組織下目前有兩個 Qwen3.8 相關 repo:
Qwen/Qwen3.8-2.4T-A95B:BF16 完整權重,Safetensors 格式,相容 vLLM、SGLang 與 TokenSpeed。
Qwen/Qwen3.8-2.4T-A95B-FP8:官方 FP8 量化版,採 block size 128 的細粒度 FP8 量化,官方表示效能指標與原始模型幾乎相同。對中大型企業自組 AI 伺服器的用戶而言,這個版本直接把權重體積砍半,是實務上的首選起點。
兩個 repo 的授權均標示為自訂的「qwen3.8-max」授權,並非 Apache 2.0。條款細節請務必在部署前詳讀 repo 內的 LICENSE 檔案。
一個容易踩雷的重點是開放權重版不等於 API 上的 Qwen3.8-Max。該公司釋出的模型卡明確說明,開放的 Qwen3.8-2.4T-A95B 是純文字模型,且強制啟用思考模式,無法關閉,每個回應都會先輸出 <think> 推理內容。API 上的 Qwen3.8-Max 則是以此為基礎的加值版本,額外提供視覺輸入、非思考模式、預設 1M 上下文與官方內建工具。所以呢,千問的多模態能力並沒有隨權重開放,因此,需要視覺輸入的用戶仍然只能乖乖付費用官方 API。
Qwen3.5 血統的混合注意力 MoE 架構解密
阿里巴巴這次公布的模型卡,首次完整公開這一代旗艦架構,有幾個值得注意的設計:
| 項目 | 規格 |
|---|---|
| 總參數 / 活躍參數 | 2.4T / 95B |
| 層數 | 92 層 |
| 隱藏維度 | 8192 |
| 層布局 | 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) |
| 專家配置 | 512 個專家,每 token 啟用 10 路由 + 1 共享 |
| 專家中間維度 | 2048 |
| MTP | 多步訓練的多 token 預測頭 |
| 原生上下文 | 262,144 token,可延伸至 1,010,000 |
架構建立在 Qwen3.5 的基礎上,最大特徵是線性注意力與標準注意力的混合布局,每 4 層中有 3 層採用 Gated DeltaNet 線性注意力,僅 1 層保留 Gated Attention 標準注意力。這種 3:1 的比例設定,大幅壓低了長上下文的 KV cache 成本,是它能撐到百萬 token 上下文的關鍵。MTP 投機小模型經過多步訓練,意味著推測解碼加速在官方層面就有支援基礎。
強制思考模式搭配 reasoning_effort 參數(xhigh、medium、low 三檔)與 preserve_thinking(保留歷史訊息的推理脈絡),顯示這一代的定位完全朝長程代理任務傾斜。官方建議取樣參數為 temperature=1.0、top_p=0.95、top_k=20,代理任務建議推理內容上限拉到 262,144 token、最終回應 131,072 token。
官方自己公布的成績顯示開放權重首次貼近閉源前段班 !
官方公布的基準將 Qwen3.8-Max 與 Claude Opus 4.8、Claude Fable 5、GPT 5.6 Sol 並列,重點數字如下(廠商自測,評測環境詳見模型卡註記):
| 基準 | Opus 4.8 | Fable 5 | GPT 5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 67.7 |
| PaperBench | 80.3 | 88.8 | 90.5 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 75.1 |
| CoWorkBench | 72.3 | 75.9 | 71.5 | 74.8 |
| GPQA Diamond | 92.0 | 92.6 | 94.1 | 92.6 |
| IFBench | 62.2 | 63.5 | 72.7 | 82.8 |
| HealthBench | 52.4 | — | 55.3 | 60.2 |
| MRCR v2 256K | 83.2 | — | 93.8 | 92.9 |
CyberQ 提醒,判讀這次官方公布的資料時要留意三點。第一,這是廠商自測數據,且大量使用 Claude Code 作為評測 harness,各家評測條件不完全對齊。
第二,Qwen3.8-Max 在 PaperBench、IFBench、HealthBench 等項目領先所有閉源對手,在 Terminal Bench 與長上下文檢索(MRCR)貼近第一名,但在 SWE-bench Pro 與 DeepSWE 等硬核軟體工程項目仍與 Fable 5 有明顯差距。
第三,相較前代 Qwen3.7-Max 的進步幅度非常大,DeepSWE 從 21.6 跳到 56.6,FrontierSWE 從 40.7 跳到 73.5,這種顯著的變化,是目前社群關注的焦點。
無論如何,一個基準上能與 Opus 4.8 和 GPT 5.6 Sol 同桌的模型,現在權重就放在 Hugging Face 上任人下載,這件事對產業來說,就是個重要的里程碑。
需要怎樣的機器才跑得動
2.4T 參數的權重記憶體需求非常之高:
| 精度 | 權重記憶體 | 硬體等級 |
|---|---|---|
| BF16 | 約 4.8TB | 多節點 GPU 叢集(如 8 節點 × 8 × H200 141GB) |
| FP8(官方版) | 約 2.4TB | 單節點放不下,仍需多節點或 NVL72 級機櫃 |
即使每 token 只啟用 95B 參數,MoE 的本質是全部 2.4T 權重都必須常駐在加速器可及的記憶體中。而 KV cache 拜混合注意力架構之賜雖然相對可節省一些記憶體,但在這種超大記憶體規模用量的情況下不是重點了。這款模型的首要服務對象,是給雲端供應商、大型企業與研究機構自架的模型,不是個人開發者或小型公司能負擔得起的。開發者熱門的 DGX Spark 的 128GB 統一記憶體連權重的零頭都放不下,Mac 平台的話要更多記憶體也才能載得下,而本站測試平台這次只能先透過 API 體驗。
這也正是 27B 市場期待它開放下載的原因。以 27B 級模型推算,BF16 約 54GB、FP8 約 27GB、4-bit 量化約 14 至 16GB(不含 KV cache),Unsloth 先前預告量化版約 17GB 記憶體可跑。一張 24GB 消費卡就能承載的先進規格模型,才是真正能改變地端 AI 部署格局的重點產品。阿里巴巴官方有確認 27B 仍在路上,只是要再等一段時間。
社群量化現況自然是 2.4T 太大,火力全部留給 27B
權重上架後的社群反應呈現有趣的分化。
2.4T 版本這邊,量化的意義有限。官方已提供 FP8,再往下壓到 4-bit 也還有 1.2TB 上下,脫離消費級與工作站硬體的範圍,因此 GGUF 社群對它興趣缺缺,目前 Hugging Face 上僅有零星衍生量化。推論引擎支援則是率先支援,對雲端業者與大型公司來說很需要,vLLM 與 SGLang 均已發布 Qwen3.8 的官方部署 recipe 與 cookbook,多節點部署是有彈性的。
27B 這邊則是萬事俱備只欠權重。量化作者 huginnfork 先前預先註冊的 FP8 與 NVFP4A16 佔位 repo 仍在待命,公開的量化配方(僅量化 MLP 層,注意力區塊與 MTP 頭保留 bf16,NVFP4 採 W4A16)沿用自 Qwen3.6-27B 家族的成熟作法。Unsloth 依慣例會在權重上架後數小時內出貨 Dynamic GGUF,CyberQ 指出,若以 Qwen3.6 部署經驗來看,預估 Q4_K_M 是甜蜜點,MTP GGUF 搭配 llama.cpp 的推測解碼支援可再帶來約 1.4 至 2 倍加速。2.4T 版本確認保留多步訓練的 MTP 投機模型,若 27B 同樣保留,這條加速路徑可望直接沿用。
授權屬於自訂條款,商用前必讀
兩個官方 repo 的授權欄位均標示「qwen3.8-max」,是為這一代量身打造的自訂授權,而非 Apache 2.0。這延續了 Qwen 在旗艦級模型上的一貫作法(前例是內含一億月活躍用戶門檻的通義千問授權)。發表初期社群曾流傳條款疑似對特定地區設限的說法,在官方授權全文面前,這類二手轉述都應以 repo 內的 LICENSE 檔案為準。對台灣的企業用戶而言,導入評估時除了技術驗證,法務端的授權審閱這次是必要程序,特別是打算以此模型提供對外服務的公司,授權部分要留意。
三強對照:開放權重的天花板之爭改寫了
Qwen3.8 權重落地後,2026 年下半年的 AI 模型開放權重頂級版本就有新局面囉:
| 項目 | Qwen3.8-2.4T-A95B | Kimi K3 | DeepSeek V4 Flash 0731 |
|---|---|---|---|
| 開發商 | 阿里巴巴 Qwen | Moonshot AI 月之暗面 | DeepSeek 深度求索 |
| 權重釋出 | 2026/8 中旬 | 2026/7/27 | 2026/7/31 |
| 總參數 | 2.4T(MoE,512 專家選 10+1) | 2.8T(MoE,896 專家選 16) | 284B(MoE) |
| 活躍參數 | 95B | 104B | 13B |
| 注意力架構 | Gated DeltaNet + Gated Attention 混合(3:1) | Kimi Delta Attention + Stable LatentMoE | 標準 MoE |
| 上下文 | 原生 262K,可延伸至 1.01M | 1M | 1M |
| 模態(開放版) | 純文字 | 原生視覺 | 純文字 |
| 思考模式 | 強制啟用,三檔 reasoning_effort | 支援 max thinking | 低中高三檔 effort |
| API 定價(輸入/輸出,每百萬 token) | $2 / $6 | 約 $2.31 混合 | 約 $0.08 至 $0.15 起 |
| 授權 | 自訂 qwen3.8-max 授權 | 自訂 Kimi K3 授權(MaaS 營收逾 2000 萬美元須另議) | 相對寬鬆(V4 Pro 為 MIT) |
三者的定位在權重落地後更加清晰。Kimi K3 仍是獨立評測的智慧榜首(Artificial Analysis 指數約 57 至 60),且是三者中唯一具備原生視覺的開放模型。DeepSeek V4 Flash 以 13B 活躍參數與地板級定價(快取命中低至每百萬 token 0.0028 美元)守住成本效率的位置。Qwen3.8 則帶來三者中最完整的閉源對標數據,是第一個敢在模型卡上直接列出與 Opus 4.8、Fable 5、GPT 5.6 Sol 逐項對決的開放模型,並以混合注意力架構在長上下文效率上另闢蹊徑。
值得玩味的是各家基準測試依然互不列入彼此,Qwen 的對照表只放閉源模型,Moonshot 與 DeepSeek 的圖表也互相缺席。開放權重陣營內部的直接對決,要等獨立評測機構補上。
產業影響:Max 級開源改變了什麼
CyberQ 觀察,開放權重模型的天花板真的是變化很快,六週內,Moonshot 開放 2.8T 的 K3,阿里開放 2.4T 的 Qwen3.8,兆級參數旗艦開源從特例變成常態。中國實驗室之間的競爭大概是這樣,閉源模型留給加值服務(視覺、內建工具、託管推論),而基礎模型本體則改成全面開放換取開發者生態與市場話語權。Qwen 模型卡上寫出「首次將 Max 級模型開放釋出」的宣示,等於直接回應了 K3 開源的壓力。
雲端推論供應商成為最大受益者。 2.4T 模型的自架門檻是多節點叢集,絕大多數用戶跑不動,但第三方推論業者都跑得動。開放權重讓 Baseten、Together 這類供應商得以在阿里官方 API 之外提供替代服務,價格競爭與資料主權選項(例如針對需要非中國市場 AI 算力的用戶)也跟著出現。對受 ITGC 或資安規範約束的企業,「同一個模型、不同司法管轄區的供應商」成為市場上可行的採購選項。
本地部署的希望仍寄託在 27B,儘管 2.4T 的開源在戰略上震撼,但是在個人與中小企業的實務上無感。真正能進入工作站、NAS 推論平台與 homelab 的是 27B。若它繼承這一代的後訓練成果與 MTP 加速路徑,將是 2026 年本地 AI 最重要的一次釋出。
台灣市場可關注這個模型的發展,絕對是要注意的,對本地 MSP 與系統整合商 SI 而言,短期的實務建議是,需要 Qwen3.8 能力的專案先以 API 或第三方託管驗證效益,同時將授權審閱納入評估流程,等 27B 落地後再評估地端方案。混合注意力架構對推論框架版本的要求較高,自架時務必使用 vLLM 與 SGLang 的最新版本與官方 recipe。
CyberQ 觀點
這次 Qwen3.8 的權重落地方式是先開放跑不動的旗艦,讓比較多人跑得動的 27B 晚一點發,這個順序本身就是訊息。旗艦開源承擔的是基準話語權與生態卡位,27B 承擔的才是實際採用,Qwen 基於市場考量,選擇先拿話語權。
CyberQ 將持續追蹤 27B 的釋出動態,權重落地後在 DGX Spark 與消費級 GPU 、Mac 等平台上進行實測,包含 vLLM FP8 部署、GGUF 量化品質對比與 MTP 推測解碼加速實測,敬請期待。








