阿里巴巴旗下 Qwen 團隊近日發布了最新的 Qwen3.8-Flash-Next 模型。這款模型採用的是 Qwen4 預計採用的實驗性預覽版架構,是一款多模態超稀疏混合專家模型,能夠用較少的啟用參數降低運算成本。
超稀疏混合專家模型與 N-gram Embedding
這款模型最值得關注的地方在於其採用的超稀疏混合專家模型架構,模型主體具有125B參數,但每個 token 只會啟用其中6B參數,另外還包含51B N-gram Embedding 與 4B MTP 參數,相較於 Qwen3.8-27B密集型模型每 token 就需要啟用27B參數,新架構有效減少了每個 token 所需的主要模型運算量。
這款模型還有一個特殊設計是51B N-gram Embedding,它是以由2至3個 token 組成的短序列索引嵌入表,藉由少量額外運算擴大模型容量。這組 N-gram Embedding可卸載至主機記憶體,並透過非同步預取與GPU計算重疊來減輕加速器記憶體的壓力及部分資料傳輸延遲的問題。

整體模型架構圖 Photo Credit by https://qwen.ai/
原生支援超長上下文與高效訓練
這款模型在處理長篇內容方面,改為使用 Gated DeltaNet(GDN)與Qwen Sparse Attention(QSA)的混合架構。GDN負責壓縮歷史資訊,QSA則以微型區塊為單位選取重要內容,以此來降低長上下文的注意力運算成本。這項設計讓模型原生支援262,144 token,並可透過YaRN等RoPE縮放技術延伸至100萬 token,適合用來處理大量技術文件、程式碼或會議紀錄。但是當延伸至100萬 token 後的實際效能,仍會受到推論框架、硬體配置及相關設定影響。
模型採用 Gated Residual,將負責在各模型層之間保留及傳遞資訊的通道擴展為四個分支,再透過動態閘門控制各分支讀取與寫入資訊的方式,訓練時則依不同權重類型搭配Muon與AdamW最佳化器。
官方表示,與Qwen3.7-Plus相比,Qwen3.8-Flash-Next的訓練成本約為九分之一,推論成本也大幅降低,同時改善訓練穩定性。這代表新架構不只著重降低模型運作時的成本,也試圖從訓練階段提高整體效率。
聚焦 AI 代理人與高吞吐應用
根據 Qwen 在Hugging Face公布的官方模型介紹與規格資料,Qwen3.8-Flash-Next的評測重點涵蓋代理式程式開發、長時間辦公任務、專業工作與工具使用。從官方公開的測試項目來看,這款模型的重點不只在一般對話,更在於需要長上下文、程式開發及反覆使用工具的AI代理人工作。
搭配Qwen Code或其他具備檔案與工具權限的代理框架後,這款模型可用於讀取大型程式庫、修改多個檔案與除錯。官方以Claude Code框架進行SWE-bench Pro測試時,Qwen3.8-Flash-Next獲得62.5分,略高於Qwen3.8-27B的61.7分。

Qwen官方公布的純文字評測結果,涵蓋程式開發、AI代理人、工具使用與一般推理能力。Photo Credit by https://qwen.ai/
在商務環境中,模型也可透過代理系統連接API、資料庫或檔案系統,執行複雜的多步驟工作。其長上下文能力也適合協助處理大量合約、內部文件或會議紀錄,但實際使用時仍須驗證資料擷取與分析結果。模型本身並不會自動取得這些系統的存取權,企業仍須自行設定代理框架、工具及權限。
Qwen3.8-Flash-Next 具備視覺編碼器,能夠理解圖片、影片與操作畫面。搭配電腦操作型代理框架後,可以根據畫面內容判斷下一步操作,朝向能理解畫面並使用工具的AI代理人發展。

多模態評測 Photo Credit by https://qwen.ai/
對需要處理大量推論請求的服務而言,每個 token 僅啟用6B參數,確實能減少主要模型的運算量,但是實際延遲與成本仍會受到硬體、推論框架、權重卸載方式、同時處理的請求數量及上下文長度影響,不能只根據啟用參數量來判斷。
企業也可以將模型部署於封閉環境,處理內部程式碼與文件。不過,Qwen3.8-Flash-Next 採用 Qwen Community License 1.0,依照授權條款,若模型僅供公司內部使用,且不向第三方提供模型、輸出結果或底層能力,不會受到另外取得授權的條款限制;但是若要對外提供模型服務,或經營以程式開發、辦公生產力為主的商業AI助理,就必須先向 Qwen 另外取得授權。
本地部署仍需大量記憶體
雖然模型主打每個 token 僅啟用6B參數,但官方模型卡列出125B主模型參數、51B N-gram Embedding與4B MTP參數,完整模型規模為180B,目前釋出的BF16權重檔約為360GB。6B只代表每個 token 參與主要運算的參數量,並不表示只需要載入6B權重。本地部署時仍須透過GPU記憶體、主機記憶體或儲存裝置,容納完整或量化後的必要權重,雖然 N-gram Embedding 與部分模型權重可以卸載至主機記憶體,但整體記憶體需求仍遠遠高於7B模型,實際所需硬體則會因量化格式、推論框架與權重卸載方式而有所不同。
CyberQ觀點
Qwen3.8-Flash-Next 的設計並不是單純縮小模型,而是將模型具有的總容量與每次實際使用的運算量分開處理,走的是重視效率的模型擴充路線,透過超稀疏混合專家架構、稀疏注意力、Gated Residual與可卸載的N-gram Embedding,在擴大模型容量的同時控制每個 token 的運算量。
官方測試顯示,這套架構適合被運用在代理式程式開發、辦公任務與工具使用,但是實際成本效益仍取決於硬體、推論框架、上下文長度與代理系統的整合方式,而且企業也必須將權限管理、資料安全及模型輸出驗證等因素一併納入考量。
由 於Qwen3.8-Flash-Next是Qwen4架構的實驗性預覽版本,相關技術後續如何應用於正式的Qwen4模型也值得大家持續關注。至於這套架構是否會成為自動化開發與公司AI代理系統的重要基礎,仍有待正式模型發布及更多的實際部署來驗證。
本文首圖由 AI 生成








