DeepSeek 於 2026 年 9 月 10 日正式推出 DeepSeek V4.1 Flash,這是 Flash 系列首次由「改版」躍升為「全新架構」的關鍵版本。與先前僅在 V4 Flash 上做微調不同,V4.1 Flash 採用 DeepSeek 自研的 Causal Encoder-Decoder(CED)架構,主打更低成本、原生多模態與極度壓縮的 KV cache,並在官方聲明中宣稱在效能、成本、速度與任務完成時間等所有關鍵指標上全面超越 V4 Pro。
不是小改版:一次架構級的大翻新
過往 DeepSeek 的 Flash 型號多半是旗艦級的輕量化或同架構微調,但 V4.1 Flash 完全不一樣。它是一顆 552B 參數的 MoE 多模態模型,支援高達 100 萬 token 的上下文,並原生處理圖像與文字。真正的亮點在「不對稱」:由於 CED 架構,輸入(prefill)階段每 token 只需啟動 8B 參數,輸出(decode)階段約 16B 參數,遠低於同規模其他模型。
CED 的做法是將 40 層 Transformer 拆成 20 層因果編碼器 + 20 層解碼器,而解碼器的全域 KV cache 並非各自從每一層自己去建,而是從最終編碼器隱層狀態投影而來。這意味著較長的前置輸入只會停在編碼器端,大幅降低 prefill 運算成本,對「輸入密集」的 agentic 工作負載特別友善,這正是當前 AI agent 應用的主戰場。
把 KV Cache 壓到 1/4:CSA2 + FP4 + SWA Bounded Replay
KV cache 是長上下文與便宜推論的頭號殺手。DeepSeek 這次一次上了多個殺手鐧:
- Compressed Sparse Attention 2(CSA2):每個注意力層在三種靜態模式(Full、Reindex、Reuse)間切換,跨層共享主要 KV 與索引器 K,並重用 Top-K 稀疏注意力索引,避免重複計算。
- 階層式稀疏索引器(Hierarchical Sparse Indexer):限制後續索引層只在第一個 Full 層構建的候選池內運作,讓更深層的索引成本不隨上下文長度線性爆炸。
- FP4 主 KV 快取(E2M1 格式,每 16 通道一個 E4M3 尺度):把全域 KV cache 縮到每 token 僅 890 bytes,約為 V4 Flash 的 1/4、DeepSeek V1 的 1/437。
- SWA Bounded Replay:重建缺失的滑窗注意力(SWA)KV 狀態時,只重放最近的引導 token,不必把 SWA KV 永久寫進 SSD,把持久 KV cache 佔用再砍到 V4 Flash 的約 1/8。
這套組合拳讓全球 KV cache 每 token 只有 890 bytes,是官方宣稱的核心數字。有人形容這是直接瞄準「agent 經濟」時代唯一真正的瓶頸——HBM 與 SSD 頻寬。
其他創新零件:Engram 記憶 + DSpark 推論
除了注意力機制,模型還搭配了多項特殊零件:Single-Pass mHC(改良殘差流混合與高效 Mega-mHC kernel)、Engram 條件式記憶(額外的 196B 參數,靠 token 查詢稀疏存取)、DSpark 推測式解碼(半自迴歸草稿生成,搭配信心排程驗證)。每個 MoE 層使用 1 個共享專家與 384 個路由專家,每 token 啟動 6 個路由專家。
視覺部分採用從零訓練的 DeepSeek-ViT(2D-RoPE 加上 3×3 pixel-unshuffle 降取樣)與兩層 MLP 投影器,讓影像與文字在語言模型預訓練初始就一起處理。預訓練在多模態語料上跑了 45T tokens,在 34T tokens 時把上下文延伸至 1M token。後訓練維持標準的 SFT → RL → on-policy distillation 流程,重點放在資料管線的自動化 agent 任務合成。
支援「連續可調推理強度」,1–100 自由取捨成本與準確度
V4.1 Flash 支援整數 1–100 的連續可調推理強度(reasoning effort),這是對過往「思考長度固定」的一大改善:你可以按任務難度在成本與準確度之間取捨,從快速簡答到深度長思考都交給同一顆模型控制。官方所有 instruct benchmark 皆以最大強度(reasoning_effort=100)測試。
效能:不全面碾壓,但以 Flash 之身追平旗艦
官方在最大推理強度下的對標結果(皆出自 DeepSeek 自家評測,非獨立複驗):
- Terminal-Bench 2.1:90.6(超越 Opus-5.0 的 89.1 與 GPT-5.6 Sol 的 88.8)
- DeepSWE v1.1:74.2(亦微幅超越 Opus 的 74.0)
- CyberGym:88.1、AutomationBench:54.8、Agent’s Last Exam:31.8——皆列全場最高
- Codeforces:3471(超越 V4 Pro 的 3348)
- 但不全然是橫掃:GPQA Diamond 90.9 輸給 GPT-5.6 Sol 的 94.1;HLE 36.8 比 Opus 的 56.3 有一段差距;Terminal-Bench 3.0/4.0 分別僅 30.0/31.2,遠低於 Opus 的 43.3/51.8——官方自己也在報告中明說,在最難的長程推理與邊緣案例上仍追不上最大型封閉模型。
媒體與開發者的共識是:這顆模型的價值不在「每項都第一」,而在「每美元能做的長上下文 agent 工作量」,它在多數編程、終端、自動化與工具使用評測上保有競爭力,價格卻只到旗艦的一成左右。
價格與 API:恐龍落地前的降價潮
官方宣布自 9/10 12:00 起調整 Flash 系列價格(離峰:輸入快取命中 $0.003/M、未命中 $0.15/M、輸出 $0.60/M;尖峰時段為離峰兩倍)。模型 API 名稱切換為 deepseek-flash。
更勁爆的是舊版 V4 Pro 將被逐步汰換:9/14 12:00 起到 V4.1 Pro 釋出為止,所有打到 deepseek-v4-pro 的請求都會被轉送到 V4.1 Flash,並以 Flash 的價格計費。也就是說,DeepSeek 用一顆「入門款」直接替掉了自家旗艦 Pro,這在業界相當罕見,也側面印證了官方對 V4.1 Flash 能力的信心。有開發者笑稱「現在要跑自建場景,硬體得重新規劃了」。
社群怎麼看:掌聲與疑慮並陳
社群的幾個顯著聲音:
- 對架構創新的讚嘆:「DeepSeek 每年都端出瘋狂又有創意的新點子,而且總是敢用接近旗艦規模去訓練。」「DeepSeek 發明了整套推理範式又持續推進,希望他們得到應得的成功。」「每個模型都以系統工程的角度去優化,真的很過癮。」
- 鼓掌但也點出痛點:「552B 幾乎是原版 V4 Flash 284B 的兩倍,已經不『flash』了,這波分數大漲一部分是參數換來的。」自建/本地推論玩家普遍失望,因為記憶體需求暴漲,多數消費級硬體已跑不動。
- 性價比成為主旋律:「對大量軟體任務而言,砸 10 倍錢買封閉旗艦已不再划算。」「DeepSeek 是我們軟體工廠的『主力』。」「有效成本可再降八成,直擊 agent 循環的財務瓶頸。」
- 保留意見:有人點出 Gemini 3.8 Flash 仍是最便宜的測評一哥、Google 模型多半一發命中;也有人提醒 DeepSeek 明確會拿你的 prompt 做訓練,敏感內容(例如 Navier–Stokes 最後一步、商業機密)最好換不追蹤的 provider。
- 實測回饋:有人拿去跑自家 Kubernetes 安全基準測驗,得到「又快又便宜又高分」的評價;也有人回報它比 V4 Pro 更能完成刁鑽任務(例如下載其合法持有的舊遊戲 ROM),但相對也更愛燃燒 reasoning token。
CyberQ 觀點
V4.1 Flash 真正的訊號是——Flash 系列正從「輕量版」變成 DeepSeek 的主力產品線,而「每 token 成本×能完成的 agent 工作量」取代「峰值分數」,成為下一代模型競爭的核心度量。DeepSeek 用一顆入門款取消自家旗艦的決定,更是把「架構效率」抬升為與「參數規模」同等重要的戰略資產。短期內,若你手上多是輸入密集的長上下文或視覺 agent 任務,V4.1 Flash 值得一測;但若極度依賴最難的長程推理,仍建議保留 Opus 或 GPT-5.6 一線備援。開源社群能否把 552B + CED 推到消費級硬體,將是接下來最值得觀察的變數。






