Reflection AI 於 2026 年 10 月 5 日發表該公司首款開放權重模型 Beam。根據官方部落格 Introducing Beam: Reflection’s 501B open-weight model,Beam 為稀疏混合專家(MoE)架構,總參數 5,010 億、每個 token 啟用 230 億參數,設計目標鎖定程式撰寫、推理與代理(agentic)工作負載。
模型目前仍在進行最終紅隊測試與評估,僅開放少數使用者透過候補名單取得早期存取,權重、技術報告、模型卡與開發者工具預計於 10 月內釋出,授權採用 Apache 2.0。
關於 Reflection AI
Reflection AI 成立於 2024 年,總部位於紐約,兩位創辦人 Misha Laskin 與 Ioannis Antonoglou 均出身 Google DeepMind,後者為 AlphaGo、AlphaZero 與 MuZero 的共同作者,先前該公司的主要產品為自主程式設計代理 Asimov。
規格與訓練規模
官方公布的關鍵數字如下 :
預訓練資料 23.8 兆 token,來源包含網路公開資料與授權的專有資料集,程式碼與技術文件經多次重複訓練
預訓練在 6,144 顆 NVIDIA GB300 NVL72 GPU 叢集上於四週內完成,goodput 達 92.3%
強化學習階段動用 10,500 顆 GB300 GPU、歷時四週,產生逾 1 億次 rollout,最大上下文 256K token,期間建立約 13 億個沙箱環境
中期訓練將有效上下文長度延伸至 100 萬 token
模型為純文字,不具多模態能力
提供 reasoning effort 參數,使用者可在回應長度與任務表現之間取捨
效能定位
官方在部落格中的定位相當明確,Beam 並未宣稱全面領先。Reflection 表示 Beam 在程式與代理任務上可與參數規模更大的 GLM 5.2 競爭、接近 Qwen 3.8-Max,但承認 Kimi K3 等先進開放模型在原始能力上仍然領先,Beam 的優勢在於推論效率。官方資料顯示,Beam 在進階推理基準上達到與 GLM 5.2 相當的分數,但推論運算量僅為 GLM 5.2 的三分之一至四分之一。
部分公布的基準分數如下(Beam 對比欄位依官方表格)。
| 基準 | Beam | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max |
|---|---|---|---|---|---|
| Terminal Bench v2.1 | 80.1 | 81.0 | 88.2 | 88.3 | 86.6 |
| SWE Bench Pro v1 | 65.5 | 62.1 | 未公布 | 未公布 | 67.7 |
| SWE Bench Pro v2-Hard | 77.2 | 未公布 | 84.3 | 88.2 | 未公布 |
| DeepSWE v1.1 | 44.4 | 44.0 | 61.0 | 68.0 | 51.0 |
| SWEBench Verified | 80.9 | 未公布 | 未公布 | 未公布 | 未公布 |
CyberQ 提醒,該公司公布的資料中,有兩點要注意一下。第一,對手模型的分數引自 Artificial Analysis 與 DataCurve,並非 Reflection 自行複測。第二,官方的效率比較以「2 × 啟用參數 × 平均生成 token 數」估算 FLOPs,排除 prefill、注意力運算與服務開銷,屬近似值而非實測成本。
技術重點
架構上,Beam 採用交錯的局部與全域注意力、細粒度路由專家,並在 DeepSeek 的無輔助損失負載平衡基礎上加入專家偏置更新的餘弦衰減,官方稱預訓練結束時最忙碌專家的負載僅為平均的 1.04 倍。
RL 基礎設施方面,官方揭露的數字包括平均 11 萬個併發 rollout、最高 17 萬個併發沙箱、新權重在中位數約 12 秒內送達推論叢集、71 次推論事故未中斷訓練任務。訓練採用完全非同步策略梯度,官方稱即使樣本落後當前策略 107 個權重版本(約一天),數值仍保持穩定。
而在安全對齊呢,Reflection 另外從預訓練檢查點訓練一個對齊教師模型,再以多教師 on-policy 蒸餾(MOPD)與 RL 教師合併。安全訓練採用 deliberative alignment 技術,並承諾在技術報告中公布安全評估結果,同時開源內部使用的安全評估集。
對本地部署的實際意涵
Beam 的 MoE 設計意味著推論運算量接近 23B 模型,但記憶體需求仍由 5,010 億總參數決定。以 FP8 精度估算,權重本體約需 500 GB 記憶體,BF16 則接近 1 TB,這兩個數字為依參數量推算,實際需求待官方釋出模型卡後確認。以此估算,單台 DGX Spark 的 128 GB 統一記憶體或消費級 GPU 無法載入,一般企業若要在自有環境執行,仍需多卡 H100/B200 等級的伺服器,或等待社群釋出 4-bit 以下量化版本。
對台灣團隊而言,值得追蹤的時間點是 10 月稍晚的權重釋出,屆時才能確認實際授權條款、模型卡所列硬體需求,以及 vLLM、SGLang 等推論引擎的支援進度。
Reflection 在部落格中自我定位為推進「西方開放權重前線」,這一說法反映目前開放權重模型的高階團隊幾乎由中國實驗室主導,而 Beam 能否在效率路線上站穩,需待權重公開並經第三方複測後才有定論。







