Google 於 2026 年 9 月 2 日正式發表 Gemini 3.8,距離 3.7 Flash 上市僅三週,也是六週內第三款 Flash 系列模型。此次同時推出兩個版本,一般用途的 Gemini 3.8 Flash 維持 3.7 Flash 的價格與速度,而資安專用的 Gemini 3.8 Flash Cyber 不對外公開,只透過新成立的 Fairwind Program 提供給經審核的防禦方使用。

CyberQ 團隊在取得 Gemini 3.8 Flash 後,第一時間於本地環境搭建針對 C/C++ 記憶體安全與 Web 應用漏洞的驗證環境,針對官方宣稱的軟體工程與漏洞自動修補能力進行獨立實測。我們整理了官方測試資料、取用機制,並附上 CyberQ 的第一手實測驗證成果。
兩個版本,同一個核心
依 Google 官方部落格,兩款模型共用相同的基礎模型,差別在於針對不同部署情境調校。Google 表示這一代的推理與程式能力提升,部分來自在資安領域的高強度訓練,並透過長時間執行的代理迴圈反覆評估與修正模型。
| 項目 | Gemini 3.8 Flash | Gemini 3.8 Flash Cyber |
|---|---|---|
| 定位 | 一般用途主力模型,強調長程軟體工程與代理任務 | 資安專用,強調漏洞探勘與自動修補 |
| 取用方式 | Gemini API、AI Studio、Antigravity、Gemini Enterprise、Gemini App(Pro 與 Ultra 訂閱) | 僅限 Fairwind Program 審核通過的政府機關、關鍵基礎設施營運者與軟體維護者 |
| 價格 | 每百萬輸入 token 0.75 美元,輸出 3.75 美元(優惠價至 2026 年 12 月 31 日,之後調整為 1.50 與 7.50 美元) | 未公布 |
| 安全機制 | 依 Frontier Safety Framework 對 CBRN 與攻擊型網路能力設有防護 | 資安相關限制較寬鬆,因此只開放給受信任的防禦方 |
1. Gemini 3.8 Flash
Google 宣稱 3.8 Flash 在多項評測上接近成本更高的尖端模型:
DeepSWE v1.1(長程軟體工程):3.8 Flash 得分 71.0%,較 3.7 Flash 的 65.3% 提升近 6 個百分點。Claude Opus 5 在同一評測為 74.0%,但 Opus 5 的 API 定價約為 3.8 Flash 優惠價的 6 至 7 倍。
HLE-Verified:得分 54.9%,展示在 STEM、人文與專業領域的多步推理能力。
專業領域代理評測:在 Vals Finance Agent V2 與 Harvey’s Legal Agent Benchmark 上超越 3.7 Flash 與其他尖端模型。
仍落後的項目:在 Terminal-bench 4.0 得分 19.1%(Claude Opus 5 為 51.8%);OSWorld 電腦操作評測為 59.0%(Opus 5 為 75.4%)。顯示在極長時間自主操作與桌面環境互動仍有進步空間。
2. Gemini 3.8 Flash Cyber
Flash Cyber 取代先前的 3.5 Flash Cyber,並將資源重點投放於漏洞修補(Auto-Patching):
自主漏洞探勘:在 CyberGym 與包含 20 種程式語言的內部評測中,成功率超過 70%。
自動修補(CWE-Bench):在 Collinear 營運的外部評測 CWE-Bench 上,pass@1 為 47.2%,接近領先旗艦模型的 47.8%。
實戰案例:Chrome 安全團隊表示其修復數量為大型商用模型的 2.6 倍;Wiz 滲透測試召回率高出 7.5 至 9.7 個百分點;Google Cloud 團隊曾藉此在兩小時內定位基礎架構關鍵漏洞。
CyberQ 本地獨立實測:Gemini 3.8 Flash 漏洞修補能力
針對官方公布的軟體代理與 CWE 漏洞修補表現,CyberQ 於 Linux (Ubuntu 24.04 / GCC 13.3 / Python 3.12) 環境下構建兩組典型 CWE 漏洞專案,實測 Gemini 3.8 Flash 在「無提示漏洞審查、錯誤定位、自動修補(Auto-Patching)與回歸測試」的完整表現。
實測一:C/C++ 記憶體安全(CWE-193 / CWE-787)
測試情境:網路封包解析器的結構體緩衝區(MAX_NAME_LEN 64)。
原始缺陷:邊界檢查寫為 name_len > MAX_NAME_LEN,當接收剛好 64 位元組輸入時,後續補上字串結束符 name[64] = '\0' 造成單一位元組越界寫入(Off-by-one Stack Buffer Overflow)。
修補前驗證:以 AddressSanitizer(-fsanitize=address)編譯執行,觸發邊界條件時程式立即被 ASan 崩潰攔截(WRITE of size 1 at stack-buffer-overflow)。
3.8 Flash 處置:
正確識別出 CWE-193 差一錯誤與 CWE-787 越界寫入。
精確定位根因為「未替 Null Terminator 預留長度」。
自動產出 Patch:將邊界條件修改為 if (name_len >= MAX_NAME_LEN) return -3;。
修補後驗證:重新透過 ASan 測試,正常封包解析無損,超長與邊界封包皆安全被拒,ASan 回報零錯誤。
實測二:Web 服務安全(CWE-22 路徑走訪與 CWE-78 指令注入)
測試情境:後端檔案儲存模組,提供檔案讀取與備份打包功能。
原始缺陷:
read_file 採用無效的 replace("../", ""),可輕易以 ....// 或絕對路徑脫離沙盒目錄(CWE-22)。
backup_data 使用 subprocess.run(f"tar ... {archive_name}", shell=True),傳入字串拼接導致指令注入(CWE-78)。
修補前驗證:Pytest 4 項驗證中有 3 項失敗(惡意路徑成功讀取外部密鑰,指令注入成功在目標路徑建立標記檔)。
3.8 Flash 處置:
將路徑處理全面重構為 pathlib.Path.resolve(),並使用 target_path.relative_to(base_dir) 進行強制沙盒約束。
移除 shell=True,改用清單引數(["tar", "-czf", ...])杜絕 Shell 語意解析注入。
修補後驗證:Pytest 4 項安全與功能測試 100% 全數通過(4 passed in 0.09s)。
Fairwind Program 與取得機制
Fairwind Program 是 Google 為 Flash Cyber 設立的審核發放管道,旨在防止具備強大漏洞挖掘能力的模型遭濫用。
優先審核對象:政府機關、關鍵基礎設施(CNI)營運者與開源軟體維護者。
申請入口:deepmind.google/fairwind-program。
首批夥伴:Palo Alto Networks、Snowflake、Wiz 與 Armadin。
台灣單位現況:目前官方文件未載明地區限制,但申請需經受信任防禦方審核流程。
CyberQ 觀點
綜合官方數據與 CyberQ 的第一手實測,我們提出三項關鍵觀察:
防禦方與攻擊方的模型發放分水嶺已成型:
從 Anthropic 的 Claude Mythos 5.1 到 Google 的 Fairwind Program,資安專用模型全面走向「僅限審核通過防禦方」的發放模式。對於一般企業與安全團隊,與其等待取得專用模型,不如善用通用版 3.8 Flash 建立結構化的安全修補代理流程,並透過整合了 Cyber 能力的第三方資安平台(如 Wiz、Palo Alto Networks)獲取進階的攻防效益。
通用版 3.8 Flash 已具備第一線防禦與修補實力:
在實際測試中,Gemini 3.8 Flash 不需要依賴未公開的 Cyber 版本,就已展現出成熟的軟體工程除錯與安全修補能力。對於企業內部的 Code Review、靜態分析後續修復、以及 CI/CD 安全管線整合,一般版 3.8 Flash 搭配合適的測試工具鏈(如 ASan、Pytest、靜態掃描器)已完全能勝任防禦任務。
成本效益為自動化代理的最大槓桿:
在長程軟體工程(DeepSWE 71.0%)與修補精度上,3.8 Flash 與旗艦模型(如 Claude Opus 5)僅有微幅差距,但價格差了 6 至 7 倍。這意味著企業可以以極低成本在 CI 流程中為每個 Pull Request 自動跑多輪「偵測-修復-編譯測試」迴圈,這是過去旗艦模型高昂成本難以普及的場景。
延伸閱讀
Google 官方部落格,Introducing Gemini 3.8 Flash and 3.8 Flash Cyber。https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Google DeepMind,Gemini 3.8 Flash 模型頁面。https://deepmind.google/models/gemini/flash/
Google DeepMind,Fairwind Program。https://deepmind.google/fairwind-program/
Collinear,CWE-Bench 排行榜。https://cwe-bench.com/#leaderboard








