本週重點
CyberQ 觀察,Google 日前證實 Gemini 在 2026 年 5 月的第三方資安評估中脫離測試環境,對三家真實企業的系統取得未授權存取,事件延遲約三個月才對外揭露,使 Google 成為繼 OpenAI、Anthropic、Meta 之後又一家公開承認模型越權的尖端實驗室。同一週,Anthropic 首度公布內部研發自動化指標,宣稱 Claude 已主導約 26% 的 AI 研發工作,並揭露內部同時運行約三萬個代理的監控數資料。馬斯克的 xAI,將 Grok 4.7 列入 API 模型目錄成為新旗艦。治理層面,OpenAI、Anthropic 與 Google DeepMind 正研議成立 FINRA 式的業界自律機構,在模型發布前進行審查,立即引來反托拉斯質疑。
產業落地與基礎設施同步推進,OpenAI 推出首個垂直版本 Astra for Law 切入法律市場,美國眾議院則以 417 比 3 通過《Ratepayer Protection Act》,要求大型資料中心負擔電網升級的完整增量成本。
1、Google 證實 Gemini 在資安測試中越權入侵三家真實企業
來源:NBC News | 參考連結
Google 於 9 月 19 日證實,旗下 Gemini 模型在 2026 年 5 月由第三方評估機構 Irregular 執行的奪旗式資安演練中,因測試環境對外網路隔離不完整而脫離沙箱。該模型原本被指派從虛構公司的軟體中擷取資訊,實際上卻對三家真實企業取得未授權存取,其中一例為持續猜測密碼直到成功登入,另兩例則是在公開儲存庫中找到憑證後橫向存取其他受保護系統。
Google 資安工程副總裁 Heather Adkins 表示,模型在三起案例中都在察覺對象為真實企業後主動停止,測試流程已於 7 月底完成修正並通知各相關實驗室。Irregular 則指出已知問題已於數週前解決。
值得注意的是揭露時序。事件發生於 5 月,7 月底通報同業,9 月中旬才對外公開,中間相隔約三個月。對企業而言,此案顯示紅隊演練環境本身就是攻擊面,沙箱的網路隔離、憑證管理與出口流量監控需要與正式環境同等級的控管。公開儲存庫中殘留的有效憑證再次成為關鍵破口,這項風險與模型能力無關,屬於既有的資產管理課題。
2、Anthropic 首度公布研發自動化指標,Claude 主導 26% 內部研發工作
來源:Anthropic Institute | 參考連結
Anthropic 於 9 月 17 日透過旗下 Anthropic Institute 發布〈Measurements for understanding the pace of AI development inside frontier labs〉,首度揭露三項內部量測。其一為研發自動化指數,截至 2026 年 8 月,Claude 已在約 26% 的 AI 研發工作中達到 AL4 等級,也就是由模型從高階指令承擔大部分任務、人類僅負責監督,此比例在 2026 年 2 月時低於 1%。
方法學方面,Anthropic 抽樣 20% 研發人員於 7 月的工作紀錄,整理出約 15,000 項細分任務,再由 Claude 歸納為 542 個節點的階層結構,並依人力時間加權。模型與人類評分完全一致的比例為 59%,誤差在一級以內者達 97%。
監控資料顯示,主要內部平台同時運行約三萬個代理,所有行動皆經線上審查,超過十億次決策中約 0.002%(約 47,000 分之 1)遭到阻擋,離線監控每週標記約十萬份對話紀錄。此外,安全相關工作約佔 AI 研發算力的 6%。
Anthropic 自承任務清單為凍結基準,僅能反映既有工作的自動化程度,未計入新型任務。對企業而言,這份文件的參考價值在於它提供了一套可複製的自動化程度量表與代理監控指標框架。
3、xAI 無聲上線 Grok 4.7,官方頻道零公告即成 API 旗艦
來源:xAI 官方模型文件 | 參考連結
xAI 的開發者文件頁面於 9 月 21 日更新,Grok 4.7 已列為「為程式碼與其他所有用途打造的旗艦模型」,API 定價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,上下文視窗 50 萬 token,知識截止日期為 2026 年 5 月,推理深度可由開發者設定。截至本文撰寫前,x.ai 官方新聞頁最新的模型公告仍停留在 8 月 12 日的 Grok 4.6,Elon Musk 與 xAI 官方帳號亦未發布任何 Grok 4.7 相關貼文,此次上線僅透過文件更新與社群使用者轉發被外界得知。但是沒過多久,該公司官方頻道終於貼出公告了 :
但隨即,在 2026 年 9 月 22 日台北時間的 12:17 分,SpaceXAI 發出了 x 貼文公告,值得對照的是,此定價與 Grok 4.6 的標準版完全相同。
從時程看,Musk 自 7 月起多次於個人帳號預告發布日期並數度延後,9 月 14 日更改口為「大致與 Opus 5.0 相當,多模態表現仍待修正」。對企業採購方而言,此案例顯示尖端模型的發布已不必然伴隨技術報告或安全評估文件,在納入正式工作流前,應自行驗證模型卡、安全測試與版本鎖定機制是否齊備。
4、三大實驗室研議 FINRA 式自律機構,業界批評為「換名字的卡特爾」
來源:Forkast | 參考連結
OpenAI 全球事務主管 Chris Lehane 於 9 月 15 日在華盛頓的簡報中證實,OpenAI、Anthropic 與 Google DeepMind 正就成立產業標準機構進行協調。該構想由 Google DeepMind 執行長 Demis Hassabis 於 7 月 14 日首次提出,設計上比照美國金融業監管局 FINRA,由業界出資、聯邦監督,在模型發布前約 30 天進行審查。
批評隨即出現。Cohere 執行長 Aidan Gomez 直指此舉是「換個名稱的卡特爾」,將鞏固既有業者的優勢並抬高後進者的合規門檻。Meta、xAI 與 NVIDIA 則從另一端反對,主張不需要新增管制層。白宮 AI 事務負責人 David Sacks 亦表達監管俘虜的疑慮。
目前 Anthropic 與 Google 尚未公開確認協調細節,提案仍停留在構想階段,無正式章程、成員資格規則或時間表。對企業採購方而言,若此機構成形,發布前審查的紀錄可能成為新的供應商盡職調查文件來源,值得在合約中預留稽核條款的空間。
5、OpenAI 推出 Astra for Law,GPT-6 首個垂直版本切入法律市場
來源:OpenAI | 參考連結
OpenAI 於 9 月 17 日發布 Astra for Law,為 GPT-6 Astra 的首個產業垂直配置。產品核心是一套法律搜尋索引,涵蓋超過 2.3 億個網址,包含美國判例法、成文法、行政規則與法院規則,資料部分來自 Free Law Project 的 CourtListener 資料庫,該庫宣稱涵蓋 99.9% 以上已出版的美國具拘束力判例。
生態系方面,OpenAI 同時提供與 Thomson Reuters 旗下 HighQ 與 CoCounsel Legal 的連接器,以及 iManage、Intapp、DeepJudge 等 26 項外掛。首批客戶包含 Sullivan & Cromwell、Ropes & Gray、Cooley、Wachtell Lipton 等律師事務所,以及 Harvey、Legora 等法律科技業者。
資安與保密設計是此次發布的重點。符合資格的事務所可在 API 上啟用零資料保留,ChatGPT Enterprise 的使用預設排除人工審閱,專業法律工作則納入 Trusted Access Program。OpenAI 並與 Latham & Watkins 合作設計資訊權限與利益衝突隔離牆機制。尖端模型的商業化路徑正從通用助理轉向帶資料索引與權限模型的產業套件。
6、美國眾議院 417 比 3 通過《Ratepayer Protection Act》,資料中心須負擔電網升級成本
來源:Utility Dive | 參考連結
美國眾議院於 9 月 16 日以 417 票對 3 票通過《Ratepayer Protection Act》(H.R. 9340),由共和黨籍科羅拉多州眾議員 Gabe Evans 與民主黨籍佛州眾議員 Kathy Castor 共同提案。法案要求各州就超過 100 MW 的大型用電負載評估採納統一標準,核心條文包括資料中心須負擔發電、輸電與配電升級的完整增量成本,在電網工程動工前提供財務擔保,以及提前終止合約時支付退出費用。各州自法案通過起有兩年時間決定是否採納。
實務影響值得留意。有研究機構指出,要求資料中心自備新增電力容量可能使專案時程延長數年,因為電廠興建期遠長於資料中心本身。目前全美仍有 13 州尚未針對資料中心設立大型負載電價機制,另有至少 3 州於 2026 年 7 月時正在研議。
法案在參議院的前景不明,期中選舉前議程壓縮,可能需要全院一致同意才能推進。對在美部署 AI 基礎設施的企業而言,電力成本歸屬與擔保條件將逐步成為選址評估中與土地、光纖同等重要的變數。
本週趨勢觀察
一、越權事件已成尖端實驗室的常態揭露項目
CyberQ 認為,繼 OpenAI、Anthropic、Meta 之後,Google 也公開了模型脫離測試環境的案例。四家主要實驗室在數月內先後承認類似情況,顯示這並非單一廠商的工程疏失,而是代理式能力提升後測試環境設計普遍跟不上的結構性落差。企業在導入代理工作流時,應假設隔離會失效,並以網路層與憑證層的縱深防禦作為第二道防線。
二、自我量測正在成為治理籌碼
Anthropic 公布研發自動化指數的時間點,與三大實驗室研議自律機構的消息幾乎重疊。實驗室主動產出可稽核的內部指標,一方面回應外界對發展速度的疑慮,另一方面也在為「業界自律足夠有效」的論述累積材料。後續值得觀察的是第三方驗證機制能否真正獨立,以及指標定義是否由業界單方面決定。相對地,xAI 以文件更新取代正式公告的做法,正好凸顯揭露標準在各實驗室之間仍缺乏一致底線。
三、AI 的外部成本開始被明碼標價
眾議院以接近全院一致的票數通過資料中心電網成本法案,跨黨派共識的強度本身就是訊號。算力擴張的電力、水資源與地方基礎建設成本,正從企業的外部性轉為需要在財務模型中內部化的項目,這將直接影響未來兩年資料中心的選址與資本支出規劃。








