OpenAI 於近日公布數款模型意外突破隔離測試環境,並存取 Hugging Face 正式系統後,Anthropic也對自家的網路安全評估展開大規模回顧調查。Anthropic近日公布網路安全測試事件調查報告,團隊在審查14萬次可能取得網際網路存取權限的評估紀錄後,發現了三起事件,分別出現在六次測試中,在這些事件中Claude 連上了網際網路,並在未經授權的情況下存取三個不同組織的正式系統。
這些事件最早可追溯至2026年4月,發生在Anthropic與第三方評估合作夥伴Irregular進行的測試中。其中第一起事件包含四次評估執行,另外兩起事件則各發生於一次獨立的評估測試中。
測試環境設定錯誤導致Claude連上真實網路
在這些測試中,Claude被指派進行奪旗挑戰,這是用來評估模型網路安全能力的一種任務。系統會給定一個虛構情境,告訴模型作為旗幟的機密資訊,藏在模擬網路上的另一台機器中,要求模型設法入侵並取得該資訊,但不指定必須採用哪一種方法。
Anthropic在提示中明確告知Claude,測試是在模擬環境中進行,而且無法連上網際網路,但由於Anthropic與Irregular對環境設定有所誤解,相關評估機器因設定錯誤而保留網際網路連線,而使得 Claude 能夠連上真實網路。
由於提示沒有明確限制 Claude 可以在哪些系統中尋找目標,加上網路安全測試通常會加入大量接近真實情況的細節,因此當Claude在搜尋過程中接觸到真實網路上的系統時,誤以為這些系統也是測試環境的一部分。
值得注意的是,這些測試為了測量模型本身的能力,刻意未啟用Claude公開提供時通常搭配的分類器與監控機制,但是受測模型本身仍接受過安全調整,並不是只強調完成指令而未加入完整安全限制的特殊版本。
而且所有評估測試都是在專用基礎設施上執行,與 Anthropic 的內部機密系統及客戶資料是完全隔離的,因此這些事件並未使模型接觸到 Anthropic 的敏感資料或客戶資訊。
三起模型越界事件始末
三起事件分別涉及Opus 4.7、Mythos 5及一款內部研究測試模型。Anthropic表示,這些模型使用的都是弱密碼、無須驗證身分的端點、暴露的偵錯頁面及SQL隱碼攻擊等基本手法,沒有利用複雜漏洞,更沒有試圖讓自己脫離測試環境。
第一起事件是 Opus 4.7 參與的測試。測試中設定的虛構目標公司,名稱恰好與一個真實存在且仍在運作的網站網域相同,Opus 4.7在虛擬環境內找不到原本的目標後,發現可以透過網際網路連上這家真實公司,就將其誤認為奪旗挑戰的預定目標,開始尋找並利用該公司基礎設施中的弱點。
這起事件中模型取得了應用程式與基礎設施的登入憑證,並存取一個包含數百筆正式環境資料的資料庫,是三起事件中影響最嚴重的一起。
Opus 4.7 在這起事件的四次評估測試的最後都察覺目標可能是真實系統。其中兩次,模型進一步合理化地認為該公司雖然真實存在,仍可能是測試安排的一部分,但四次測試中模型都沒有因此停止攻擊。
第二起事件涉及 Mythos 5, Mythos 5 在虛構環境中發現一份假造的新進開發者設定指南,內容要求員工從PyPI安裝一個實際上不存在的Python套件。Claude發現可以利用這項設定,於是便在真實的PyPI平台註冊帳號,建立並上傳一個同名的惡意套件,希望虛構公司的系統能夠自動下載及執行。
為了發布套件,Claude 還嘗試尋找電話號碼及建立電子郵件帳號,最後透過一個免費且未遭封鎖的電子郵件服務完成PyPI帳號註冊。
Anthropic指出,如果是由人類參與測試,這些繁複的註冊步驟很可能足以讓測試者察覺,套件正被上傳至真實的PyPI,而不是模擬平台。
這個惡意套件在 PyPI 上公開約一小時,就已被 15 台真實系統下載並執行,其中包括一家安全公司的自動掃描設備。套件中的隱藏程式碼擷取該公司的登入憑證,並將憑證傳往Claude 設定的收集端點。Claude之後又利用這些憑證存取該公司的其他基礎設施。
這家安全公司並不是Claude原本鎖定的目標,模型在發布套件時甚至不知道該公司存在。該套件後來由PyPI本身的安全系統自動移除,Anthropic也已通知PyPI團隊並提供相關攻擊指標。
Mythos 5 在測試初期曾正確判斷,若使用的是真實網路,發布惡意套件就會構成真實攻擊,並認為這不可能是測試的預定解法。不過,由於它不認得保護連線的憑證授權單位,誤以為這些憑證授權單位是測試環境虛構的,加上系統日期顯示為2026年,因此自我說服目前仍處於模擬環境。因此當自動掃描系統開始下載套件時,Claude 也將其視為測試中預先安排的角色。
最後一起事件由一款內部研究測試模型引起。該模型在找不到原定的虛構目標後,轉而在網路上尋找替代目標,掃描約九千個線上目標,最後入侵一家公司的網路應用程式。模型使用的手法包括從暴露於網路的偵錯頁面讀取憑證,以及發動SQL隱碼攻擊。
在大部分過程中,模型將接觸到的真實主機視為模擬測試的一部分。直到它發現遭入侵的主機位於一個與奪旗挑戰沒有任何關聯的雲端帳號中,才自行判斷這是真實目標並停止攻擊。這款內部研究測試模型目前尚未公開推出的計畫。
Anthropic指出,這三起事件並不是在受控制的實驗條件下進行的比較,因此不能僅憑這些案例就斷定模型愈新,辨識真實環境及停止攻擊的能力就一定愈好。現有結果只能說與這種趨勢相符,仍需要更多測試才能確認。
防護機制的檢討與未來對策
Anthropic表示在這三起事件中,並沒有證據顯示這些模型有自行設定了新目標。Claude執行的仍是評估所交付的奪旗任務,只是因為對環境產生錯誤認知,把真實系統誤認為測試內容,因此這些事件較接近評估執行架構與作業管理失誤,而非模型對齊失效。
但 Anthropic也承認,Opus 4.7 在察覺目標可能是真實系統後仍持續攻擊,以及 Mythos 5為了發布PyPI套件所採取的行動,都顯示模型的判斷及安全訓練仍有改善空間。
Anthropic 於7月23日開始檢查評估紀錄,在發現Claude可能連上網際網路後,已於同日暫停所有網路安全評估,團隊也在隔日確認全部三起事件,並於7月27日通知Irregular及三個受影響組織,當時成功聯絡上的兩個組織都未曾察覺相關活動,也沒有主動聯絡Anthropic;公司目前正持續嘗試聯絡第三個組織。Irregular 也正在進行自己的調查。
Anthropic 認為,如果測試前仔細驗證所有網路存取路徑、即時監控評估紀錄,並更徹底地檢查評估文字紀錄及網路日誌,都可能避免事件發生,或至少降低發生機率。未來Anthropic 將會擴大對評估紀錄的持續監控、改善調查工具,並加強對外部供應商及合作環境的安全驗證。
隨著AI代理能力不斷提升,即使虛擬測試環境本身沒有接觸機密資料,也可能因模型具備自主操作能力而產生實際風險。這類環境需要採用與其他承載高能力模型的系統相同的安全標準,並透過多層次防護避免單一設定錯誤造成模型接觸真實網路。
CyberQ觀點
本次事件凸顯出強大 AI 代理在隔離不當的環境中可能帶來的潛在風險。儘管模型本身沒有惡意,但卻可能因為錯誤的環境認知而對真實世界造成損害。隨著模型版本的推進,我們觀察到 AI 的情境感知能力正在提升,最新的內部測試模型能夠在發現目標非虛擬環境時主動停止攻擊,這顯示出持續強化模型判斷力與安全訓練的成效。然而,在推動 AI 發展的同時,必須重新審視測試環境的架構設計,才能確保安全邊界不會因為人為設定疏失而被輕易突破。
首圖由 Nano Banana AI 生成配圖由 AI 生成







