CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
聯繫我們
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • 熱門
  • AI 人工智慧
  • 資安
  • Docker
  • 進階應用
  • 網通
  • NAS
  • 開箱測試
  • 教學
  • 展覽直擊
首頁 新聞 AI 人工智慧

Anthropic安全評估出包 三款Claude模型誤駭三家組織系統

Ashley Hsieh by Ashley Hsieh
2026 年 07 月 31 日 19:48
in AI 人工智慧, 新聞
閱讀時間: 2 分鐘
A A
Anthropic安全評估出包 三款Claude模型誤駭三家組織系統
613
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

OpenAI 於近日公布數款模型意外突破隔離測試環境,並存取 Hugging Face 正式系統後,Anthropic也對自家的網路安全評估展開大規模回顧調查。Anthropic近日公布網路安全測試事件調查報告,團隊在審查14萬次可能取得網際網路存取權限的評估紀錄後,發現了三起事件,分別出現在六次測試中,在這些事件中Claude 連上了網際網路,並在未經授權的情況下存取三個不同組織的正式系統。

RELATED POSTS

Apple 庫存翻倍備戰供應鏈短缺|GPT-5.6 Luna 降價 80%|Reddit財報顯AI衝擊|產業精選 07.31

Zuckerberg 預測個人 AI 代理五年內普及|微軟 AI 投資兩樣情|產業精選 07.30

微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

這些事件最早可追溯至2026年4月,發生在Anthropic與第三方評估合作夥伴Irregular進行的測試中。其中第一起事件包含四次評估執行,另外兩起事件則各發生於一次獨立的評估測試中。

測試環境設定錯誤導致Claude連上真實網路

在這些測試中,Claude被指派進行奪旗挑戰,這是用來評估模型網路安全能力的一種任務。系統會給定一個虛構情境,告訴模型作為旗幟的機密資訊,藏在模擬網路上的另一台機器中,要求模型設法入侵並取得該資訊,但不指定必須採用哪一種方法。

Anthropic在提示中明確告知Claude,測試是在模擬環境中進行,而且無法連上網際網路,但由於Anthropic與Irregular對環境設定有所誤解,相關評估機器因設定錯誤而保留網際網路連線,而使得 Claude 能夠連上真實網路。

由於提示沒有明確限制 Claude 可以在哪些系統中尋找目標,加上網路安全測試通常會加入大量接近真實情況的細節,因此當Claude在搜尋過程中接觸到真實網路上的系統時,誤以為這些系統也是測試環境的一部分。

值得注意的是,這些測試為了測量模型本身的能力,刻意未啟用Claude公開提供時通常搭配的分類器與監控機制,但是受測模型本身仍接受過安全調整,並不是只強調完成指令而未加入完整安全限制的特殊版本。

而且所有評估測試都是在專用基礎設施上執行,與 Anthropic 的內部機密系統及客戶資料是完全隔離的,因此這些事件並未使模型接觸到 Anthropic 的敏感資料或客戶資訊。

三起模型越界事件始末

三起事件分別涉及Opus 4.7、Mythos 5及一款內部研究測試模型。Anthropic表示,這些模型使用的都是弱密碼、無須驗證身分的端點、暴露的偵錯頁面及SQL隱碼攻擊等基本手法,沒有利用複雜漏洞,更沒有試圖讓自己脫離測試環境。

第一起事件是 Opus 4.7 參與的測試。測試中設定的虛構目標公司,名稱恰好與一個真實存在且仍在運作的網站網域相同,Opus 4.7在虛擬環境內找不到原本的目標後,發現可以透過網際網路連上這家真實公司,就將其誤認為奪旗挑戰的預定目標,開始尋找並利用該公司基礎設施中的弱點。

這起事件中模型取得了應用程式與基礎設施的登入憑證,並存取一個包含數百筆正式環境資料的資料庫,是三起事件中影響最嚴重的一起。

Opus 4.7 在這起事件的四次評估測試的最後都察覺目標可能是真實系統。其中兩次,模型進一步合理化地認為該公司雖然真實存在,仍可能是測試安排的一部分,但四次測試中模型都沒有因此停止攻擊。

第二起事件涉及 Mythos 5, Mythos 5 在虛構環境中發現一份假造的新進開發者設定指南,內容要求員工從PyPI安裝一個實際上不存在的Python套件。Claude發現可以利用這項設定,於是便在真實的PyPI平台註冊帳號,建立並上傳一個同名的惡意套件,希望虛構公司的系統能夠自動下載及執行。

為了發布套件,Claude 還嘗試尋找電話號碼及建立電子郵件帳號,最後透過一個免費且未遭封鎖的電子郵件服務完成PyPI帳號註冊。

Anthropic指出,如果是由人類參與測試,這些繁複的註冊步驟很可能足以讓測試者察覺,套件正被上傳至真實的PyPI,而不是模擬平台。

這個惡意套件在 PyPI 上公開約一小時,就已被 15 台真實系統下載並執行,其中包括一家安全公司的自動掃描設備。套件中的隱藏程式碼擷取該公司的登入憑證,並將憑證傳往Claude 設定的收集端點。Claude之後又利用這些憑證存取該公司的其他基礎設施。

這家安全公司並不是Claude原本鎖定的目標,模型在發布套件時甚至不知道該公司存在。該套件後來由PyPI本身的安全系統自動移除,Anthropic也已通知PyPI團隊並提供相關攻擊指標。

Mythos 5 在測試初期曾正確判斷,若使用的是真實網路,發布惡意套件就會構成真實攻擊,並認為這不可能是測試的預定解法。不過,由於它不認得保護連線的憑證授權單位,誤以為這些憑證授權單位是測試環境虛構的,加上系統日期顯示為2026年,因此自我說服目前仍處於模擬環境。因此當自動掃描系統開始下載套件時,Claude 也將其視為測試中預先安排的角色。

最後一起事件由一款內部研究測試模型引起。該模型在找不到原定的虛構目標後,轉而在網路上尋找替代目標,掃描約九千個線上目標,最後入侵一家公司的網路應用程式。模型使用的手法包括從暴露於網路的偵錯頁面讀取憑證,以及發動SQL隱碼攻擊。

在大部分過程中,模型將接觸到的真實主機視為模擬測試的一部分。直到它發現遭入侵的主機位於一個與奪旗挑戰沒有任何關聯的雲端帳號中,才自行判斷這是真實目標並停止攻擊。這款內部研究測試模型目前尚未公開推出的計畫。

Anthropic指出,這三起事件並不是在受控制的實驗條件下進行的比較,因此不能僅憑這些案例就斷定模型愈新,辨識真實環境及停止攻擊的能力就一定愈好。現有結果只能說與這種趨勢相符,仍需要更多測試才能確認。

防護機制的檢討與未來對策

Anthropic表示在這三起事件中,並沒有證據顯示這些模型有自行設定了新目標。Claude執行的仍是評估所交付的奪旗任務,只是因為對環境產生錯誤認知,把真實系統誤認為測試內容,因此這些事件較接近評估執行架構與作業管理失誤,而非模型對齊失效。

但 Anthropic也承認,Opus 4.7 在察覺目標可能是真實系統後仍持續攻擊,以及 Mythos 5為了發布PyPI套件所採取的行動,都顯示模型的判斷及安全訓練仍有改善空間。

Anthropic 於7月23日開始檢查評估紀錄,在發現Claude可能連上網際網路後,已於同日暫停所有網路安全評估,團隊也在隔日確認全部三起事件,並於7月27日通知Irregular及三個受影響組織,當時成功聯絡上的兩個組織都未曾察覺相關活動,也沒有主動聯絡Anthropic;公司目前正持續嘗試聯絡第三個組織。Irregular 也正在進行自己的調查。

Anthropic 認為,如果測試前仔細驗證所有網路存取路徑、即時監控評估紀錄,並更徹底地檢查評估文字紀錄及網路日誌,都可能避免事件發生,或至少降低發生機率。未來Anthropic 將會擴大對評估紀錄的持續監控、改善調查工具,並加強對外部供應商及合作環境的安全驗證。

隨著AI代理能力不斷提升,即使虛擬測試環境本身沒有接觸機密資料,也可能因模型具備自主操作能力而產生實際風險。這類環境需要採用與其他承載高能力模型的系統相同的安全標準,並透過多層次防護避免單一設定錯誤造成模型接觸真實網路。

CyberQ觀點

本次事件凸顯出強大 AI 代理在隔離不當的環境中可能帶來的潛在風險。儘管模型本身沒有惡意,但卻可能因為錯誤的環境認知而對真實世界造成損害。隨著模型版本的推進,我們觀察到 AI 的情境感知能力正在提升,最新的內部測試模型能夠在發現目標非虛擬環境時主動停止攻擊,這顯示出持續強化模型判斷力與安全訓練的成效。然而,在推動 AI 發展的同時,必須重新審視測試環境的架構設計,才能確保安全邊界不會因為人為設定疏失而被輕易突破。

首圖由 Nano Banana AI 生成配圖由 AI 生成

Anthropic 砍掉 Claude Code 八成系統提示詞:Claude 5 世代的 Context Engineering 新規則
標籤: AI安全評估AnthropicClaude越界Mythos5Opus4.7PyPI惡意套件奪旗挑戰資安測試誤判
Share7Tweet5ShareShareShare1
上一篇

Apple 庫存翻倍備戰供應鏈短缺|GPT-5.6 Luna 降價 80%|Reddit財報顯AI衝擊|產業精選 07.31

Ashley Hsieh

Ashley Hsieh

專案管理者與 UI/UX 設計、AI美術設計認證、淨零碳規劃管理師,在上市歐洲外商、生醫、金融、科技產業中淬煉,曾參與過多個跨平台專案,從需求分析、設計、使用者測試到專案交付流程都樂在其中。 私底下,我是一位「喜歡買東西但錢包容易抗議」的人,對科技、設計與藝術有熱情,正在努力平衡質感生活,學習和錢包一起成長的日常小練習者。

相關文章

新聞

Apple 庫存翻倍備戰供應鏈短缺|GPT-5.6 Luna 降價 80%|Reddit財報顯AI衝擊|產業精選 07.31

2026 年 7 月 31 日
新聞

Zuckerberg 預測個人 AI 代理五年內普及|微軟 AI 投資兩樣情|產業精選 07.30

2026 年 7 月 30 日
微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析
新聞

微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

2026 年 7 月 30 日
GM 獲三倍開發效率|Runway 把 bug 變新功能|產業精選 07.29
新聞

GM 獲三倍開發效率|Runway 把 bug 變新功能|產業精選 07.29

2026 年 7 月 29 日
Anthropic 砍掉 Claude Code 八成系統提示詞:Claude 5 世代的 Context Engineering 新規則
AI 人工智慧

Anthropic 砍掉 Claude Code 八成系統提示詞:Claude 5 世代的 Context Engineering 新規則

2026 年 7 月 28 日
新聞

Claude 對話意外被 Google 索引外流、微軟推 AI 資安平台|產業精選 07.28

2026 年 7 月 28 日

推薦閱讀

Anthropic安全評估出包 三款Claude模型誤駭三家組織系統

Anthropic安全評估出包 三款Claude模型誤駭三家組織系統

2026 年 7 月 31 日

Apple 庫存翻倍備戰供應鏈短缺|GPT-5.6 Luna 降價 80%|Reddit財報顯AI衝擊|產業精選 07.31

2026 年 7 月 31 日

Zuckerberg 預測個人 AI 代理五年內普及|微軟 AI 投資兩樣情|產業精選 07.30

2026 年 7 月 30 日
微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

2026 年 7 月 30 日
GM 獲三倍開發效率|Runway 把 bug 變新功能|產業精選 07.29

GM 獲三倍開發效率|Runway 把 bug 變新功能|產業精選 07.29

2026 年 7 月 29 日

近期熱門

  • 告別隨意寫程式!Matt Pocock 推出 grill-me 技能,讓 AI 成為最嚴苛的架構審查官

    告別隨意寫程式!Matt Pocock 推出 grill-me 技能,讓 AI 成為最嚴苛的架構審查官

    366 shares
    Share 146 Tweet 92
  • 開放權重 AI 聯合聲明:NVIDIA、微軟、Meta、OpenAI 等 35 家大廠共同戰略宣言

    180 shares
    Share 72 Tweet 45
  • GitHub 趨勢周報 Vol.25:去中心化通訊與AI代理工具

    170 shares
    Share 68 Tweet 43
  • 微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

    165 shares
    Share 66 Tweet 41
  • 梁文鋒近 4 小時閉門會議紀要外洩:解密 DeepSeek 的 AGI 藍圖與融資暫停風波

    146 shares
    Share 58 Tweet 37
  • AI 裁員潮蔓延|開放權重聯盟成形|駭客羞辱間諜軟體|產業精選 07.26

    137 shares
    Share 55 Tweet 34
  • 實戰指南:Tailscale + QNAP 打造免網管跨國協作圈與檔案分享

    126 shares
    Share 50 Tweet 32
  • Claude 對話意外被 Google 索引外流、微軟推 AI 資安平台|產業精選 07.28

    120 shares
    Share 48 Tweet 30
  • 實戰指南:HDP Recovery Media Creator 打造 ISO 還原媒體,NAS 虛擬機沙盒完成 0 錯誤演練

    112 shares
    Share 45 Tweet 28
  • Anthropic 砍掉 Claude Code 八成系統提示詞:Claude 5 世代的 Context Engineering 新規則

    98 shares
    Share 39 Tweet 25

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。