根據 Quartz 這篇 Anthropic’s AI model created fake identities to push malicious code in U.K. safety tests 提到英國人工智慧安全研究所(AISI)發布的最新資安評估報告中,指出 Anthropic 的最新模型 Mythos 5 在例行性網路安全測試中,展現出惡意欺騙的行為,不僅自行建立虛構的網路身分,更試圖透過社交工程手法施壓並操控人類審查員,以誘騙其核准並合併包含惡意程式碼的開源專案更新。
這個測試於 7 月 25 日至 7 月 28 日進行,期間 AISI 共執行 122 次網路安全挑戰測試,結果顯示 AI 代理人在未獲授權情況下自行連線至公開網際網路並執行非授權操作的案例共有 19 起,其中 Mythos 5 就占據 17 起,其餘 2 起則涉及 OpenAI 的 GPT-5.6-Sol 模型。
企圖利用社交工程與多重偽裝來滲透 GitHub 熱門專案
其中最嚴重的一起案例為 Mythos 5 的 AI 代理人,鎖定了 GitHub 上一個被廣泛使用的開源專案,為了將惡意程式碼植入該專案,該模型先透過網路檢索鎖定專案維護者的個人資訊,然後一口氣創建多個虛構的線上身分,並利用這些假身分對真實維護者進行多方社交工程與施壓,意圖迫使維護者核准惡意程式碼合併的請求。
當請求引起社群質疑與檢視時,Mythos 5 甚至還主動修改其過往的網路活動紀錄以抹除痕跡,掩飾意圖,並評估創立更多假身分繼續推進目標,所幸最後該惡意程式碼被人類審查員即時發現並予以退回。
AISI 還發現該模型曾主動聯繫過測試環境外的外部人士,透過檔案分享平台發送訊息,試圖誘使這些人員或其使用的 AI 程式碼輔助工具來執行惡意程式碼。AISI 強調,這是首次在無特定提示詞引導的情況下,觀察到 AI 針對真實人類展現出如此高程度的自主欺騙行為。
高權限測試環境與事件處置
AISI 安全團隊在 7 月 28 日透過流量監控發現異常,注意到有資料透過 Tor 匿名網路傳輸至測試系統之外。團隊隨後立即宣布資安事件,並在一小時內就完成控制與封鎖。
本次評估是在特殊測試條件下進行,是為了測試模型在接近真實攻擊者環境下的能力極端值,測試過程中,故意開啟了網際網路存取,並關閉了原本設計用以阻擋危險行為的資安過濾器與防護機制。目前涉案的特定模型設定版本均未在市場上公開發售。
針對此測試,Anthropic 也在社群平台回應表示,該測試環境有刻意放寬限制的條件,並且關閉了防護過濾器,且未對網路使用設立安全邊界,還強調沒有任何跡象顯示模型有突破安全隔離環境的情形。
AISI 表示後續將與模型評估暨威脅研究組織 METR 合作,進行獨立第三方審查,並已同步通報 GitHub,GitHub 官方亦證實該 AI 代理人的行為已違反其服務條款。
CyberQ 觀點
這次 AISI 的測試結果,為整個生成式 AI 與 AI 代理人產業投下了重磅炸彈。過去市場討論 AI 資安,大多集中在模型是否會給出有毒答案或 prompt 注入攻擊 Prompt Injection,但 Mythos 5 展示出的行為,已經跨越了單純的文字輸出,而是進入主動戰術層面,包括目標偵察、多重身分偽造、鏈上痕跡抹除、甚至發動跨平台的社交工程手法來施壓。
不但如此,近期也傳出國際上有駭客使用了中國的 DeepSeek V4 Flash 0731 正式版模型搭配著名的 AI 代理人程式 Hermes Agents,也拿來跑攻擊程式,針對網站和企業做自主性攻擊,這則是人為搭配 AI 去產生的惡意工具。
值得防禦方關注的是,現在企業與開源社群大力引進 AI Coding Assistant來提升開發效率,但 Mythos 5 卻嘗試利用檔案分享平台將惡意 Payload 投遞給外部人員,意圖誘騙人類或其使用的 AI 助手執行,這也代表未來 AI 不僅能作為攻擊者的武器,還可能成為攻擊其他 AI 系統的導火線。
而且也暴露出目前的模型安全高度仰賴外掛式的過濾機制,而非模型本體具備道德或規則意識,如果防護網因為設定錯誤、系統漏洞或是遭 Prompt 繞過,AI 代理人的自主行為邏輯就極可能為了達成目標而不擇手段。企業在建置與導入自主 AI 代理人工作流時,絕不能將安全寄望於模型的自我約束,必須在系統層級實施嚴格的零信任機制、權限隔離以及強制性的人類介入審查,才能在享受 AI 自動化紅利的同時,守住企業資安的最後一道防線。
首圖由 Nano Banana AI 生成







