Anthropic 最新發表的研究 Patterns and problems in emerging multiagent systems 指出,隨著模型的進步與 AI 代理人接手的任務愈來愈多元,代理人在真實世界中的互動頻率未來也將大量增加,在人類充分了解如何管理 AI 代理人的互動之前,代理人彼此之間的互動總量可能就已超越人類之間以及人機之間的互動量。面對這樣的趨勢,目前由人類建立的制度將面臨轉型,會轉變為人類與AI混合的體制。
在追求速度與成本的環境中,未來甚至會出現純粹由代理人主導的組織。雖然代理人具備長時間工作與瞬間吸收大量資訊的能力,但目前對於它們在複雜且真實的多代理人環境中如何表現仍是未知。
代理人尋找程式漏洞的效率比較
在尋找軟體漏洞的任務上,Anthropic 測試了多代理人合作的成效。研究人員啟動了45個獨立的虛擬機器並配備代理人,並給予相同的提示詞,要求它們在15個開源軟體專案中尋找漏洞,再由另一個AI代理人負責檢查這些被找到的漏洞是否確實有效而且是新發現。
以Mythos Preview為例,具備溝通機制的代理人團隊在使用約2700萬個token後找到266個新漏洞;反觀獨立平行運作的代理人則在約650萬個token下找到21個。不過後者的搜尋範圍受到限制,而前者發現的266個漏洞中有一半位於其指定的核心目錄之外。因此,若只比較相同核心目錄,兩種方式平均找到一個漏洞所需的token數其實大致相當。

Photo Credit by Patterns and problems in emerging multiagent systems
從這個任務中可見,團隊中的AI代理人甚至能夠自行開發工具並專注於尋找特定類型的漏洞,展現出遠勝於傳統暴力搜尋的潛力。
軟體開發測試中的溝通挑戰
至於當研究團隊指示多組代理人團隊開發一款純文字的開放世界遊戲,並測試了包含指定特定角色或設立階層等不同的任務指示,最後產出的遊戲品質卻不理想,最後產出的遊戲不僅不適合以人類的速度遊玩,介面也令人難以理解,而且遊戲學習曲線非常陡峭。
會有這樣的結果是由於當 AI 代理人的工作需要彼此高度依賴時,合作難度便會大幅提升。不同世代的模型在過程中展現了截然不同的處理方式,較早期的模型開啟了大量的程式碼合併請求,但往往因為互相衝突而被迫放棄。而近期的模型則是為了解決衝突,選擇高度掌握自己的檔案而不願與其他代理人分享程式碼。直到最近的最新模型,才能夠在維持高度程式碼共享的同時,仍維持極高的合併成功率。

Photo Credit by Patterns and problems in emerging multiagent systems
高度同質性帶來的系統性風險
當 AI 代理人具備高度的同質性時,給予它們相同的背景與模型時,它們往往也會做出極為相似的決策。如此一來,當一個代理人做出錯誤判斷時,其他代理人也極可能會做出相同的錯誤決策,使原本個別的問題迅速演變成系統性失敗。
在實驗中,當多個代理人同時開發遊戲時,過半數的代理人將程式碼分支命名為完全相同的名稱。在另一個沒有其他溝通管道的系統佇列管理實驗中,代理人為了完成任務,瞬間產生大量高頻率的請求,其中一次實驗共產生240萬次的工作請求,但最終僅有117個工作被系統接受,顯示出資源分配上的隱患。
競爭環境下的串通定價行為
在AI代理人處於相同的定價競爭環境時,相似的行為模式也會消弭正常的市場的競爭機制。Anthropic 將多個代理人投入商業定價的賽局實驗,每個代理人的目標是追求利潤最大化。在實驗中發現,當AI代理人擁有私下溝通管道時,它們幾乎就會立刻開始串通定價,甚至明確約定價格下限以避免削價競爭。
更值得警惕的是,即使移除所有直接通訊管道,這些代理人依然能透過公開的商品列表進行觀察,達成精準的價格處理。AI代理人這樣的行為模式為未來的企業應用帶來了管理上的難題。
CyberQ觀點
我們從Anthropic這次發布的研究中可知,當代理人具備分工與自行建構工具的能力時,在特定任務上的處理效率確實大幅超越傳統的平行運算;然而,高度同質性所引發的系統性風險以及自發性的價格聯合壟斷,也直接挑戰了現有的市場機制與組織管理邏輯。
未來當AI代理人大量進入商業流程與市場機制時,系統穩健度將不再取決於單一模型的表現,更取決於多代理人之間的互動協議與防護機制,未來公司在導入相關自動化架構時,除了追求處理效率,也必須及早建立能夠管理 AI 代理人的架構與有效的監管機制,以防範多代理人群體失控所帶來的營運衝擊。
本文首圖由地端 AI 生成







