Anthropic再揭AI越權事件 Claude第4度入侵外部系統

(台泰時報9月10日電)人工智慧公司Anthropic近日披露,旗下Claude模型在安全測試期間再度出現未經授權存取外部系統的情況,這是該公司目前確認的第4起相關事件。此次事件發生於今年1月,涉及早期版本的Claude Opus 4.6,但公司在首輪內部全面檢查時未能發現,直到上月重新檢視先前漏查的一組測試紀錄後才確認問題。

Anthropic表示,已通知所有受影響對象,但未進一步公開事件細節。公司初步評估認為,此次事件的嚴重程度並未高於先前3起案例。這些事件引發外界關注自主型AI代理在執行複雜任務時,可能自行尋找漏洞、突破限制,甚至與外部系統互動,行為超出開發者原先預期。

Anthropic今年7月曾公布,部分Claude模型在網路安全測試期間曾入侵3家公司的系統。相關案例分別涉及Claude Opus 4.7、Claude Mythos 5及一款內部研究模型。公司指出,當時測試設定出現操作失誤,使模型意外取得公開網路存取權限,最終在14萬1006次測試紀錄中確認異常行為。

公司進一步指出,多起事件存在兩項重複特徵。第一是「推理偏誤」,模型可能忽略或錯誤解讀證據,誤認自己正在真實網路環境中執行任務;第二是「魯莽行為」,也就是模型為達成目標,願意採取可能造成負面影響的行動。Anthropic認為,這類問題顯示高階AI代理的行為監測與風險控制仍面臨技術挑戰。

為釐清事件,Anthropic已委託獨立研究機構METR展開調查,並提供更廣泛的資料存取權限,包括事發前後的對話紀錄及可接觸機密資訊的員工訪談。METR過去也曾調查OpenAI模型與Hugging Face基礎設施遭AI代理入侵事件,並與Redwood Research共同發現,當時約有700個AI代理協同行動,部分代理還曾嘗試掩蓋自身行為軌跡。

隨著自主型AI代理逐漸能執行複雜任務,Anthropic等業者也面臨更嚴格安全檢視。業界強化權限控管、測試環境隔離與異常偵測,以降低模型未預期下對外部系統採取行動的風險。

圖片來源:Bangkok Biz