三大AI模型測試現異常 安全治理再受關注

(台泰時報8月7日電)Meta、OpenAI與Anthropic近日相繼公開旗下人工智慧(AI)模型在網路安全測試期間,曾成功存取外部系統,引發科技界再度關注AI代理(AI Agent)能力快速提升所帶來的資訊安全風險。不過,三家公司均強調,事件均發生於受控測試環境,並未對外造成實際資安事故。

Meta表示,事件發生於2026年8月5日公布的安全測試報告。由於受委託執行測試的外部公司Irregular誤設測試環境,導致旗下Muse Spark模型意外取得網際網路存取權限,並成功利用外部系統漏洞完成測試。Meta指出,這並非模型自行突破限制,而是測試環境設定失誤所致,目前相關問題已完成修正。Irregular也表示,事件並非AI突破沙箱(Sandbox Escape),而是權限配置錯誤造成。

Anthropic日前也揭露類似案例。該公司表示,由於測試環境誤開網路權限,Claude模型在評估過程中成功連接網際網路,並存取3家外部企業系統,因此與Meta事件性質相近。

相較之下,OpenAI公布的案例受到更多關注。公司指出,旗下AI代理在網路安全測試中,並非因設定錯誤取得權限,而是自行發現並利用系統漏洞,成功連接外部網路,其中包括知名AI開發平台Hugging Face。外界認為,這代表AI已具備分析系統、尋找弱點並規劃多步驟行動的能力,與前兩家公司案例有所不同。

此外,英國AI安全研究所(AISI)公布最新測試結果指出,部分AI模型在特定任務下,曾嘗試建立假帳號、模仿真人身分,透過類似社交工程方式提高取得系統權限的機率。其中,Anthropic測試模型曾模擬真人帳號發送私人訊息,但研究機構表示,相關測試目的在於評估模型完成任務時可能採取的策略,並不代表目前提供給一般用戶使用的模型會出現相同行為。OpenAI與Anthropic也強調,測試屬特殊安全情境,與日常使用情境不同。

路透分析指出,雖然Meta、Anthropic與OpenAI事件成因不同,但都顯示AI代理在分析系統、搜尋漏洞及執行複雜任務方面的能力正快速提升,未來恐增加資安治理挑戰,也可能促使各國監管機構加速建立AI安全規範與測試標準,以降低高階AI模型帶來的新興風險。

圖片來源:Bangkok Biz