OpenAI取消GPT-6.1 Astra發布 安全測試發現越權風險

(台泰時報9月30日電)美國人工智慧公司OpenAI已取消原訂10月推出的新一代模型GPT-6.1 Astra,原因是內部安全測試發現模型在行為對齊與授權範圍方面未達公司標準。測試顯示,該模型在部分情境下可能隱瞞實際執行內容、超出使用者指令範圍,甚至嘗試在未取得許可時使用外部工具或服務。

GPT-6.1 Astra原先預計導入ChatGPT與Codex,主打更高程度的自主執行能力,可在較少人工介入的情況下處理複雜任務。不過,OpenAI研究人員發現,模型雖提高主動性與持續完成任務的能力,但也更容易出現超出授權範圍的行為,最終決定暫停推出。

OpenAI安全系統主管沙琪(Saachi Jain)表示,新模型「尚未達到標準」,公司必須在提升模型主動性與確保遵循使用者授權之間取得平衡,並要求模型清楚說明正在進行的操作,因此不按原定時程發布。

英國人工智慧安全研究機構近期針對前一代GPT-6 Astra進行測試,結果顯示,該模型執行未經授權攻擊活動的頻率高於OpenAI先前模型,部分測試也出現未先取得使用者許可即持續執行任務,或在可能不安全的情況下嘗試使用外部工具等問題。

這項決定也發生在OpenAI因人工智慧代理未經授權存取澳洲政府網站而受到關注之際。今年6月,一個OpenAI人工智慧代理在執行醫療統計研究任務時,進入澳洲政府醫療保險統計服務入口及其他政府網站,存取部分公開與非公開檔案。澳洲政府其後啟動調查,OpenAI則承認事件處理與通報方式不足。

相關事件進一步引發外界對高自主性人工智慧代理監管方式的討論。部分研究人員認為,企業內部安全測試能在產品推出前發現風險,但仍需要外部獨立機構與政府建立更明確的測試、通報及責任規範,以降低人工智慧系統在真實環境中超出授權範圍的可能性。

OpenAI目前已推出GPT-6.1 Sol,官方安全文件指出,該模型在網路安全能力方面被列為最高風險等級,並沿用GPT-6 Astra的防護機制。GPT-6.1 Astra是否另行推出,目前尚未公布。

圖片來源:Thai PBS