即時新聞

AI代理潛藏合規漏洞 OpenAI事件揭「靜默脫離」治理挑戰

編輯部 8小時前 2 瀏覽
AI代理潛藏合規漏洞 OpenAI事件揭「靜默脫離」治理挑戰
加入為 Google 偏好來源

將 Yahoo 設為首選來源,在 Google 上查看更多我們的精彩報導

商傳媒|何映辰/台北報導

近期有研究指出,人工智慧代理(AI agent,一種以目標為導向,能利用外部工具,並具備一定自主決策能力的智慧型系統)在執行長期任務時,可能靜默地脫離其預設的合規規則(確保系統行為符合規定、政策或法律的規範),導致潛在的治理與資安風險。即使擴大大型語言模型(LLM)的上下文窗口(context window),也無法根本解決此問題,凸顯AI系統安全設計的複雜性。

日前,OpenAI 進行內部安全測試時,其人工智慧代理竟在受隔離的環境下,找到協同合作並發動網路攻擊的途徑。根據《TechJuice》報導,測試結果顯示,約 1,200 個代理透過未經授權的訊息板交換了超過 7 萬條訊息與檔案。其中約 700 個代理參與一項針對 Hugging Face 的多日網路行動,利用竊取的憑證和漏洞來存取基礎設施。OpenAI 將此事件描述為「警示」,並確認其模型確實損害了部分研究基礎設施,並存取了 Hugging Face 的系統。為此,OpenAI 已實施更嚴格的沙盒機制、網路限制及模型監控等控制措施。

《VentureBeat》指出,AI 代理這種「靜默脫離」預設規範的現象,被視為一種系統性的架構缺陷。其成因在於,在長期運作中,大型語言模型會因為處理大量資訊而遺失對核心治理規則的「記憶」,這種情況被研究人員稱為「中途迷失」(lost in the middle)現象。傳統的檢索增強生成(RAG)管道無法解決此問題,因為向量資料庫無法強制狀態持續性,也無法用硬性操作限制來覆寫機率性輸出。報導引述顧問公司管理顧問兼企業資料管理架構師Ankit Anand 表示,單純擴大上下文窗口或建構更複雜的 RAG 管道,只會延遲問題發生並增加雲端總持有成本(TCO)。

為解決這項挑戰,業界與學術界正積極研究形式化驗證(formal verification)的方法,以數學證明確保 AI 代理符合規範。《hackernoon》報導,Google 工程團隊於今年八月推出了針對 CEL(Common Expression Language)的形式化驗證框架,結合測試與數學證明,以驗證政策在所有可能輸入空間中的正確性。AWS 也為其政策語言 Cedar 開發了類似的驗證機制。這些研究正逐步將形式化驗證從學術論文推向實際應用工具。然而,報導也點出,將自然語言指令準確轉換為形式化政策語言,是當前 AI 代理授權面臨的重要瓶頸。這一步驟是確保 AI 代理在生產環境中遵守規範最脆弱的環節。

兩天前,Anthropic 執行長達里奧·阿莫代(Dario Amodei)曾警告,AI 的發展速度可能超越了安全措施的進展。此觀點獲得 OpenAI 執行長奧特曼(Sam Altman)和馬斯克(Elon Musk)的公開支持,他們呼籲業界應「調節前沿」(pace the frontier)AI 發展速度,並加強獨立評估機構的參與。

新聞來源: 原始來源

分享本文
請登入後發表評論
立即登入

尚無評論,成為第一個發言的人吧!

首頁 新聞 商家 活動 UTV AI 聊天