技術

AI代理逃出沙盒,OpenAI再度暫停最強模型

Adrian Kessler
在 Google 中新增我們

OpenAI 已叫停旗下能力最強 AI 模型的所有訓練、測試及工具使用作業,原因是其中一個研究代理人突破了原本應該待在其中的封閉環境。沒有人指示它逃出去。它接到的任務是找出一篇部落格文章的作者,但搜尋工具一無所獲,於是它開始尋找其他出路。

這件事的影響遠不止 OpenAI 的實驗室,因為各大實驗室如今都在向消費者推銷同一類軟體:能瀏覽網頁、點擊操作、執行程式碼並自主行動的 AI。這些代理人可以代訂旅程、填寫表格及管理收件匣。對 ChatGPT 使用者來說,表面上不會有任何變化。暫停措施只涵蓋尚未發布的內部模型,OpenAI 並未在任何市場下架 ChatGPT、Codex 或其公開 API。

根據 OpenAI 自行發布的事件報告,代理人先嘗試直接連線至 Google、Bing 和 DuckDuckGo,但這些請求都遭到封鎖。接著,它開始探查周遭環境,發現環境中的 DNS 解析器——也就是網際網路的地址簿,負責把網站名稱轉換成伺服器位置——並未受到過濾。它把問題藏進要求解析器查詢的名稱中,藉此將問題傳送至外部聊天機器人服務,並收到答覆。這就像一名無法打電話的囚犯,改把紙條藏在送洗衣物裡傳出去。

OpenAI 的監控系統很快就發現了這件事。收到第一則外部回覆後 12 分鐘,自動警報便將事件列為最高優先級;三分鐘後,人工審查人員確認了警報。然而,這項作業之後又持續執行了兩個半小時。公司表示,預期中的自動停止機制並未發揮作用,讓員工無法確定是否需要親自介入。

這次逃逸並非孤立事件。OpenAI 另外揭露,曾有 53 起案例中,代理人把 ChatGPT 使用者的圖片上傳至外部圖片託管網站,並以非公開連結分享。這些圖片來自已同意讓 OpenAI 使用其資料訓練模型的帳戶,原本應先經過隱私過濾程序。公司表示,Enterprise、Business 和 API 帳戶不受影響,除非管理員曾開啟資料分享功能;公司也已與託管服務商合作,移除大部分檔案。另外,NBC News 報導,OpenAI 代理人曾在美國教育部網站上找到開發者金鑰,並在網路其他地方重新發布美國證券交易委員會的公開資料,這些行動都超出了原先交辦的範圍,但代理人並未取得任何非公開資訊。

這次暫停確實踩下了煞車,但作用有限。OpenAI 沒有透露涉及哪些模型,也未公布恢復日期;公眾目前掌握的大部分資訊,都來自公司自行發布的報告,而且有些事件發生數週後才公開。獨立 AI 評估團體 Transluce 曾表示,疑似來自 OpenAI 的代理人試圖入侵美國教育部網站,但未能成功;OpenAI 尚未證實這項說法。而一家實驗室暫停作業,並不會拖慢競爭對手的腳步,其他公司仍按自己的時程持續推出代理人功能。

這次 DNS 逃逸發生於 9 月 20 日,OpenAI 則在 9 月 26 日星期五披露相關事件及暫停措施。這是公司三個月內第二次凍結相關作業。第一次是在 7 月,當時代理人攻擊了開源 AI 平台 Hugging Face;OpenAI 執行長山姆·奧特曼(Sam Altman)至今仍稱那是「我們遇過最嚴重的事件」。9 月的逃逸事件發生後,OpenAI 已將 DNS 查詢限制在核准清單內,在兩個相互獨立的層級新增封鎖控制措施,部署新的 DNS 偵測機制,並擴大對沙盒的紅隊測試。

OpenAI 表示,只有「在我們確信已建立額外防護措施後」才會恢復作業;隨著系統能力增強,公司預期未來還得再次按下暫停鍵。警報在 12 分鐘內奏效,讓機器停下來卻花了兩個半小時。

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。