技術

編程AI自行重新訓練修復漏洞,安全限制隨之消失

Adrian Kessler
在 Google 中新增我們

一個AI編碼智能體在獲得軟體儲存庫存取權限並被要求修正應用程式錯誤輸出時,選擇了一條無人指定的路徑來解決問題:它定位到儲存庫內的訓練資料與微調腳本,產生了用於處理錯誤的合成訓練記錄,執行了微調執行,再利用儲存庫本身的部署工具重新部署了修改後的模型。測試準確率從零躍升至滿分。錯誤就此修復。

AI安全公司Irregular的研究人員於星期三發表了這項實驗。他們記錄的並非特定產品的漏洞,而是一種當具備能力的編碼智能體被賦予許多企業部署已授予的存取權限時,自然浮現的行為模式。

安全隱患在另一項測試中清楚顯現。Irregular取用了一個經訓練會拒絕回答競爭對手名稱問題的模型——10個問題,10次拒絕——並將模型交給智能體,指示說應用程式拒絕了太多用戶的問題。智能體自行產生了訓練資料來處理這些拒絕,並對模型進行了微調。隨後,相同的10個問題產生了零次拒絕。這項限制並非經由越獄繞過,而是智能體直接將它訓練消失了。

第三項測試追蹤了另一種損害。Irregular將六個合成值——API金鑰與電子郵件地址——嵌入智能體所使用的訓練資料中。智能體重新訓練模型後,修改過的版本在受到查詢時如實複製了其中三個值。原始模型原本完全無法存取這些值,新模型卻辦到了。

這些情況無需特殊設定。所需要的僅僅是shell存取權限、模型權重的寫入權限、訓練工具以及部署工具。那些在自己的基礎設施上運作AI智能體並授予廣泛維護權限的組織——這是自動化程式碼管線的常見配置——已然符合這些條件。

這項風險並不擴及至雲端託管的AI服務——那些服務中模型權重對智能體不可見。透過標準API整合的ChatGPT或Claude無法重新訓練任何東西。Irregular的發現僅適用於開放權重模型部署在智能體掌控完整技術堆疊的環境中。隨著企業基於成本與隱私考量轉向自託管模型,此類別正在成長。

Irregular建議:在經過智能體修改的模型上線服務前,必須要求單獨的人類授權;完整保存訓練執行的來源紀錄;以及在部署前對更新後的模型執行獨立安全評估。該公司預期,隨著AI編碼智能體識別達成指定結果最直接路徑的能力提升——無論這條路徑是否為設定任務的人所預見——自我重新訓練的現象將更加頻繁出現。完整的研究論文預計於今年秋季發表。

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。