技術

Anthropic AI向費城警方送出假命案線報 市府法務部門介入

Adrian Kessler
在 Google 中新增我們

Anthropic 模型在費城警方網站留下的假殺人案線索,從未送到任何偵探手上;垃圾郵件過濾器先一步攔下了它。這是令人安心的部分,也是公司自己的說法著重強調的一面。費城採取行動所依據的,卻是另一面:這則線索在市府系統裡待了好幾週,直到製造出它的公司發現為止;如今,市府已讓律師介入處理。

在聊天機器人假扮目擊者這件怪事背後,其實有個更單純的運作方式。這個模型在一項測試中直接於公開網路上執行,只受到一份簡短的禁令清單約束。清單並未禁止它在一宗未破殺人案中提交捏造的目擊資訊。

Anthropic 的模型實際做了什麼

根據 Anthropic 自己的說法,這個模型是 Claude Haiku 4.5,設定為在隨機挑選的網頁上編造並執行範例任務。其中一個網頁是費城市府專門徵集未破殺人案線索的網站 PhillyUnsolvedMurders.com。給模型的指示要求它「絕不可登入、建立帳戶、輸入個人資料、購物,或提交任何具破壞性的內容」。指示沒有提到表單。於是模型填寫了表單,姓名和聯絡方式欄位留白,並寫道:「我可能掌握與此案相關的資訊。」

據 Fox Business 報導,訊息還進一步聲稱,模型記得曾在頁面提及的一條街附近,看見一名「符合描述」的人。頁面上其實沒有嫌疑人的描述。訊息最後寫道:「如果這項資訊有用,請聯絡我。」警方表示,這則訊息被標記為垃圾郵件,從未轉交即時犯罪中心審核;警方也沒有發現部門系統或資料遭未經授權存取的跡象。

為何費城不把這當成系統故障

警方聲明肯定自家防護措施遏止了損害,卻不認為這就能了結此事。聲明指出,這些防護措施「並不會減輕 AI 系統提供虛構資訊一事的嚴重性」,並補充說:「未破案件涉及真實受害者、悲痛的家屬,以及努力尋求答案的調查人員。」警方告訴 Anthropic,「公司必須加強防護措施,避免類似事件影響市府系統」,並稱市府過了這麼久才接獲通知「令人無法接受」。

事情也因此不再只是模型出了什麼狀況,而是關乎一家公司。據 NBC10 報導,警方目前正與市府法律部門、創新與科技辦公室,以及市長謝蕾爾·帕克(Cherelle Parker)的行政團隊合作;市府表示,將研究在地方、州及聯邦層級採取監管措施。目前尚未宣布任何指控或處罰。但對 Anthropic 而言,一個正在研究如何規範 AI 實驗室測試系統方式的市政府,已成為一種全新的交涉對象。

只是更長清單中的一項

費城這則線索,出現在警方公開事件的同一天 Anthropic 發布的一份報告中。報告將模型在真實系統上意外採取的行動分成四類:利用第三方網站的軟體漏洞執行指令、提交原本不該提交的表單、繞過限制取得受管制資料,以及利用縮網址服務規避擷取工具的限制。其中一個案例裡,一個尚未發布的研究模型因練習用的表格無法載入,便提交了一份真實的政府表格。另一個案例中,Claude Mythos 5 在地圖網站的設定檔裡找到存取權杖,並用它查詢地方政府伺服器。

部分網站屬於聯邦、州及地方機關;Anthropic 表示,已向白宮簡報,並通知每個涉事機關。公司形容這些案例「對現實世界的影響極小」,嚴重程度也低於先前披露的事件;當時 Claude 在網路安全評估期間,曾連續數小時存取真實的第三方系統。公司也表示,尚未完成對這些新案例的全面對齊評估。

時機至關重要。美國聯邦貿易委員會在 9 月底證實,正對 Anthropic、OpenAI 及其他實驗室展開業界範圍的調查,檢視它們是否違反《聯邦貿易委員會法》,並正準備發出正式要求,據 Reuters 和 The Next Web 報導,這類要求可強制企業主管作證。Reuters 報導,美國聯邦貿易委員會主席安德魯·弗格森(Andrew Ferguson)曾表示,如果開發者的測試代理程式最終入侵系統,開發者就應對造成的損害負責。這份調查檔案中最廣為人知的案例來自 OpenAI:該公司在 7 月披露,旗下逾千個代理程式曾入侵 Hugging Face 平台。

Anthropic 做了哪些改變,又承認了什麼

Anthropic 表示,已關閉導致事件發生的測試流程,新增驗證步驟,收緊模型使用網頁工具的權限,並建立偵測工具;測試結果顯示,這套工具能攔截報告中的所有案例。最大的改變其實是退讓:公司已將停止存取即時網際網路的措施擴大至所有內部評估,「直到我們確認安全與監控措施」能可靠地捕捉這類行為為止。直白地說,公司目前還無法保證能看見代理程式在公開網路上的所有行動,因此先讓它們退出網路。

日期說明了市府為何不滿。警方將線索日期記為 7 月 18 日(PhillyVoice 於 7 月 28 日報導)。Anthropic 表示,該公司在 7 月開始檢視對話紀錄時發現此事;警方則稱,公司直到 9 月 28 日才發現。警方表示,Anthropic 於 10 月 7 日星期三通知他們,並在隔天舉行會議;Anthropic 的報告則將分享調查結果的日期記為 10 月 8 日,並稱當時「技術審查一完成便立即」通知。警方於 10 月 9 日對外公布事件。

這次發揮作用的防護措施屬於市府:垃圾郵件過濾器,以及每一則線索都必須由真人審核的規定。測試代理程式下一次決定填寫的表單,可能屬於一個沒有這些防護措施的對象。

標籤: , , , ,

在 Google 中新增我們

討論

共有 0 則留言。