技術

微軟在內部文件中稱AI資料抓取為「人類史上最大的勞動竊取」

Adrian Kessler
在 Google 中新增我們

微軟一位科學家為公司正在打造的技術取了個名字,而這個名字一點都不光彩。他在檢視大型語言模型如何從開放網路上學習時,稱之為「人類史上最大規模的勞力竊盜」。這句話原本是寫給內部看的,如今卻成了法庭上的證物。

這句話如今被當作一個「抓到了」的鐵證:AI 巨頭的自家員工稱其商業模式為竊盜。但這樣的解讀太狹隘了。這份解封的法律文件真正顯示的是,這家公司深知自己正在變現的機制,並以白話文描述了那個機制,然後還是照樣出貨。有趣的地方不在於那句罵人的話,而在於它底下那張示意圖。

這份文件出自微軟應用科學總監布倫特·赫克特(Brent Hecht)之手,出現在《紐約時報》控告 OpenAI 與微軟的著作權官司中。赫克特主張,未經付費就以已發表的作品訓練模型,形同「一場史無前例、令人震驚的竊盜」。另一份內部簡報更深入探討了這套機制的運作:它警告微軟的 AI 內容策略已啟動「死亡迴圈」,將「同時傷害我們模型的效能與整個網路」。其中一句話寫道,大型語言模型是「一個摧毀自身供應鏈的產品」。

最後那句話用七個字就講完了整個故事(編按:指原文“a product that destroys its supply chain”)。一個在搜尋框內直接回答問題的聊天機器人,剝奪了使用者點進它學習來源頁面的理由。點擊次數減少,意味著產出這些文章的網站收入降低,能存活的網站變少,可供下一個模型訓練的新鮮人類文字也跟著減少。微軟並非從外部旁觀這個迴圈,而是用自己的數據實際測量過:Copilot 的答案引擎讓《紐約時報》網站的點擊率比一般搜尋減少了多達 93%。

這些文件也量化了這樁交易的輸入端。OpenAI 的中期訓練資料中,含有超過 91,000 份來自《紐約時報》、《每日新聞》與「調查報導中心」的作品。一份取自 Common Crawl 的資料集,光是 nytimes.com 的文件就超過兩百萬份。一個名為「Project Mango」的集合中,至少包含 16 萬份來自新聞出版商的獨特作品。文件中描述,付費牆被繞過,著作權聲明在資料被餵入模型前就被剝除。

OpenAI 自己的高層對這種效應並非一無所知。負責 ChatGPT 的尼克·圖利(Nick Turley)在受訪時表示,這些產品對新聞業而言「很大程度上具有取代性」,並稱此一轉變對出版商是「生存威脅」。這與赫克特得出的結論相同,只是掛在不同的職銜下。

這就是為什麼這些話語的意義遠超於難堪。微軟已與這些言論保持距離,告訴法院其實際立場是遵守著作權法,而兩家公司都不願對外洩事件發表評論。但合理使用抗辯某種程度上取決於公司知道什麼、意圖為何。自家科學家在文件中點名傷害——竊盜、供應鏈被摧毀、網路被掏空——這些都不是公司能輕易撇清的意見。它們讀起來就像是證據,顯示這套機制在規模化之前就已為人所知。

這些模型學習的網路,是由那些預設另一端有讀者存在的人所建立的。微軟的文件顯示,它白紙黑字知道讀者正被工程性地排除,卻仍持續建造。

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。