技術

楊立昆告誡學術界:「你們絕對不應該研究大型語言模型」

Adrian Kessler
在 Google 中新增我們

多年來,楊·勒昆一直告訴人工智慧產業,大型語言模型走的是一條迂迴路線。如今,一段在 X 上廣為流傳的演講片段中,這位圖靈獎得主把警告指向規模較小、也更弱勢的群體——大學實驗室裡的研究人員,而且不留任何餘地。

「不要研究大型語言模型。至少,如果你身在學界,就絕對不要研究大型語言模型。你沒有任何東西可以貢獻。如果你有興趣讓人工智慧真正取得進展,打造某種扎根於現實世界的人工智慧,或是發展實體人工智慧,就不要研究大型語言模型,也不要研究生成式模型。」

這番話出自他在 ETH Zurich 的演講,題為「World Models: Enabling the Next AI Revolution」,是 5 月 29 日舉行的 Frontiers of Embodied AI 講座之一。人工智慧評論員羅漢·保羅(Rohan Paul)本週將這段影片貼出,稱之為勒昆「最新的演講」,但實際上它已是四個月前的內容。接下來一句引來笑聲:「所以,你大概猜得到,這讓我在矽谷不太受歡迎。」他身後投影片的標題是「給人工智慧同行的建議」,最後以紅色大字寫道:「如果你對人類層級的人工智慧有興趣,就不要研究大型語言模型。」

前半段談的是算力

撇開挑釁意味,這番給學界的建議,說到底是經濟問題。大型語言模型的進展,靠的是在叢集上進行訓練,而有能力負擔這類訓練的公司屈指可數。博士生很難在一場由預算決定勝負的競賽中有所作為,這正是「你沒有任何東西可以貢獻」在實際上的意思。勒昆談這個觀點已經有一段時間:據 VentureBeat 報導,他在 2024 年巴黎 VivaTech 活動上告訴那些想打造下一代人工智慧的學生,大型語言模型掌握在大公司手中。

投影片也列出他認為研究者應改投入的方向:以聯合嵌入架構取代生成式模型;以能量式模型取代機率模型;以正則化方法取代對比式方法;以模型預測控制取代強化學習——他認為,強化學習只應用來修正計畫,以應對現實世界不如預期運作的情況。這些想法都能用規模不大的硬體進行測試,而這正是大學實驗室仍握有優勢之處。

後半段才是真正的挑釁

「生成式模型也不要研究」,比一般對聊天機器人的批評更進一步。這是否定生成本身,也就是否定透過預測下一個詞或像素來建構智慧的想法;這使勒昆與許多常被歸在他身邊的實體人工智慧領域人士立場相左。上週,AMD 同意以全股票交易收購李飛飛(Fei-Fei Li)的 World Labs,交易估值約 82 億美元。The Register 將這筆交易形容為一種避險,以防大型語言模型最終證明是條死路,並指出勒昆也曾表達過類似看法。然而,World Labs 打造的是能生成並模擬 3D 環境的模型。NVIDIA 的 Cosmos 3 同樣是生成式世界模型,而 Physical Intelligence 則以視覺語言模型為基礎打造機器人模型。流向「世界,而非文字」的資金,大多並沒有流向勒昆所主張的那種做法。

來自手握股權表人士的建議

還得把發言者的身分納入考量。勒昆離開 Meta 後,現任巴黎 AMI Labs 執行董事長。該公司在 3 月募得 10.3 億美元,估值達 35 億美元,創下歐洲規模最大的種子輪募資紀錄,目標是打造可作為大型語言模型替代方案的世界模型。公司正於巴黎、紐約、蒙特婁和新加坡擴大招聘。每一位採納他建議的研究者,都可能成為公司的潛在人才。

這不代表他的建議出於功利。他在 AMI 成立之前就持有這個觀點,也早在投資人以現金支持之前,便為此付出名聲上的代價。但到了 2026 年,研究建議與商業計畫恰好指向同一個方向,學生應該把這點納入考量。

勒昆開玩笑說,這番話讓他在矽谷失去朋友。對正在選擇論文題目的學生來說,賭注更大:把博士研究押在一種架構上,而他剛為證明這種架構投入了十億美元。

標籤: , , , ,

在 Google 中新增我們

討論

共有 0 則留言。