技術

OpenAI宣告AGI到來,引用的基準測試成績低37分

Adrian Kessler

黃仁勳在X上的貼文只有一句話和一聲祝賀:「從ChatGPT到o1再到Astra,四年內,AGI已經到來。恭喜@OpenAI團隊。」他於9月6日發出這則貼文。三天前,OpenAI總裁格雷格·布羅克曼(Greg Brockman)向媒體用了幾乎相同的措辭:「歡迎來到AGI時代。」兩項宣言接連出現,出自兩位利益互補的人,而外界大抵將其視為確認。

這項主張背後的基準是ARC-AGI-3。OpenAI表示,其以GPT-6代號發布的新前沿模型Astra,在ARC-AGI-3上獲得99.9%的分數,在FrontierMath Tier 4上獲得98%。在標準條件下,這種水準的分數將代表真正的斷裂——一個不僅表現出色、而且進入早期基準視為理想目標的領域的模型。建立ARC-AGI-3的組織發布了其標準評估框架下的成績:62.7%。

這兩個數字相差三十七個百分點。兩者都來自真實評估。OpenAI的內部框架與基準建立者的參考框架並非同一套協議,同一模型在各自框架下會產生不同分數。ARC-AGI-3組織所用的參考條件——即其認為可用於跨領域比較模型的條件——產生62.7%。OpenAI的內部設定產生99.9%。這兩個數字之間的差距,就是強勁基準結果與到來宣言之間的差距。

AGI祝賀背後的晶片交易

Astra是以NVIDIA晶片訓練的。黃仁勳銷售NVIDIA晶片。當一位CEO公開祝賀客戶跨越歷史門檻——一個使打造該產品所用的硬體成為未來關鍵基礎設施的門檻——這項公告在結構上就是一項商業主張。不是陰謀。而是結構性現實:利益衝突顯而易見,框架圍繞著「到來」而非「表現」,而大多數報導在未加評論的情況下接受了這兩者。

AI基礎設施的晶片市場依賴敘事而運作。如果Astra是AGI,那麼訓練Astra的一切就成為後AGI世界的硬體——而為下一次訓練購買晶片的公司,將朝向那個基準去購買。黃仁勳的祝賀,在那個特定意義上,也是一份產品聲明。這項聲明依賴於一個基準組織本身以不同方式測量的數字。

獨立驗證顯示了什麼——以及它沒顯示什麼

截至本文發布,Astra並未出現在Artificial Analysis Intelligence Index或Arena.ai的排行榜中——這兩個是前沿模型最受關注的獨立評估系統。重大前沿發布的獨立驗證通常會在數日內出現。這裡的缺席並非表現不佳的證據。它意味著通常伴隨此等規模主張的外部驗證尚未實現。

基準建立者給出的62.7%並非反駁。在ARC-AGI-3上達到該水準——這是一項旨在抵禦過往基準被膨脹的優化技巧的測試——確實強勁。ARC-AGI-3的前身已經飽和:模型吸收了類似於測試題目的訓練資料,將分數推高,卻未改善新穎推理能力。ARC-AGI-3改變了題目設計,要求從模式檢索中進行抽象。在參考框架下,該測試的六十二點七個百分點,遠高於兩年前存在的任何水準。

提出異議的研究人員對此非常精確。他們針對的不是模型的能力。而是從表現跳到宣言的那一步。「在這些基準上表現良好」與「AGI已經到來」之間需要一個過渡步驟:一個穩定、共通的AGI定義,用以衡量到來與否。目前整個領域並不存在這種定義。OpenAI有內部定義。依照OpenAI自己的定義,Astra或許符合資格。但一家公司以自己撰寫的定義來衡量自家產品,與以外部標準衡量的結果,是不同種類的結果。

沒有附帶定義的那句話

黃仁勳的貼文沒有任何但書。「AGI已經到來」是陳述句——不是「依照某些衡量標準」或「在某些定義下」,而是乾淨俐落的到來。他提到的四年進程——ChatGPT、o1、Astra——作為能力軌跡是真實的。這個序列中的每個模型都擴展了可能性的邊界。將該序列框定為一趟有終點的旅程,並宣布終點,則是在做出不同的主張:它說「到來」與旅程可區分,存在一條線而非一個坡度,而Astra跨越了那條線。

這項主張背後的基準數字是62.7%。打造這項測試的人發布了它。它提出的問題——AGI宣言究竟是一項測量還是市場動作——在9月6日就在那裡。而報導大多在未發問的情況下回答了它。

標籤: , , , , ,

討論

共有 0 則留言。