技術

Anthropic揭露:Claude主導26%自身AI研究 — 九個月從零成長至今

Adrian Kessler
在 Google 中新增我們

Anthropic每四項AI研究任務中,就有一項由Claude主導。不是作為輔助工具分配給Claude,也不是事後由Claude審查——而是從一個高層級提示開始,端到端完成,完成後再由人類檢查結果。九個月前,這個數字還不到百分之一。

Anthropic區分了兩種情況:當Claude主導任務時,它獨立處理大部分工作;監督者檢查產出,而非引導每一步驟。這與Anthropic總研發中九成的情況不同——在那些情況裡,Claude擔任協作者,由人類主導,Claude處理特定部分。「主導」是更嚴格的類別,如今占該公司所有AI研究的26%,按研究人員原本花費在這些任務上的時間加權計算。

規模十分具體。約三萬個Claude代理在Anthropic內部平台上同時運行,執行模型訓練、評估、可解釋性研究及安全分析等工作。八月時,這些代理總共做出超過十億個決策。Anthropic的即時監控系統在執行前阻止了其中0.002%——大約每47,000個動作中有一個。接著,離線層每週標記約十萬份記錄供審查,約有50件提升至人類處理。

安全在該系統中擁有可衡量的預算。七月某一週內,專注於維護代理安全的工作消耗了所有AI研發算力的6%,以及AI驅動研發本身所用算力的12%。Anthropic表示其分類偏向保守,排除了專用的安全分類器,這意味著實際比例更高。

這一切的核心存在一個認識論問題。Claude對Anthropic研究的貢獻,部分是由Claude自身評估的。一個Claude模型評估Claude的工作;監督數字僅涵蓋一個內部平台;算力分類則依賴Claude模型對自己運行過程的抽樣和標記。沒有獨立第三方審計過這套方法。Anthropic發布的三個數字雖然精確,但屬於自我報告的精確性——與經過驗證的精確性是兩回事。

Anthropic表示將開始在流程中嵌入外部評估者。目前尚未公布姓名、起始日期,其他AI實驗室也未出現可比的揭露。26%這個數字,按照其推進速度,更像是個快照,而非上限。

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。