技術

Gemini 4 Argon:Google的反攻之作,幾乎還沒人用得到

Google DeepMind新模型最多可輸出100萬個token,並在Google自家榜單奪冠,但第一批只開放給經過審核的資安防禦人員
Adrian Kessler
在 Google 中新增我們

過去一年大半時間,Google的人工智慧故事談的都是它還沒推出的東西。Gemini 4 Argon就是它的回應,而這款模型最能說明問題的,不是哪一項基準分數,而是誰能用到它的那份名單。Google DeepMind的這款新前沿模型將透過公司的Fairwind Program,率先交給一小群經過審核的資安防禦人員,除此之外不對任何人開放。

Argon是為長時程任務打造的:軟體工程、法律與金融研究,以及網路防禦。最關鍵的機制變化在於輸出長度:模型現在能在單次執行中推理並寫出數十萬個token,足以把一項大型程式碼遷移一路做到完,而不必再用零碎片段拼湊起來。

Google表示,已有數千名內部工程師在使用這款模型。公司在發表內容中描述,Argon代理已在旗下各資料中心釋放超過300 TiB的記憶體,並正把C與C++程式碼移植到記憶體安全的語言Rust,範圍一路延伸到逾80萬行的Fuchsia Zircon核心。在Google的開源影片解碼器libgav1上,Argon把32,000行手工調校的SIMD程式碼改寫成安全的Rust,執行速度比先前的Rust移植版本快2.7倍。

Bar chart comparing Gemini 4 Argon and Gemini 3.8 Flash Cyber on vulnerability discovery and the Wiz penetration test benchmark
Image: Google

輸出上限從64,000個token提高到100萬個token。基準數據全都出自Google自己:DeepSWE v1.1拿下77.9%,在以經濟價值加權的知識工作榜單Vals Index排名第一,在長影片理解測試LVBench拿下91.7%。根據VentureBeat的統計,在已公布的18項基準中,Argon在12項上獨占鰲頭,但在FrontierSWE v2上,OpenAI的GPT-6 Astra仍領先它超過10個百分點。在外部測試者能親自執行這款模型之前,這些都只是說法,不是定論。

資安這個定位,說明了為何門檻設得這麼高。Google訓練Argon自行找出、驗證並修補漏洞,還會提供受信任的防禦人員一個拿掉資安防護機制的版本。透過Wiz的Scan for Good計畫,這款模型在醫院軟體中揪出一個會外洩個人資料的嚴重漏洞,而先前的模型都沒發現。令人不安的機制在於:一個如此擅長補洞的模型,按定義也同樣擅長找洞。

所以,安全措施才是真正的重點。Google表示,Argon會拒絕協助網路攻擊以及化學、生物、放射性或核子攻擊,是該公司迄今對提示注入抵抗力最強的模型,並在一套監控系統下運作,這套系統會監看它的思維鏈,一旦超出使用者意圖就中止執行。Google也參與了美國政府自願性質的模型發布前存取程序。

那麼,現在誰能用到Gemini 4 Argon?只有Fairwind的參與者和Google內部團隊。開放給開發者、企業與一般消費者的時間尚未公布;開放將從付費API客戶和Google AI Ultra訂閱者開始。首發價格為每百萬輸入token 2美元、每百萬輸出token 10美元,之後將分別調漲至4美元和20美元。

這款模型由科雷·卡武克丘奧盧於9月30日發表。在德米斯·哈薩比斯於8月卸下執行長一職後,他接掌了Google DeepMind。這是Google自2025年11月推出Gemini 3以來第一款全新旗艦模型,而它真正的考驗不在排行榜上,而在於一款拿掉防護機制發布的模型,能否始終留在原本託付的人手中。

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。