技術

Meta發布Muse Glimmer:300億參數AI智能體可在本地GPU上運行

Adrian Kessler

Meta打造了一款擁有300億參數的AI代理,完全在消費級硬體上運作,並免費開源釋出。這款名為Muse Glimmer的模型不會將你的任務路由到Meta的伺服器。它在你自己的GPU本地執行,量化後的記憶體占用僅18到20GB,落在當前高階消費級顯示卡的規格範圍內。

這點之所以重要,是因為上一代本地模型——那些過去兩年充斥Ollama函式庫的70億和130億參數版本——雖然能產生流暢文字,但作為自主代理卻表現不佳。它們難以處理多步驟推理、中途失敗的工具呼叫,以及需要記住前幾步任務的問題。Muse Glimmer正是為這類工作流程而設計:程式撰寫、函式呼叫、行程管理、檔案整理,以及能在工具呼叫中斷時自動復原的多步驟任務序列。

底層架構是Muse Spark的蒸餾版本,後者是Meta上個月開始銷售API存取權的商業模型。透過Logit蒸餾和強化學習,Meta將其閉源旗艦模型壓縮成能裝入24GB GPU的形式——RTX 5090、Apple M5 Max或M4 Max。投機解碼(Speculative decoding)進一步提升吞吐量:RTX 5090的運算速度是未使用時的3.1倍,M5 Max為1.8倍,M4 Max為1.5倍。實際使用上,這差異正是反應靈敏的代理與需要耐心的代理之間的分界線。

該模型可處理交錯文本與影像——螢幕截圖、文件、混合內容輸入——並支援超過100種語言。它原生相容本地AI用戶已在使用的主流框架:Ollama、LM Studio、llama.cpp、MLX。如果你已經從Hugging Face下載模型並在自己的硬體上執行,Muse Glimmer無需額外工具即可融入現有工作流程。

授權條款為Apache 2.0,意味著沒有商業限制。個人、企業和研究人員皆可免費使用,無需付費給Meta。這使其與OpenAIAnthropic的模型截然不同,後者即使開發階段也需按Token付費。相比Google的Gemma4-31B和阿里巴巴的Qwen3.6-27B——規模上最接近的開放權重競爭對手——Meta強調Muse Glimmer在同等規模下於代理任務與通用語言模型基準上表現強勁,但未具體說明在哪項任務上勝出。

硬體門檻依然嚴苛。將18GB的模型權重裝入GPU聽起來可行,但算一算需要什麼GPU就知道了。RTX 5090當前售價超過兩千美元。Apple M5 Max機型起始價近三千美元。這是針對特定收入族群的本地AI,並非多數用戶的雲端替代品。量化版本也是Muse Spark的低保真度兄弟:它繼承了商業模型的訓練訊號,但並非商業模型本身。Meta繼續銷售更高能力版本的API存取權。

這次發布真正改變的是本地模型中「具備能力的代理」這一層級。執行一個專為自主任務完成而訓練的300億參數模型,與執行相同參數量的聊天模型截然不同。區別在於模型如何處理工具失敗與多步驟序列——而非它如何完美完成一句話。

模型權重已從8月10日起在Hugging Face上提供,採用Apache 2.0授權。Meta已確認與AMD、Arm、Dell、Intel及Nvidia的裝置級優化合作關係,後續還將針對特定硬體配置推出調優版本。本地AI社群將在數天內對模型進行壓力測試——正如它對每次重大發布所做的那樣——該社群的標竿結果將在兩週內提供更清晰的圖像,顯示Muse Glimmer的真正實力。

標籤: , , , , ,

討論

共有 0 則留言。