技術

Anthropic推出Fable 5.1:快取成本降低75%,代理任務基準成績翻倍

Susan Hill

Anthropic 於 9 月 1 日推出 Fable 5.1,將快取輸入 token 成本從每百萬個 1.00 美元降至 0.25 美元——降幅達 75%,而此刻正值多數生產級 AI 開發者發現,真正讓基礎設施預算吃緊的並非原始運算,而是脈絡累積。在即時代理型(agentic)對話中,單一個 Claude 對話可能因回合間不斷累積脈絡,而在快取中存放數十萬個 token。每百萬個 0.25 美元的價格,讓這種累積從開發者必須設法繞過的成本上限,變成一項可以刻意設計的選擇。

與價格變動一同公布的評測結果顯示,效能的提升進一步強化這項經濟誘因。在 Terminal-Bench-Science 0.1 這項衡量多步驟科學推理、需要實驗設計與反覆分析的評測中,Fable 5.1 拿下 52.6%,而 Fable 5 僅為 24.7%——成績翻了一倍以上。AutomationBench 從 17.1% 提升至 31.4%,Terminal-Bench 4.0(一項更廣泛的代理型能力評估)則從 42.0% 上升至 55.8%。CursorBench 3.2.0 的成績為 73.4%。四項評測的趨勢一致:Fable 5.1 並非邊際上的小幅進步,而是在定義代理型價值的任務類別上顯著更可靠。

兩項效果加總,改寫了以 Claude 開發應用的成本計算邏輯。一個代理型應用若能以更少回合完成任務——因為模型更可靠——在通往成功結果的路徑上就會消耗更少的 token 總量。將 75% 的快取降價套用在它實際使用的 token 上,在高重複使用的代理型工作流程中,每項任務的有效成本降幅可達 45% 甚至更高。Anthropic 並未公布一個統包的總節省數字,但自行建模評估 token 經濟效益的開發者,在脈絡密集的工作負載上會得出相近的範圍。

Fable 5.1 即日起可透過 Anthropic 的直接 API(模型識別碼為 claude-fable-5-1),以及 Amazon Web Services Bedrock、Google Cloud Platform 與 Microsoft Azure 使用。Anthropic 同步推出 Enterprise Frontier Safeguards 功能:由客戶控制的資料保留政策、客戶管理的加密金鑰,以及部署在客戶既有雲端基礎設施租戶內,除了底層雲端費用外不額外收費。

在一般發行之外,Anthropic 也推出了 Mythos 5.1,這是同一基礎模型的變體,但公司表示其安全防護機制針對經過審查的組織設定了更寬鬆的條件。僅限經過驗證的網絡安全研究機構與生命科學公司使用。Anthropic 列舉的應用案例包括蛋白質結合體設計與生物模型最佳化,其推論吞吐量可達標準版本的 2.5 倍。Mythos 5.1 並非自助式服務:Anthropic 會逐案審查申請,且未公布已加入的用戶規模。

Fable 5.1 在代理型任務——尤其是 Terminal-Bench-Science——上的成績,讓 Anthropic 公布的結果領先 OpenAI 最新揭露的對等評測數字。跨公司的評測比較在方法上須保持審慎——供應商會挑選對自家模型有利的評測,而 Anthropic 特別強調的這些測試顯然是選出結果較佳的項目。然而內部成績翻倍的模式卻難以迴避:Fable 5.1 並非同一個模型貼上降價標籤。效能的變化幅度之大,讓定價故事與效能故事根本無法分開看待。

對於目前未使用 Claude 的開發者而言,快取定價的調整才是值得換算成自身 token 經濟效益的數字。任何未能將快取 token 價格壓到每百萬個 0.25 美元附近的 AI 供應商,現在都將在企業銷售對話中面臨直接的價格比較問題。Anthropic 的快取價格在本次降價前已低於數家競爭對手;如今差距進一步拉大。效能提升難以一概適用於所有使用場景,但在代理型與科學推理這個領域,Fable 5.1 樹立了一個標竿,任何供應商的下一個重大版本都將以此為比較基準。

標籤: , , , ,

討論

共有 0 則留言。