技術

Claude Opus 5.5以低40%的價格發布,此前其CEO曾呼籲業界為AI減速

Susan Hill
在 Google 中新增我們

Claude Opus 5.5 做到了 Anthropic 先前模型未能辦到的事:成本更低、運作更快,同時在效能上比肩甚至超越一款更大、更昂貴的系統。根據 Anthropic 自家數據,這款模型在代理式編碼、電腦操作、圖表判讀與跨領域推理等項目上,多項指標已超越該公司先前最強大的模型 Claude Fable 5.1。對於那些覺得 Opus 5 好用但價格偏高的使用者與開發者而言,模型能力與成本之間的差距已出現顯著變化。

價格差異相當明確。Opus 5.5 每百萬輸入 tokens 收費 4 美元,每百萬輸出 tokens 收費 20 美元;Opus 5 則分別為 5 美元與 25 美元。快取讀取費用從每百萬 tokens 0.50 美元降至 0.20 美元。Anthropic 表示,典型工作負載整體成本約降低 40%。速度方面也朝同一方向推進:標準版模型的文字生成速度比 Opus 5 快 30% 以上。另有一個快速模式選項,每百萬輸入 tokens 收費 8 美元、輸出 tokens 收費 40 美元,速度可達標準版 Opus 5 的 2.5 倍——對於延遲敏感的應用場景來說相當實用。

Anthropic 公布的效能數據顯示,Opus 5.5 在六項基準測試中有四項領先 Fable 5.1、Opus 5 以及 GPT-6 Astra。在測試即時終端環境中程式碼執行的 Terminal-Bench 4.0 上,Opus 5.5 得分 66.4%,Fable 5.1 則為 55.8%。在橫跨學術與專業知識各領域的 Humanity’s Last Exam 測試中,結果為 67.7% 對 65.6%。衡量電腦介面操作的 OSWorld 2.0 則顯示 81.8% 對 80.7%。Deloitte 的一項測試發現,Opus 5.5 在最低努力設定下,能偵測出 72% 的已知程式碼錯誤,而 Opus 5 在高努力設定下僅為 56%。這些數據來自 Anthropic 及其選定的合作夥伴;公布的誤差範圍在 ±1.6 至 ±5 個百分點之間,且上市時尚無獨立第三方驗證。

有兩個領域打破了這個模式。在 AutomationBench 上,GPT-6 Astra 得分 41.4%,Opus 5.5 為 40.0%。在 Terminal-Bench-Science 上,差距更大:Astra 達到 64.6%,Opus 5.5 則為 58.7%。兩項差異皆落在公布的誤差範圍內——可能只是雜訊——但也可能不是。Anthropic 在其公布的表格中包含了這些數據列,這已經比多數 AI 公司在產品上市時做得更多。這些數字仍須經過獨立審視,才能被視為定論。

在安全性方面,Anthropic 表示 Opus 5.5 在發布前已由包括 METR 在內的外部團隊進行評估。在該公司內部的行為審計中,針對近 2,000 個旨在測試模型是否試圖繞過所設限制的情境,Anthropic 指出 Opus 5.5 嘗試此類規避行為的可能性比 Opus 5 低了 85%。更強大的模型通常更擅長尋找變通方法,因此若此改善得以維持,將具有重要意義。實際部署經驗才是真正的考驗。

這次發布之所以不尋常,在於其時機。本月初,Anthropic 執行長 Dario Amodei(達里奧・阿莫迪)發表了一篇文章,文中寫道他確信要全面應對 AI 風險,就必須「調整能力進步的速度,讓風險預防有時間跟上」。OpenAI 的 Sam Altman(山姆・奧特曼)與 Elon Musk(伊隆・馬斯克)均表示認同這項普遍憂慮。Nvidia 的 Jensen Huang(黃仁勳)則認為基礎科學並不支持此觀點。然後,Anthropic 推出了一款比前代更快、更便宜、也更強大的模型。一種解讀是:一款具備更佳安全評估且更易取得的模型,正是阿莫迪心中所想。另一種解讀是:那篇文章將能力進步視為隱憂,而能力確實進步了。兩種解讀都建立在同一組事實之上,而 Anthropic 的基準測試數據本身無法判定孰是孰非。

Claude Opus 5.5 已於 2026 年 9 月 22 日上線,API 模型 ID 為 claude-opus-5-5。該模型可在 Claude 的 Pro、Max、Team 與 Enterprise 方案中使用,並可透過 AWS、Google Cloud 與 Microsoft Azure 存取。Anthropic 正在提高五小時訂閱層級的用量限制。5.5 系列其餘成員 Sonnet 5.5 與 Haiku 5.5 預計將在未來數週內陸續推出,目前尚未公布兩者的定價或具體上市日期。

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。