技術

DeepSeek V4.1 Flash快取降60%

Adrian Kessler

DeepSeek V4.1 Flash 採用該公司稱之為「因果編碼器-解碼器」(Causal Encoder-Decoder)的全新架構。其 5520 億個參數分佈於 20 層編碼器與 20 層解碼器,但僅有 80 億個參數在輸入標記時激活,輸出時則為 160 億個。這使得它在結構上比那些每次運算都激活更大參數片段的模型更為精簡——這項設計選擇直接體現在推論成本與記憶體效率的優勢上。

記憶體方面的提升具體明確。V4.1 Flash 的 KV 快取為每個標記 890 位元組,約為 V4-Flash 的四分之一。透過 FP4 快取與壓縮稀疏注意力機制 2(Compressed Sparse Attention 2),其持續性快取占用量降至前一代的八分之一。離峰時段的快取輸入成本現為每百萬個標記 0.003 美元——比 V4-Flash 下降了 60%。未快取輸入成本下降 33%,輸出成本下降 11%。

在開發者最關注的各項基準測試中,該模型表現不俗。在自主軟體工程測試 DeepSWE v1.1 中,它獲得 74.2 分,略微領先 Anthropic 的 Opus 5(74.0 分)與 GPT-5.6 Sol(73.0 分)。GPQA Diamond 得分為 90.9。較為顯著的差距出現在 Terminal-Bench 3.0 上:V4.1 Flash 得分 30.0,而 Opus 5 為 43.3 分,這是一項在需要擴展互動除錯任務上的真實差異。

視覺能力已從預訓練階段內建。先前,V4 將視覺功能拆分為獨立的 Vision-Exp 變體。V4.1 Flash 則以單一模型取代這兩者,該模型基於 DeepSeek-ViT(一種從一開始就與語言模型共同開發的、經過專項訓練的編碼器)。多模態層級已不復存在——每次呼叫預設即可獲得視覺能力。

上下文視窗為 100 萬個標記,輸出上限為 384,000 個標記,足以用於長篇文件分析與擴展代理工作流程,無需進行區塊切割。使用舊版 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 識別碼的現有 API 呼叫者,現在已自動被路由至 V4.1 Flash。自 2025 年 9 月 14 日起,DeepSeek V4 Pro 的流量也將以 Flash 的價格完成轉換。

DeepSeek 將 V4.1 Flash 描述為「我們新架構系列中最小的一款模型」。這暗示著一個採用相同因果編碼-解碼設計的、規模更大的 V4.1 Pro 也將問世。如果它能保持 Flash 的效率軌跡,那麼它將把這種架構的每美元效能表現進一步推向基準測試曲線的高端——進入目前由每百萬標記成本顯著更高的模型所佔據的領域。

架構上的重要性不僅僅體現在定價表上。KV 快取的增長是大型模型在長上下文場景下運行的主要限制因素,而它會隨著處理的每個標記而擴增。V4.1 Flash 的方法——更少的活躍點,壓縮後的快取——直接應對了這一挑戰。它是一個可用於長上下文部署的模板,而非一種僅針對邊際案例的優化。

標籤: , , , , ,

討論

共有 0 則留言。