扒完DeepSeek最新論文,我發現了V4.1 Flash便宜大碗的祕密

愛範兒
昨天

DeepSeek V4.1 Flash 發布後,DeepSeek 網頁版和 App 也更新了,之前需要選擇的「快速」、「專家」和「識圖」都合併升級為一個入口。

全新的 DeepSeek V4.1 Flash 同時具備了日常對話、圖片理解與複雜問題解決能力,看起來像是把過去這一個多月,DeepSeek 發布的 V4 Flash 正式版、Vision Exp、V4 Pro 正式版幾個模型,全部融合在一起了。

在社交媒體上,大家對 V4.1 Flash 最多的評價就是「快」。

有網友展示自己在 DeepSeek Harness 內的對話,模型的運行速度是 217 tok/s 左右。而其他的測試結果顯示,V4.1 Flash 的運行速度為 420-507 tok/s ,比 Gemini 3.8 Flash 還要更快。

本來是融合了好幾個模型,主幹參數也接近上一代 Flash 的兩倍,從 284B 到了 552B,但怎麼速度就變快了。

雖然 4.1 看着是一次小更新,但從 DeepSeek 公開的技術報告來看,V4.1 Flash 採用了重新設計的模型架構,並擴大了訓練數據和強化學習規模。

參數的增加,但處理長輸入和保存上下文所需的開銷卻降低了,因為每 Token 的全局 KV cache 只有 890 字節,是自家 V4-Flash 的四分之一;和 2023 年的初代 DeepSeek-V1 相比,縮小了約 437 倍。

總參數變多,但是用來每一次工具調用、每一輪對話,模型上下文的 KV cache 卻減少了,而減少的 KV cache 也沒有因此讓 V4.1 Flash 變弱,在多個 Agent 基準測試上,它打平甚至反超了 Claude Opus-5 和 GPT-5.6 Sol。

我們分析了 V4 Flash 和 V4.1 Flash 的兩篇論文技術報告,看到了 DeepSeek 在 Agent 時代到底要做什麼樣的高效率模型。

圖|論文地址:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

模型變大,成本怎麼降下來

所謂的 KV cache 可以理解為模型處理過內容後留下的中間狀態;後續生成需要參考前文時,複用這些狀態,可以省下重新計算的開銷。

而當我們的上下文越長時,這個用來保存模型狀態的工作台台面就會越大,佔的顯存越多。

DeepSeek 四代模型的演化,可以說就是在不斷地對 KV cache 進行壓縮,從 V1 的每 token 389 KB,到 V3.2 的 48 KB、V4-Flash 的 3.5 KB,再到今天的 890 字節,連 1 KB 都不到。

V4.1-Flash 採用的做法是一組組合拳。在架構上,40 層網絡被修改成「編碼器 + 解碼器」兩半(CED 架構),Causal Encoder-Decoder,簡稱 CED。

它把 40 層網絡分成前後兩部分:前 20 層是因果編碼器,後 20 層是解碼器。後半部分需要的全局 KV 緩存,可以直接由前半部分的最終輸出生成,因此,大部分輸入內容無需再完整經過後 20 層。

即解碼器需要的全局記憶直接由編碼器的輸出投影生成,預處理長文本的計算量近乎減半。這對頻繁調用工具、緩存經常不命中的 Agent 負載尤其省錢。

圖|DeepSeek 各代模型在不同上下文長度下的單 Token 解碼(Decode)FLOPs 對比。

具體來說,假設我們讓 AI 幫忙選一批辦公電腦,看產品資料、查價格、列出配置,最後給採購建議。

第一輪,它讀了幾款電腦的介紹。第二輪,我們補充預算,讓它重新篩選。第三輪,我們又接着說,有兩個崗位需要剪視頻,配置得單獨調整。

就這樣每次我們只補充一句話,模型處理的內容卻可能越來越長。要接着完成任務,它需要記得前面選過哪些型號、為什麼淘汰某一款、預算是多少,以及哪些要求啱啱發生了變化。

V4 是標準的 decoder-only,整個模型「讀」和「寫」用同一套全部工序。給它一段 100 萬 token 的輸入,每個 token 都要完整穿過全部 43 層。

現在 V4.1 Flash 大部分只需經過前半段,後半程的解碼器不用再把原文逐層過一遍,而是直接拿編碼器讀完之後「消化好的筆記」,技術上是把編碼器最後一層的隱狀態投影成解碼器的全局 KV cache,然後基於這份筆記開始生成。

圖|V4 Flash 和 V4.1 Flash 架構區別

這樣一來,模型處理輸入時,每個 token 激活約 80 億參數;生成時,激活約 160 億參數。對於足夠長的輸入,技術報告給出的預處理計算量接近減半。

可以說 V4.1 Flash 的 CED 這套結構就是衝着 Agent 負載設計,它優先節省的,正是 Agent 不斷接收材料時的計算。資料越長,省去大部分輸入在後半網絡中的處理,就越有價值。

其次,注意力機制升級為 CSA2,讓不同層之間可以「借用」彼此算好的索引和緩存,而不是各算各的;主 KV cache 更是用上了 FP4 量化,並且特意選了 OCP 開放標準格式,理由是「支持儘可能多的硬件平台」。

V4.1-Flash 的 Compressed Sparse Attention 2,簡稱 CSA2,是讓多個網絡層共享全局 KV 緩存。有的層負責建立緩存、挑出相關位置;後續層可以沿用這份緩存,重新選擇自己需要的位置;還有一些層連選擇結果也直接複用。

上一代部署方案會把全局和部分局部 KV 狀態長期保存,以便用戶重新生成答案,或繼續多輪對話。但局部狀態往往只在活躍會話的短時間內有用,長期保留會佔用大量存儲。

V4.1-Flash 把編碼器的局部狀態放進只保留幾分鐘的內存池。狀態過期後,如果用戶又繼續任務,就重新計算最近 128 個 token,近似恢復需要的局部狀態。DeepSeek 將這個辦法稱為 SWA Bounded Replay。

它用少量重算,換掉了長期保存這部分狀態的開銷。移走局部狀態,再疊加全局緩存壓縮,同等負載下,持久 KV 緩存佔用降到上一代的約八分之一,且可以保證駐留 72 小時以上。

換句話說,用戶三天內回來繼續對話,服務商都不用重新付錢算一遍。

這種近似恢復的方案也會帶來取捨,恢復結果與完整重新計算並不完全相同,DeepSeek 在報告中稱已測場景中的質量影響很小,並把極端長上下文檢索、會話恢復時的狀態變化列為後續重點測試對象。

此外,V4.1 Flash 對比 V4 Flash 的不同,還在於 552B 主幹之外,模型還外掛了 196B 的「條件記憶」模塊 Engram:它不做計算,只做查表。

通過把常見詞的 2 到 4 個組合預先存成一張巨大的哈希表,用到時直接查出來接進網絡,DeepSeek V4.1 Flash 的成本又能進一步下降。

省下計算和存儲之後,模型還得把題做對

V4.1-Flash 使用了包含圖像和文本的 45 萬億 token 預訓練語料。它從語言模型預訓練開始就接觸多模態數據,圖像經過視覺編碼器處理後,與文字一起進入語言主幹。

這讓 Agent 可以直接利用截圖檢查工作。例如,在生成網頁或辦公文件後,讀取渲染出來的畫面,判斷排版、圖表或頁面是否需要修改。工具返回的文字結果之外,模型多了一種檢查依據。

後訓練部分,DeepSeek 也寫得相當明確:這次沿用了監督微調、強化學習和蒸餾,沒有引入新的後訓練算法。團隊主要投入在訓練數據和環境的生產上。

這似乎也在說,RL 的軍備競賽,主戰場可能不在論文裏的新算法,而在數據工程的水電煤。

他們把一道 Agent 任務拆成三個部分:問題、執行環境、驗證系統。模型要面對足夠難的要求,環境得能運行,驗收也要與題目對應。

通用 Agent 的材料,來自內部員工和外部合作伙伴反饋的工作記錄、工具接口與失敗案例。團隊據此重建工具的輸入輸出格式和行為約束,讓模型可以在模擬環境中反覆練習實際工作裏出過錯的步驟。

圖|DeepSeek 會不斷讀取圖片來檢查結果

以編程任務為例,有的 AI 負責出題、準備工作環境,有的負責試做,還有獨立的 AI 檢查題目和驗收要求是否一致、答案有沒有泄漏、能不能靠鑽漏洞過關。檢查不過,就修好題目再試。

任務用於新一輪強化學習後,解題軌跡又會成為重新審核題目質量的材料。某個測試如果一直誘導模型鑽空子,或者失敗源於環境配置而非能力,這些問題就需要回到任務生產環節處理。

圖|在 DeepSeek Harness 的 Minimal 模式下,隨着強化學習(RL)訓練規模的擴大,模型在各項代碼智能體基準測試中的性能均有所提升。

在 DeepSeek 的歸納中,這次後訓練的收益主要來自任務規模、多樣性和可驗證性的改善。模型做過更多類型的工作,也更頻繁地得到與結果相關的反饋。

工具軟件本身也會影響表現,DeepSeek 用不同工具框架測試同一個模型,發現系統提示、工具配置和歷史信息管理的差異,都可能改變任務結果。

DeepSeek 在報告中表示,後續會繼續擴大模型、數據和強化學習規模,並把模型與工具框架放在一起優化。

V4.1-Flash 目前是這一新架構系列中最小尺寸的模型,未來的 V4.1-Pro 或許會延續這一架構,但從上次 V4 Pro 正式版的經歷來看,DeepSeek 顯然不會再輕易就發布一款新的 Pro 模型。

Agent 測試進步明顯,難題仍有差距

能力提升最集中地出現在 Agent 測試中。

在 DeepSeek 公布的最高推理檔位結果裏,V4.1-Flash 的 DeepSWE v1.1 軟件問題解決率達到 74.2%,上一代 Flash 為 54.4%,V4-Pro 為 62.7%。同一測試表格中的 Opus-5 為 74.0%,GPT-5.6 Sol 為 73.0%。

Terminal-Bench 2.1 的成績從 82.7 升到 90.6;面向工作自動化的 AutomationBench,則從 37.7 升到 54.8,也高於同表中的 V4-Pro、Opus-5 和 GPT-5.6 Sol。

最難的任務仍然拉得開距離。Terminal-Bench 4.0 上,新 Flash 從上一代的 7.0 提高到 31.2,但 Opus-5 為 51.8。在高難科學問答 GPQA Diamond 上,V4.1-Flash 的 90.9 也低於 V4-Pro 的 92.4。

原生視覺帶來了新的可用範圍,領先模型的優勢也還在。帶工具的專業圖表測試 Chartography 中,V4.1-Flash 得到 78.9,高於 Kimi K3 的 68.1,低於 Opus-5 的 84.0。

模型的表現,還會受 Agent 框架影響。同一個 V4.1-Flash,在最高推理檔位下,用 mini-SWE 跑 DeepSWE 得到 74.2,換成 Claude Code 為 69.8,Codex 為 65.6。系統提示、工具定義和上下文管理,都會影響模型能否把能力用出來。

另一方面,更長的思考也會增加賬單。

DeepSeek 在強化學習中加入了隨推理檔位變化的長度懲罰,讓同一模型學會用不同長度的推理處理任務。API 提供 low、high、max 三檔,分別對應內部 50、75、100 的 effort 值。

圖|報告中的總體趨勢是,增加推理投入能改善成績,但圖表也出現了更高檔位得分下降的情況。

在 V4 Flash 報告的結尾,DeepSeek 列了 7 條未來方向,包括架構精簡、訓練穩定性、稀疏嵌入、低延遲、長程 Agent、多模態,和數據合成,5 個月後 V4.1 似乎正逐條解決這些問題。

模型可以更大,思考可以更長,工具也可以調用更多次。只要最終把任務做完所需要的顯存、延遲和總成本繼續下降,它就依然是一款更便宜的模型。

從 7 月底發布 V4 Flash,到 8 月推出 V4 Pro,很快又更新了視覺推理預覽模型 Vision Exp,再到這兩天更新 V4.1 Flash,DeepSeek 的整體發布節奏對比過去一年,似乎是前所未有的快。

而過去那些卷 Benchmark 的分數,也會在一次次接近 100 分之後,開始卷速度,卷每秒處理的 Token 誰更多。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10