DeepSeek V4.1 Flash 發布後,DeepSeek 網頁版和 App 也更新了,之前需要選擇的「快速」、「專家」和「識圖」都合併升級為一個入口。

全新的 DeepSeek V4.1 Flash 同時具備了日常對話、圖片理解與複雜問題解決能力,看起來像是把過去這一個多月,DeepSeek 發布的 V4 Flash 正式版、Vision Exp、V4 Pro 正式版幾個模型,全部融合在一起了。
在社交媒體上,大家對 V4.1 Flash 最多的評價就是「快」。
有網友展示自己在 DeepSeek Harness 內的對話,模型的運行速度是 217 tok/s 左右。而其他的測試結果顯示,V4.1 Flash 的運行速度為 420-507 tok/s ,比 Gemini 3.8 Flash 還要更快。

本來是融合了好幾個模型,主幹參數也接近上一代 Flash 的兩倍,從 284B 到了 552B,但怎麼速度就變快了。
雖然 4.1 看着是一次小更新,但從 DeepSeek 公開的技術報告來看,V4.1 Flash 採用了重新設計的模型架構,並擴大了訓練數據和強化學習規模。
參數的增加,但處理長輸入和保存上下文所需的開銷卻降低了,因為每 Token 的全局 KV cache 只有 890 字節,是自家 V4-Flash 的四分之一;和 2023 年的初代 DeepSeek-V1 相比,縮小了約 437 倍。

總參數變多,但是用來每一次工具調用、每一輪對話,模型上下文的 KV cache 卻減少了,而減少的 KV cache 也沒有因此讓 V4.1 Flash 變弱,在多個 Agent 基準測試上,它打平甚至反超了 Claude Opus-5 和 GPT-5.6 Sol。
我們分析了 V4 Flash 和 V4.1 Flash 的兩篇論文技術報告,看到了 DeepSeek 在 Agent 時代到底要做什麼樣的高效率模型。

圖|論文地址:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
模型變大,成本怎麼降下來
所謂的 KV cache 可以理解為模型處理過內容後留下的中間狀態;後續生成需要參考前文時,複用這些狀態,可以省下重新計算的開銷。
而當我們的上下文越長時,這個用來保存模型狀態的工作台台面就會越大,佔的顯存越多。
DeepSeek 四代模型的演化,可以說就是在不斷地對 KV cache 進行壓縮,從 V1 的每 token 389 KB,到 V3.2 的 48 KB、V4-Flash 的 3.5 KB,再到今天的 890 字節,連 1 KB 都不到。
V4.1-Flash 採用的做法是一組組合拳。在架構上,40 層網絡被修改成「編碼器 + 解碼器」兩半(CED 架構),Causal Encoder-Decoder,簡稱 CED。

它把 40 層網絡分成前後兩部分:前 20 層是因果編碼器,後 20 層是解碼器。後半部分需要的全局 KV 緩存,可以直接由前半部分的最終輸出生成,因此,大部分輸入內容無需再完整經過後 20 層。
即解碼器需要的全局記憶直接由編碼器的輸出投影生成,預處理長文本的計算量近乎減半。這對頻繁調用工具、緩存經常不命中的 Agent 負載尤其省錢。

圖|DeepSeek 各代模型在不同上下文長度下的單 Token 解碼(Decode)FLOPs 對比。
具體來說,假設我們讓 AI 幫忙選一批辦公電腦,看產品資料、查價格、列出配置,最後給採購建議。
第一輪,它讀了幾款電腦的介紹。第二輪,我們補充預算,讓它重新篩選。第三輪,我們又接着說,有兩個崗位需要剪視頻,配置得單獨調整。
就這樣每次我們只補充一句話,模型處理的內容卻可能越來越長。要接着完成任務,它需要記得前面選過哪些型號、為什麼淘汰某一款、預算是多少,以及哪些要求啱啱發生了變化。
V4 是標準的 decoder-only,整個模型「讀」和「寫」用同一套全部工序。給它一段 100 萬 token 的輸入,每個 token 都要完整穿過全部 43 層。
現在 V4.1 Flash 大部分只需經過前半段,後半程的解碼器不用再把原文逐層過一遍,而是直接拿編碼器讀完之後「消化好的筆記」,技術上是把編碼器最後一層的隱狀態投影成解碼器的全局 KV cache,然後基於這份筆記開始生成。

圖|V4 Flash 和 V4.1 Flash 架構區別
這樣一來,模型處理輸入時,每個 token 激活約 80 億參數;生成時,激活約 160 億參數。對於足夠長的輸入,技術報告給出的預處理計算量接近減半。
可以說 V4.1 Flash 的 CED 這套結構就是衝着 Agent 負載設計,它優先節省的,正是 Agent 不斷接收材料時的計算。資料越長,省去大部分輸入在後半網絡中的處理,就越有價值。
其次,注意力機制升級為 CSA2,讓不同層之間可以「借用」彼此算好的索引和緩存,而不是各算各的;主 KV cache 更是用上了 FP4 量化,並且特意選了 OCP 開放標準格式,理由是「支持儘可能多的硬件平台」。

V4.1-Flash 的 Compressed Sparse Attention 2,簡稱 CSA2,是讓多個網絡層共享全局 KV 緩存。有的層負責建立緩存、挑出相關位置;後續層可以沿用這份緩存,重新選擇自己需要的位置;還有一些層連選擇結果也直接複用。
上一代部署方案會把全局和部分局部 KV 狀態長期保存,以便用戶重新生成答案,或繼續多輪對話。但局部狀態往往只在活躍會話的短時間內有用,長期保留會佔用大量存儲。
V4.1-Flash 把編碼器的局部狀態放進只保留幾分鐘的內存池。狀態過期後,如果用戶又繼續任務,就重新計算最近 128 個 token,近似恢復需要的局部狀態。DeepSeek 將這個辦法稱為 SWA Bounded Replay。

它用少量重算,換掉了長期保存這部分狀態的開銷。移走局部狀態,再疊加全局緩存壓縮,同等負載下,持久 KV 緩存佔用降到上一代的約八分之一,且可以保證駐留 72 小時以上。
換句話說,用戶三天內回來繼續對話,服務商都不用重新付錢算一遍。
這種近似恢復的方案也會帶來取捨,恢復結果與完整重新計算並不完全相同,DeepSeek 在報告中稱已測場景中的質量影響很小,並把極端長上下文檢索、會話恢復時的狀態變化列為後續重點測試對象。

此外,V4.1 Flash 對比 V4 Flash 的不同,還在於 552B 主幹之外,模型還外掛了 196B 的「條件記憶」模塊 Engram:它不做計算,只做查表。
通過把常見詞的 2 到 4 個組合預先存成一張巨大的哈希表,用到時直接查出來接進網絡,DeepSeek V4.1 Flash 的成本又能進一步下降。
省下計算和存儲之後,模型還得把題做對
V4.1-Flash 使用了包含圖像和文本的 45 萬億 token 預訓練語料。它從語言模型預訓練開始就接觸多模態數據,圖像經過視覺編碼器處理後,與文字一起進入語言主幹。
這讓 Agent 可以直接利用截圖檢查工作。例如,在生成網頁或辦公文件後,讀取渲染出來的畫面,判斷排版、圖表或頁面是否需要修改。工具返回的文字結果之外,模型多了一種檢查依據。

後訓練部分,DeepSeek 也寫得相當明確:這次沿用了監督微調、強化學習和蒸餾,沒有引入新的後訓練算法。團隊主要投入在訓練數據和環境的生產上。
這似乎也在說,RL 的軍備競賽,主戰場可能不在論文裏的新算法,而在數據工程的水電煤。
他們把一道 Agent 任務拆成三個部分:問題、執行環境、驗證系統。模型要面對足夠難的要求,環境得能運行,驗收也要與題目對應。
通用 Agent 的材料,來自內部員工和外部合作伙伴反饋的工作記錄、工具接口與失敗案例。團隊據此重建工具的輸入輸出格式和行為約束,讓模型可以在模擬環境中反覆練習實際工作裏出過錯的步驟。

圖|DeepSeek 會不斷讀取圖片來檢查結果
以編程任務為例,有的 AI 負責出題、準備工作環境,有的負責試做,還有獨立的 AI 檢查題目和驗收要求是否一致、答案有沒有泄漏、能不能靠鑽漏洞過關。檢查不過,就修好題目再試。
任務用於新一輪強化學習後,解題軌跡又會成為重新審核題目質量的材料。某個測試如果一直誘導模型鑽空子,或者失敗源於環境配置而非能力,這些問題就需要回到任務生產環節處理。

圖|在 DeepSeek Harness 的 Minimal 模式下,隨着強化學習(RL)訓練規模的擴大,模型在各項代碼智能體基準測試中的性能均有所提升。
在 DeepSeek 的歸納中,這次後訓練的收益主要來自任務規模、多樣性和可驗證性的改善。模型做過更多類型的工作,也更頻繁地得到與結果相關的反饋。
工具軟件本身也會影響表現,DeepSeek 用不同工具框架測試同一個模型,發現系統提示、工具配置和歷史信息管理的差異,都可能改變任務結果。
DeepSeek 在報告中表示,後續會繼續擴大模型、數據和強化學習規模,並把模型與工具框架放在一起優化。
V4.1-Flash 目前是這一新架構系列中最小尺寸的模型,未來的 V4.1-Pro 或許會延續這一架構,但從上次 V4 Pro 正式版的經歷來看,DeepSeek 顯然不會再輕易就發布一款新的 Pro 模型。
Agent 測試進步明顯,難題仍有差距
能力提升最集中地出現在 Agent 測試中。
在 DeepSeek 公布的最高推理檔位結果裏,V4.1-Flash 的 DeepSWE v1.1 軟件問題解決率達到 74.2%,上一代 Flash 為 54.4%,V4-Pro 為 62.7%。同一測試表格中的 Opus-5 為 74.0%,GPT-5.6 Sol 為 73.0%。

Terminal-Bench 2.1 的成績從 82.7 升到 90.6;面向工作自動化的 AutomationBench,則從 37.7 升到 54.8,也高於同表中的 V4-Pro、Opus-5 和 GPT-5.6 Sol。
最難的任務仍然拉得開距離。Terminal-Bench 4.0 上,新 Flash 從上一代的 7.0 提高到 31.2,但 Opus-5 為 51.8。在高難科學問答 GPQA Diamond 上,V4.1-Flash 的 90.9 也低於 V4-Pro 的 92.4。
原生視覺帶來了新的可用範圍,領先模型的優勢也還在。帶工具的專業圖表測試 Chartography 中,V4.1-Flash 得到 78.9,高於 Kimi K3 的 68.1,低於 Opus-5 的 84.0。

模型的表現,還會受 Agent 框架影響。同一個 V4.1-Flash,在最高推理檔位下,用 mini-SWE 跑 DeepSWE 得到 74.2,換成 Claude Code 為 69.8,Codex 為 65.6。系統提示、工具定義和上下文管理,都會影響模型能否把能力用出來。
另一方面,更長的思考也會增加賬單。
DeepSeek 在強化學習中加入了隨推理檔位變化的長度懲罰,讓同一模型學會用不同長度的推理處理任務。API 提供 low、high、max 三檔,分別對應內部 50、75、100 的 effort 值。

圖|報告中的總體趨勢是,增加推理投入能改善成績,但圖表也出現了更高檔位得分下降的情況。
在 V4 Flash 報告的結尾,DeepSeek 列了 7 條未來方向,包括架構精簡、訓練穩定性、稀疏嵌入、低延遲、長程 Agent、多模態,和數據合成,5 個月後 V4.1 似乎正逐條解決這些問題。

模型可以更大,思考可以更長,工具也可以調用更多次。只要最終把任務做完所需要的顯存、延遲和總成本繼續下降,它就依然是一款更便宜的模型。
從 7 月底發布 V4 Flash,到 8 月推出 V4 Pro,很快又更新了視覺推理預覽模型 Vision Exp,再到這兩天更新 V4.1 Flash,DeepSeek 的整體發布節奏對比過去一年,似乎是前所未有的快。
而過去那些卷 Benchmark 的分數,也會在一次次接近 100 分之後,開始卷速度,卷每秒處理的 Token 誰更多。