DeepSeek又更新了,這次梁文鋒沒放大招

虎嗅APP
07/31

DeepSeek又更新了,為什麼先來的是Flash?

出品|虎嗅科技組

作者|宋思杭

編輯|苗正卿

頭圖|視覺中國

這是進擊的獨角獸第31篇,該系列關注月之暗面、智譜、MiniMax、階躍星辰、零一萬物、百川智能、面壁智能和DeepSeek共8家大模型獨角獸公司。

梁文鋒的熱度一直在AI圈的Top級,尤其是今年。

從V4預覽版發布,到後來的孖展與IPO傳聞,再到一份流傳甚廣的四小時談話實錄,DeepSeek的每一次動作,都能迅速成為行業話題。

7月31日下午,DeepSeek又更新了。

這次,DeepSeek只是在API文檔的更新日誌裏宣佈,V4-Flash正式版API上線公測。

從「正式版」和「公測」兩個詞同時出現來看,這並不是V4的最終形態。DeepSeek也特意強調,本次更新只涉及V4-Flash的API,V4-Pro及App、Web端模型均未發生變化,V4-Pro正式版還要再等等。

但這次更新依然值得關注。

從最新版本來看,V4-Flash-0731沒有改變模型架構和參數規模,只重新進行了一次後訓練。更新後,DeepSeek把幾乎所有篇幅都用來強調它在Agent,尤其是Code Agent上的進步。

這意味着,V4-Flash並不是一次簡單的模型更新。

DeepSeek正在嘗試回答一個新的問題:到了Agent階段,一家公司最需要的,究竟是一個能力最強的模型,還是一個足夠強、足夠快,也足夠便宜的模型?

這一次,DeepSeek沒有繼續堆參數

V4-Flash並不是7月31日才第一次出現。

4月24日,DeepSeek發布V4預覽版時,已經同時推出V4-Pro和V4-Flash。兩者都是MoE模型,但體量差距明顯:V4-Pro擁有1.6萬億總參數,每次推理激活49B參數;V4-Flash擁有284B總參數,每次只激活13B參數。兩款模型均支持100萬Token上下文。

在DeepSeek的定位裏,Pro負責能力上限,Flash負責效率。

參數規模更大的V4-Pro,在世界知識以及高難度Agent任務上表現更好;V4-Flash則可以通過增加思考預算,在部分推理任務上接近Pro。換句話說,Flash犧牲了一部分知識容量,卻用更小的激活參數換來了速度和成本。

7月31日的更新沒有改變這套架構。

DeepSeek明確表示,V4-Flash-0731與預覽版的模型結構、尺寸完全一致,僅重新進行了後訓練。

但就是這次後訓練,讓V4-Flash的Agent能力出現了明顯變化。

按照DeepSeek公布的結果,V4-Flash-0731在Terminal Bench 2.1上達到82.7,在NL2Repo上達到54.2,在DeepSWE上達到54.4,在Toolathlon Verified上達到70.3。DeepSeek稱,這些結果已經大幅超過V4-Pro預覽版。

這件事的意義在於,DeepSeek沒有通過增加參數和重新預訓練,來提高模型的Agent能力。

用通俗的話來講就是,DeepSeek雖然繼續在追求AGI,但是並沒有通過一味地增加參數來實現這件事情,而是讓模型學會更好地拆解任務、調用工具、執行代碼,並在更長的任務軌跡中減少錯誤。

過去,大模型公司的主要競爭發生在預訓練階段。誰有更多算力、更多數據,誰就有機會訓練出參數更大、知識更多的模型。但進入Agent階段後,模型能力不再完全由預訓練決定。

一個模型會不會使用終端,能不能在數百次交互中維持任務狀態,遇到錯誤後能否修正,以及是否知道什麼時候應該調用什麼工具,這些能力越來越依賴後訓練、強化學習和模型外部的執行框架。

V4-Flash的變化,恰好說明了這一點。

這也是為什麼,DeepSeek這次除了更新模型,還原生支持了Responses API,並專門適配Codex。同時,DeepSeek在測試Code Agent任務時,使用了尚未正式發布的DeepSeek Harness minimal mode。

換句話說,這些Agent成績不完全屬於模型本身,而是屬於「模型、推理預算與Harness」共同組成的系統。

這當然也意味着,目前公布的數據仍需謹慎看待。

一方面,部分結果來自DeepSeek內部測試集;另一方面,DeepSeek Harness尚未公開,外界還無法在完全相同的環境下復現這些成績。正式版V4-Flash究竟比預覽版進步了多少,還需要等待獨立評測以及真實開發場景驗證。

但至少從這次更新可以看出,DeepSeek正在從只提供模型和API,向Agent所需要的執行環境多走一步。

但DeepSeek目前還沒有親自做一個完整的Agent產品,卻開始提供讓模型進入Agent工作流所必需的接口、適配和Harness。

這是一種非常剋制的產品化。

為什麼是Flash?

既然V4-Pro的能力上限更高,DeepSeek為什麼不先更新Pro?

最直接的原因是,Agent並不是一次模型調用。

在聊天機器人階段,用戶提出一個問題,模型生成一次答案,一次交互就結束了。但在Agent任務裏,模型需要先理解目標,再拆解任務、檢索信息、調用工具、讀取結果、修正錯誤,最後完成交付。

一個複雜任務,可能包含幾十次甚至數百次模型調用。

這時,模型單次推理增加的成本和延遲,會在整個任務軌跡中被不斷放大。一個能力更強、但速度更慢、成本更高的模型,未必能帶來更好的實際結果。

Agent真正需要的,往往不是每一步都調用能力最強的模型,而是在絕大多數步驟中,使用一個能力足夠、價格更低、響應更快的模型。

這正是V4-Flash的價值。

根據DeepSeek技術報告,在100萬Token上下文下,V4-Flash單Token推理所需的計算量,約為V3.2的10%,KV Cache則約為V3.2的7%。它的總參數只有V4-Pro的約六分之一,每次激活參數也只有Pro的約四分之一。

這種差距最終也體現在API定價上。

目前,V4-Flash每百萬Token未命中緩存的輸入價格為1元,輸出價格為2元;V4-Pro分別為3元和6元。V4-Flash的併發限制為2500,Pro則為500。Responses API目前也只有V4-Flash支持,V4-Pro預計到8月初纔會接入。

在V4的產品體系裏,Pro負責證明DeepSeek的模型能力能夠達到什麼位置,Flash則負責承擔真正高頻、長鏈條的Agent任務。前者是能力模型,後者更像生產模型。

梁文鋒曾在內部公開說道,「模型應該放在相同成本下比較;在現階段,Coding Agent的優先級高於其他垂直Agent。」

從這個角度來看,V4-Flash此次更新的方向,確實與這兩個判斷形成了呼應。

DeepSeek沒有選擇通過擴大參數,讓Flash在所有能力上追上Pro;它選擇在模型架構不變的情況下,通過後訓練和Agent框架,提高Flash完成真實任務的能力。

這背後是一種更現實的計算。

如果Agent最終要進入企業和開發者的日常工作流,那麼決定模型能否被大規模使用的,不只是Benchmark,而是完成一個任務需要多少時間、消耗多少Token,以及最終成功率是多少。

不過,這也是V4-Flash目前最需要證明的地方。

DeepSeek公布的Agent成績大多使用Max reasoning effort完成。更高的思考強度通常意味着更長的推理過程和更多Token消耗。一個模型每百萬Token的價格很低,不等於完成一項任務的總成本一定更低。Agent該按Token還是任務收費?

如果V4-Flash需要消耗更多Token才能達到接近Pro的效果,那麼它在單價上的優勢,可能會被更長的任務軌跡部分抵消。

因此,真正有價值的對比,不是V4-Flash在某一項Benchmark上超過了誰,而是在完成同一個Agent任務時,它與V4-Pro、Kimi、GLM以及閉源模型分別需要多少Token、多少時間和多少次重試。

DeepSeek暫時還沒有給出這個答案。

本內容未經允許不得轉載。授權事宜請聯繫 hezuo@huxiu.com。

End

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10