DeepSeek V4定檔7月中旬,峯谷API定價同步落地

華爾街見聞
06/29

DeepSeek在產品迭代與技術開源兩條線上同步提速。正式版V4宣佈7月中旬上線,屆時API將啓動峯谷定價機制,高峯時段價格翻倍;聯合北京大學發布的推理加速框架DSpark已全量部署於線上服務,使單用戶生成速度最高提升85%。兩項進展疊加釋出,顯示這家公司正將商業化壓力管理與技術能力兌現同步推進。

6月29日,DeepSeek團隊宣佈DeepSeek V4正式版計劃於7月中旬上線,並同步引入峯谷定價策略。根據公布的價格表,高峯時段API價格為平時價格的兩倍,平時價格與現行V4 API定價持平。高峯時段界定為每日上午9時至12時及下午2時至6時。官方表示,此舉旨在更合理地配置資源、提升服務穩定性。

在技術層面,DeepSeek於6月27日聯合北京大學發布推理加速框架DSpark,並同步開源全棧推測性解碼工具鏈DeepSpec。論文由公司創始人梁文鋒本人署名,已上傳至公開代碼庫。實測顯示,DSpark部署後V4-Flash單用戶生成速度提升60%至85%,V4-Pro提升57%至78%,效果已在線上服務全量驗證。這也是DeepSeek完成500億元孖展後首次對外發布的開源技術成果。

對API用戶而言,峯谷定價將直接推高工作時段使用成本;對開發者而言,推理速度的顯著提升或可在高併發場景下部分抵消成本壓力,並進一步降低推理優化的落地門檻。

V4正式版上線與峯谷定價機制

DeepSeek V4模型預覽版於4月24日上線並同步開源,具備百萬字超長上下文,在Agent能力、世界知識及推理性能上均實現國內與開源領域領先。正式版預計於7月中旬推出,將帶來進一步的功能優化與性能提升。

V4系列分為兩個規格:旗艦版V4-Pro總參數量達1.6萬億,激活參數49B,預訓練數據量33T,支持1M上下文,網頁端以專家模式運行;輕量版V4-Flash總參數284B,激活參數13B,預訓練數據32T,同樣支持1M上下文,網頁端以快速模式運行。兩款模型均已開源並提供API服務。

峯谷定價是此次正式版更新的另一核心變量。該機制將每日API使用成本切分為兩個層級,平時價格維持現行水平不變,高峯時段收費翻倍。對於在工作時段密集調用API的企業用戶而言,成本影響將較為直接;而有條件將批量任務遷移至低峯時段運行的用戶,則可在定價調整後維持原有成本水平。

DSpark:推測性解碼的工程化落地

DSpark並非全新架構的模型,而是在現有V4模型基礎上引入了推測性解碼模塊,核心在於工程層面的優化落地。推測性解碼的基本邏輯是:先由輕量級小模型快速生成候選token(草稿),再由大模型並行驗證,接受符合目標分佈的連續前綴,從而在不損失生成質量的前提下提升速度。

DSpark針對這一技術路線在實際落地中的兩個核心瓶頸提出了針對性方案。

其一是半自迴歸生成架構,主要解決並行草稿的"後綴衰減"問題——並行獨立生成各位置token時,位置間缺乏依賴約束,越往後錯誤累積越嚴重,驗證接受率隨之斷崖式下跌。DSpark採用"並行主幹+輕量串行頭"的兩階段設計:並行主幹保留速度優勢,串行模塊則補充相鄰token間的依賴關係,修正語義衝突,直接提升每輪驗證的有效接受長度。測試顯示,2層深度的DSpark有效接受長度甚至超過5層深度的純並行方案DFlash。

其二是置信度調度驗證機制,針對全量驗證導致的算力浪費問題。DSpark在草稿模型上增加置信度評分模塊,實時預測每個候選token的條件接受概率,並通過"順序溫度縮放"校準方法將評分誤差從3%-8%壓縮至約1%。在此基礎上,調度器根據實時負載動態調整驗證長度:低併發時拉滿算力,高併發時主動裁剪低價值token,避免資源爭搶與速度驟降。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10