DeepSeek發布實驗性視覺理解模型,多模態Agent能力逼近Opus-4.8

華爾街見聞
08/21

DeepSeek加速佈局多模態。8月21日,公司上線實驗性視覺理解模型DeepSeek-V4-Flash-Vision-Exp,在保留原有文本能力的基礎上增加圖像理解能力,並向開發者開放API。

從公司公布的測試結果看,新模型在Agent、推理、世界知識等純文本任務上的表現與DeepSeek-V4-Flash基本相當;在視覺理解類Agent基準測試中,性能較前代明顯提升,已逼近Opus-4.8。

與此同時,DeepSeek上線免費的Files API,並發布DeepSeek Harness 0.1.1,為新模型提供接入支持。此次更新進一步擴展了DeepSeek API的應用範圍,開發者可以在Agent框架中處理圖文混合任務。

文本能力基本持平,視覺理解明顯增強

DeepSeek-V4-Flash-Vision-Exp定位為實驗性模型,重點是在增加視覺能力的同時保持文本性能。

DeepSeek表示,在Agent、推理和世界知識等純文本任務上,新模型與V4-Flash正式版表現持平;在需要視覺理解的Agent基準測試中,性能則實現明顯提升。

需要注意的是,DeepSeek在測試中使用DeepSeek Harness極簡模式框架,並採用max檔位、temperature=1.0、top-p=0.95等參數。由於V4-Flash在ApexBench和Agents' Last Exam的測試中會忽略多模態元素,因此視覺任務上的兩代模型對比並非完全同口徑。

多模態能力面向Agent場景,API價格與V4-Flash一致

DeepSeek展示了新模型在多類Agent任務中的應用,包括根據需求生成面向高淨值客戶的西藏自駕遊PPT、對網站進行多輪交互式創作,以及生成帶有動態視覺效果的前端Mini Demo。

這些案例主要體現了模型對圖像和文本信息的綜合理解能力,以及在多輪交互任務中的應用潛力。

在API計費方面,V4-Flash-Vision-Exp沿用V4-Flash的定價。圖片輸入將轉換為token計費,單張圖片最多佔用384個token。API支持Chat Completions、Messages和Responses三種調用格式,圖片可通過base64、外部URL或Files API傳入。

同期上線的Files API目前免費。開發者可提前上傳圖片,並在後續請求中通過file_id調用,以減少重複上傳。DeepSeek同時發布DeepSeek Harness 0.1.1,為新模型提供開箱即用的Agent接入支持。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10