突發|DeepSeek 多模態模型上新,鯨魚終於開天眼了

愛範兒
08/21

DeepSeek 終於「開眼」了。

就在啱啱,DeepSeek 推出了一款面向 Agent 時代的多模態模型:deepseek-v4-flash-vision-exp。

目前,該模型已經上線 DeepSeek API 平台上,用戶可以通過設定 model=’deepseek-v4-flash-vision-exp’ 訪問該模型。

官方介紹,這是一個實驗性質的模型。該模型在保持 DeepSeek-V4-Flash 文本能力的基礎上,新增視覺理解能力,可以處理圖片輸入,並進一步提升多模態 Agent 任務表現。

與此同時,DeepSeek Harness 0.1.1 版本也加入了對該模型的原生支持,開發者可以直接調用 deepseek-v4-flash-vision-exp,將圖像理解能力接入現有 Agent 工作流。

這意味着 DeepSeek 的多模態能力開始從單純的「看圖問答」走向更復雜的任務執行場景。

從文本模型到多模態 Agent

過去一段時間,AI Agent 的競爭重點逐漸從模型生成能力轉向任務執行能力。

一個能夠完成真實工作的 Agent,需要理解用戶輸入的信息,也需要讀取文件、識別圖片、調用工具,並根據環境變化調整行動路徑。

在這一過程中,視覺能力成為重要組成部分。

DeepSeek 表示,deepseek-v4-flash-vision-exp 在文本能力方面與 V4-Flash 保持一致,包括 Agent 能力、推理能力以及世界知識。

同時,該模型在多模態 Agent 基準測試中,相比 V4-Flash 有明顯提升,模型表現接近 Opus-4.8 等高端模型。

目前,deepseek-v4-flash-vision-exp 支持混合文本和圖片輸入,圖片可以通過 Base64、外部 URL 或 Files API 方式提供。

開發者可以通過 Chat Completions、Messages 以及 Responses API 調用該模型,使圖片理解能力接入不同類型的應用。

例如,在辦公場景中,Agent 可以讀取截圖、分析文檔頁面、理解表格內容;在開發場景中,它可以識別界面問題、分析錯誤信息;在內容生產場景中,它可以根據圖片素材輔助生成內容。

比如我們可以用 deepseek-v4-flash-vision-exp 生成商業定製西藏自駕遊 PPT。

再比如,我們還可以用它對 DeepSeek Harness 官網進行二次創作。

簡言之,多模態能力的加入,讓 Agent 能夠處理的信息範圍進一步擴大。

定價延續 V4-Flash,圖片按 Token 計費

從 API 價格來看,deepseek-v4-flash-vision-exp 延續了 DeepSeek-V4-Flash 的價格體系。

模型輸入和輸出均按照 token 數量計算費用,其中圖片會根據尺寸轉換為 token,與文本 token 一同計費。

官方表示,每張圖片最高會換算為 384 tokens,並按照 V4-Flash 的價格標準計費。

https://api-docs.deepseek.com/zh-cn/quick_start/pricing/

目前,deepseek-v4-flash-vision-exp 的百萬 tokens 輸入價格如下:

緩存命中情況下,空閒時段價格為 0.05 元,高峯時段為 0.10 元。

緩存未命中情況下,空閒時段價格為 1.5 元,高峯時段為 3 元。

輸出價格方面,空閒時段為每百萬 tokens 4.5 元,高峯時段為 9 元。

其中,高峯時段為北京時間每天 9:00 至 12:00,以及 14:00 至 18:00,其餘時間按照空閒時段價格計算。

相比一些主打多模態能力的大模型,DeepSeek 繼續保持相對較低成本的 API 策略,希望降低開發者調用視覺模型的門檻。

Files API 解決圖片複用問題

伴隨視覺模型上線,DeepSeek 同步推出 Files API。

此前,開發者調用視覺模型時,通常需要在每次請求中重新上傳圖片。當圖片需要在多個請求、多輪對話或者 Agent 任務中重複使用時,不僅增加網絡傳輸成本,也會受到請求大小限制影響。

Files API 提供了一種新的方式。

開發者可以先上傳圖片文件,隨後通過 file_id 在不同請求中引用同一文件,無需重複上傳。

https://api-docs.deepseek.com/zh-cn/guides/files\_api

目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,單個文件最大支持 64 MiB,單用戶最大存儲空間為 25 GiB,最多可以保存 10000 個文件。

對於複雜 Agent 工作流來說,這類文件管理能力的重要性正在提升。

例如,一個需要長期分析產品資料的 Agent,可以先上傳大量圖片、文檔素材,之後根據任務需要反覆調用,而無需每次重新傳輸數據。

值得一提的是,DeepSeek 此次上線 deepseek-v4-flash-vision-exp,並沒有單獨強調圖像生成或視覺娛樂能力,而是將重點放在多模態 Agent 場景。

從行業趨勢來看,AI Agent 正在從處理文字指令,走向理解現實世界中的各種信息。

文字是人類交流的重要方式,但大量真實工作依賴圖片、文件、界面和環境信息。一個只能處理文本的 Agent,很難真正進入辦公、設計、開發等複雜場景。

因此,多模態能力正在成為 Agent 進一步發展的基礎設施。DeepSeek 通過 V4-Flash-Vision-Exp、Files API 以及 Harness 生態支持,正在嘗試補齊這一環節。

只能說,那個熟悉的 DeepSeek 終於又回來了。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10