IT之家 8 月 1 日消息,深度求索(DeepSeek)昨日(7 月 31 日)通過 API 文檔發布日誌,宣佈 DeepSeek-V4-Flash 正式版 API 上線公測。@ArtificialAnlys、@arena 等 AI 跑分基準平台今天(8 月 1 日)同步更新了相關基準測試結果。
@ArtificialAnlys (Artificial Analysis)
@ArtificialAnlys (Artificial Analysis) 是一家領先的國際獨立 AI 基準測試與分析機構,專門針對大語言模型(LLM)、視頻生成、AI 音樂等多領域進行無偏見的性能與託管成本評估。
其中,Artificial Analysis Intelligence Index(智能指數)是最核心的綜合性技術基準,用來全面衡量 AI 模型的絕對智能水平並追蹤技術演進。
報告指出 DeepSeek V4 Flash 0731 在人工智能分析智能指數 (AII) 中獲得 50 分,比 DeepSeek V4 Flash(2026 年 4 月發布)高出 10 分,比 DeepSeek V4 Pro 高出 6 分。
DeepSeek V4 Flash 0731 的智能指數比 GPT-5.6 Luna(最高 51 分)低 1 分。即使 OpenAI 今天將 GPT-5.6 Luna 的價格下調了 80%,DeepSeek V4 Flash 0731 在其自有 API 上的單任務成本仍然比 GPT-5.6 Luna(最高 51 分)低約 60%。
造成這一差異的關鍵因素是 DeepSeek 為其自有 API 提供了約 98% 的緩存命中折扣,這一折扣力度遠超業內大多數廠商提供的 90% 緩存命中折扣。

@arena (Arena.ai)
@arena (Arena.ai) 是當前全球 AI 行業最權威的「人類偏好」大模型即時對戰與評測平台。它源自著名的 LMSYS Chatbot Arena 團隊,採用類似國際象棋的 Elo 積分系統,通過純粹的人類開發者雙盲盲測(Blind A/B Testing)來對全球 AI 模型進行高強度的淘汰賽排名。
在其細分排行榜中,Frontend Code Arena(前端代碼競技場,又稱 WebDev Arena)是目前評估大模型網頁開發、前端工程與 Agent 級自動化編碼能力的黃金標準與行業風向標。
報告稱 DeepSeek-V4-Flash-High 以 1586 分的成績重塑了 Frontend Code Arena 跑分排行榜。
每個 MToken 的價格為 0.14 美元(IT之家注:現匯率約合 0.95 元人民幣)/0.28 美元(現匯率約合 1.9 元人民幣),是同類產品中性價比最高的。
在前端代碼領域,它的總排名為第 7,開放類別的排名第 3!在各個類別中,它在消費產品領域排名第 4,在基於參考的設計、數據與分析、遊戲領域排名第 6,在品牌與營銷領域排名第 7。
與 DeepSeek-V4-Flash-High-Preview 相比,這是一個顯著的提升,性能提高了 154 分。而與 DeepSeek-V4-Pro-Preview 相比,提升幅度更大,達到了 121 分。
