DeepSeek又更新了,这次梁文锋没放大招

虎嗅APP
Jul 31

DeepSeek又更新了,为什么先来的是Flash?

出品|虎嗅科技组

作者|宋思杭

编辑|苗正卿

头图|视觉中国

这是进击的独角兽第31篇,该系列关注月之暗面、智谱、MiniMax、阶跃星辰、零一万物、百川智能、面壁智能和DeepSeek共8家大模型独角兽公司。

梁文锋的热度一直在AI圈的Top级,尤其是今年。

从V4预览版发布,到后来的融资与IPO传闻,再到一份流传甚广的四小时谈话实录,DeepSeek的每一次动作,都能迅速成为行业话题。

7月31日下午,DeepSeek又更新了。

这次,DeepSeek只是在API文档的更新日志里宣布,V4-Flash正式版API上线公测。

从“正式版”和“公测”两个词同时出现来看,这并不是V4的最终形态。DeepSeek也特意强调,本次更新只涉及V4-Flash的API,V4-Pro及App、Web端模型均未发生变化,V4-Pro正式版还要再等等。

但这次更新依然值得关注。

从最新版本来看,V4-Flash-0731没有改变模型架构和参数规模,只重新进行了一次后训练。更新后,DeepSeek把几乎所有篇幅都用来强调它在Agent,尤其是Code Agent上的进步。

这意味着,V4-Flash并不是一次简单的模型更新。

DeepSeek正在尝试回答一个新的问题:到了Agent阶段,一家公司最需要的,究竟是一个能力最强的模型,还是一个足够强、足够快,也足够便宜的模型?

这一次,DeepSeek没有继续堆参数

V4-Flash并不是7月31日才第一次出现。

4月24日,DeepSeek发布V4预览版时,已经同时推出V4-Pro和V4-Flash。两者都是MoE模型,但体量差距明显:V4-Pro拥有1.6万亿总参数,每次推理激活49B参数;V4-Flash拥有284B总参数,每次只激活13B参数。两款模型均支持100万Token上下文。

在DeepSeek的定位里,Pro负责能力上限,Flash负责效率。

参数规模更大的V4-Pro,在世界知识以及高难度Agent任务上表现更好;V4-Flash则可以通过增加思考预算,在部分推理任务上接近Pro。换句话说,Flash牺牲了一部分知识容量,却用更小的激活参数换来了速度和成本。

7月31日的更新没有改变这套架构。

DeepSeek明确表示,V4-Flash-0731与预览版的模型结构、尺寸完全一致,仅重新进行了后训练。

但就是这次后训练,让V4-Flash的Agent能力出现了明显变化。

按照DeepSeek公布的结果,V4-Flash-0731在Terminal Bench 2.1上达到82.7,在NL2Repo上达到54.2,在DeepSWE上达到54.4,在Toolathlon Verified上达到70.3。DeepSeek称,这些结果已经大幅超过V4-Pro预览版。

这件事的意义在于,DeepSeek没有通过增加参数和重新预训练,来提高模型的Agent能力。

用通俗的话来讲就是,DeepSeek虽然继续在追求AGI,但是并没有通过一味地增加参数来实现这件事情,而是让模型学会更好地拆解任务、调用工具、执行代码,并在更长的任务轨迹中减少错误。

过去,大模型公司的主要竞争发生在预训练阶段。谁有更多算力、更多数据,谁就有机会训练出参数更大、知识更多的模型。但进入Agent阶段后,模型能力不再完全由预训练决定。

一个模型会不会使用终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正,以及是否知道什么时候应该调用什么工具,这些能力越来越依赖后训练、强化学习和模型外部的执行框架。

V4-Flash的变化,恰好说明了这一点。

这也是为什么,DeepSeek这次除了更新模型,还原生支持了Responses API,并专门适配Codex。同时,DeepSeek在测试Code Agent任务时,使用了尚未正式发布的DeepSeek Harness minimal mode。

换句话说,这些Agent成绩不完全属于模型本身,而是属于“模型、推理预算与Harness”共同组成的系统。

这当然也意味着,目前公布的数据仍需谨慎看待。

一方面,部分结果来自DeepSeek内部测试集;另一方面,DeepSeek Harness尚未公开,外界还无法在完全相同的环境下复现这些成绩。正式版V4-Flash究竟比预览版进步了多少,还需要等待独立评测以及真实开发场景验证。

但至少从这次更新可以看出,DeepSeek正在从只提供模型和API,向Agent所需要的执行环境多走一步。

但DeepSeek目前还没有亲自做一个完整的Agent产品,却开始提供让模型进入Agent工作流所必需的接口、适配和Harness。

这是一种非常克制的产品化。

为什么是Flash?

既然V4-Pro的能力上限更高,DeepSeek为什么不先更新Pro?

最直接的原因是,Agent并不是一次模型调用。

在聊天机器人阶段,用户提出一个问题,模型生成一次答案,一次交互就结束了。但在Agent任务里,模型需要先理解目标,再拆解任务、检索信息、调用工具、读取结果、修正错误,最后完成交付。

一个复杂任务,可能包含几十次甚至数百次模型调用。

这时,模型单次推理增加的成本和延迟,会在整个任务轨迹中被不断放大。一个能力更强、但速度更慢、成本更高的模型,未必能带来更好的实际结果。

Agent真正需要的,往往不是每一步都调用能力最强的模型,而是在绝大多数步骤中,使用一个能力足够、价格更低、响应更快的模型。

这正是V4-Flash的价值。

根据DeepSeek技术报告,在100万Token上下文下,V4-Flash单Token推理所需的计算量,约为V3.2的10%,KV Cache则约为V3.2的7%。它的总参数只有V4-Pro的约六分之一,每次激活参数也只有Pro的约四分之一。

这种差距最终也体现在API定价上。

目前,V4-Flash每百万Token未命中缓存的输入价格为1元,输出价格为2元;V4-Pro分别为3元和6元。V4-Flash的并发限制为2500,Pro则为500。Responses API目前也只有V4-Flash支持,V4-Pro预计到8月初才会接入。

在V4的产品体系里,Pro负责证明DeepSeek的模型能力能够达到什么位置,Flash则负责承担真正高频、长链条的Agent任务。前者是能力模型,后者更像生产模型。

梁文锋曾在内部公开说道,“模型应该放在相同成本下比较;在现阶段,Coding Agent的优先级高于其他垂直Agent。”

从这个角度来看,V4-Flash此次更新的方向,确实与这两个判断形成了呼应。

DeepSeek没有选择通过扩大参数,让Flash在所有能力上追上Pro;它选择在模型架构不变的情况下,通过后训练和Agent框架,提高Flash完成真实任务的能力。

这背后是一种更现实的计算。

如果Agent最终要进入企业和开发者的日常工作流,那么决定模型能否被大规模使用的,不只是Benchmark,而是完成一个任务需要多少时间、消耗多少Token,以及最终成功率是多少。

不过,这也是V4-Flash目前最需要证明的地方。

DeepSeek公布的Agent成绩大多使用Max reasoning effort完成。更高的思考强度通常意味着更长的推理过程和更多Token消耗。一个模型每百万Token的价格很低,不等于完成一项任务的总成本一定更低。Agent该按Token还是任务收费?

如果V4-Flash需要消耗更多Token才能达到接近Pro的效果,那么它在单价上的优势,可能会被更长的任务轨迹部分抵消。

因此,真正有价值的对比,不是V4-Flash在某一项Benchmark上超过了谁,而是在完成同一个Agent任务时,它与V4-Pro、Kimi、GLM以及闭源模型分别需要多少Token、多少时间和多少次重试。

DeepSeek暂时还没有给出这个答案。

本内容未经允许不得转载。授权事宜请联系 hezuo@huxiu.com。

End

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10