GPT-6重回第一,OpenAI也打不过Anthropic

虎嗅APP
Sep 08

OpenAI重新有底气谈“第一”了。

出品|虎嗅科技组  

作者|黄天媛  

编辑|苗正卿  

头图|视觉中国

GPT-6 Astra发布后,OpenAI重新有底气谈“第一”了。

9月3日,OpenAI发布GPT-6 Astra,并将其称为“世界上最智能的模型”。在软件工程、计算机操作和专业工作等多项测试中,Astra均大幅超过上一代GPT-5.6 Sol,并在部分指标上领先Claude。其中FrontierMath Tier 4得分97.6%、ARC-AGI-3最高99.9%、ExploitBench达到100%。在更谨慎的独立评测中,截至9月7日,Artificial Analysis最新综合榜单中,Astra与Claude Fable 5.1以53分并列第一。

金融时报将这次发布直接放在OpenAI与Anthropic的竞争中观察:过去一段时间,Anthropic夺走了前沿模型的技术领先叙事,OpenAI试图借Astra重新夺回来。

OpenAI和Anthropic的竞争,从开始就带着一丝同门相争的意味。2020年底,时任OpenAI研究副总裁Dario Amodei带着多位OpenAI成员离开,随后创办Anthropic。此后很长时间里,Anthropic更多扮演追赶者的角色。

但过去一年,局势发生了反转。模型能力、Claude Code和云渠道三线并进,Anthropic很快跑通了从技术到企业收入的商业化路径。

到今年5月,Anthropic最新融资估值达到9650亿美元,超过同期OpenAI的8520亿美元,成为全球估值最高的独立大模型公司。

甚至在中国科技和投资圈,“谁是中国的Anthropic”也成了新的估值叙事。

而现在,OpenAI带着GPT-6 Astra杀了回来。但问题是,重新追回能力领先地位的OpenAI,还能过去一样顺利赢下市场吗?

答案没有那么简单。

OpenAI曾经失去的,不只是Benchmark

竞争的前半程,OpenAI一直掌握着主动权。从GPT-4开始,OpenAI一直保留着模型能力和用户优势。

到2024年,这种关系开始松动。Claude 3 Opus首次在多项Benchmark上挑战GPT-4,升级后的Claude 3.5 Sonnet又把Coding能力推到行业前列,在SWE-bench Verified上超过包括OpenAI o1-preview在内的公开模型。(虎嗅注:benchmark,即用一套标准测试题或任务,对不同大模型的能力进行横向比较。)

但2025年Claude Code的出现让二者之间的竞争格局发生了巨变。

Coding成为大模型目前商业化最成熟的场景之一。硅谷风投机构Menlo Ventures估算,2025年企业在生成式AI上的支出达到370亿美元,两年增长接近22倍,其中Coding支出达到40亿美元,成为最大的部门级AI场景。

在Menlo估算的企业LLM API支出中,Anthropic的份额从2023年的12%升至40%,OpenAI则从50%降至27%;Coding模型市场中,Anthropic达到54%,OpenAI只有21%。Menlo将Anthropic的增长很大程度上归因于Claude Code。

真实企业采购数据也呈现类似趋势。企业支出管理平台Ramp今年7月数据显示,43.5%的美国企业客户为Anthropic产品付费,OpenAI为39.7%。

收入和估值的变化更加直观。

截至7月底,Anthropic年化收入运行率已经超过650亿美元;OpenAI同期超过400亿美元。虽然二者的统计口径并不完全一致,不过美国科技商业媒体 Axios 援引知情人士估算,即使将Anthropic调整为类似的净额口径,两者仍存在约190亿至210亿美元的差距。

5月底,Anthropic融资后的估值达到9650亿美元,也超过OpenAI今年3月的8520亿美元。

过去几年,是Anthropic追着OpenAI的模型跑。但现在,OpenAI开始追着做Anthropic的企业生意。

OpenAI开始攻打Anthropic的腹地

OpenAI将Astra定位为,“用于最困难端到端工作的模型”,重点强调Coding、Computer Use、专业工作和复杂多步骤任务。不只回答问题,还要更新CRM、处理表格、操作软件,从一个初始需求一直做到最终交付。

它们恰好指向Anthropic过去一年建立商业优势的路径——软件开发、Agent和企业知识工作。

更重要的是,Astra的发布并不是一个孤立动作。今年以来,OpenAI明显开始加速企业业务的布局。

2月推出的Frontier开始把Agent接入企业数据、权限和业务系统;4月,OpenAI披露企业业务已经贡献超过40%的收入,同时把模型和Codex进一步带进AWS;6月又建立Partner Network,引入Accenture、BCG、McKinsey、PwC等咨询和服务公司参与销售、集成和交付。

产品边界也在不断拓展。Codex起初是一款Coding Agent,但到6月,已经有超过500万人每周使用Codex,到 8 月中旬,Codex 活跃用户已突破 1500 万。其中约20%已经是分析师、营销、运营、研究员、投资人等非开发者。7月上线的ChatGPT Work进一步把Codex的Agent能力装进普通白领的工作流,可以跨应用处理资料并生成文档、表格、演示和网站。路透社将它直接视为Claude Cowork的竞争者。

到8月,OpenAI已经开始用另一套语言描述企业AI。瓶颈“不再只是模型能力”,企业需要做的是把Agent放进真实工作流,并从“让AI辅助人工作”转向“让AI独立执行完整工作”。

这与Anthropic过去一年跑通的路径越来越相似。Claude Code先从Coding切入高价值工作流,再借AWS、Google Cloud、Microsoft和合作伙伴网络进入企业。OpenAI现在也在补齐产品、云渠道、系统集成和Agent平台。

两家公司正在收敛到同一个答案:前沿模型的商业价值,也许最终要靠进入企业工作流来兑现。

对于OpenAI,Astra补上了其中一块重要的拼图——一个更擅长Coding、Computer Use和复杂多步骤任务的底层模型。

模型第一,不等于商业第一

但对于现在来说,模型能力已经不再是竞争最重要的问题。企业采购AI,也不像消费者永远追逐最新款产品。除了性能,价格、稳定性、安全合规、云渠道以及迁移成本,都会影响最终选择。

Ramp今年8月专门研究了Anthropic性能更强、价格也更贵的模型Fable 5,其7月只占Ramp样本中Anthropic企业Token使用量的6%;同期GPT-5.6 Sol占OpenAI企业Token的25%。

Ramp据此提出,企业客户为“额外智能”支付的意愿可能正在接近上限,当头部模型达到某个能力门槛后,企业更关心的是性价比的问题。考虑到出口管制等问题,价格也许不能完全作为归因,但至少能够说明,模型性能领先已经不能转换成企业的使用量了。

Anthropic显然也在解决这个问题。

9月1日推出Fable 5.1时,它宣传的重点不再只有模型更强。新模型保持原有输入输出价格,但将Prompt Cache读取价格降至此前的四分之一。与此同时,又推出面向企业的Enterprise Frontier Safeguards,让部分敏感数据可以保留在客户控制的云环境中。

在OpenAI和Anthropic都越来越接近资本市场的节点,投资者最终看的也不会是谁多拿几个Benchmark第一,而是谁能把昂贵的模型能力,更稳定、更高效地转化成持续收入。GPT-6帮OpenAI重新拿回了技术竞争的筹码,但商业上的胜负,还远没有因此逆转。

再往后看,战场可能还会继续变化。随着企业内部的Agent越来越多,问题可能不再只是“谁有一个更强的Agent”,而是谁能把散落在不同软件、数据和业务流程里的Agent连接起来,让它们彼此协作。

这种竞争已经露出苗头:OpenAI把Frontier定位成统一管理企业Agent的平台,Anthropic则通过MCP尝试定义AI连接数据和工具的通用协议。

到那时,真正稀缺的或许不是又一个更聪明的模型,而是连接工具、调度Agent和承接用户需求的入口。谁能把越来越多的Agent组织起来,让它们稳定完成复杂工作,谁就更有可能占据下一阶段竞争的制高点。

本内容来源于网络,观点仅代表作者本人,不代表虎嗅立场。如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。

End

想涨知识 关注虎嗅视频号!

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10