GPT-6踩了脚刹车

虎嗅APP
Sep 04

OpenAI一边宣布AGI已经到来,一边主动踩刹车

出品|虎嗅科技组

作者|宋思杭

编辑|苗正卿

头图|OpenAI官网

OpenAI终于等到了一个可以宣布“AGI时代已经开始”的时刻。

9月3日,OpenAI正式发布GPT-6 Astra。在发布会的媒体简报中,OpenAI总裁Greg Brockman说,如果几年后回看AGI究竟诞生于什么时候,“我认为可能就是现在,也可能就是这个模型”。

这是一个足够激进的判断。按照OpenAI公布的数据,Astra在数学、计算机操作、软件工程、网络安全和专业工作上均达到新的水平:FrontierMath Tier 4得分97.6%,ARC-AGI-3最高得分99.9%,测试模型利用已知漏洞开发攻击代码的ExploitBench得分100%。

榜单之外,更值得注意的是,就在宣布“AGI可能已经到来”的同时,OpenAI也公开承认,模型继续变强,已经不再是一件只有收益、没有代价的事情。

Astra发布前,OpenAI曾暂停两周前沿模型的强化学习训练,以加固研究环境、补充监控和对齐评测。OpenAI当时称,其规模最大的前沿强化学习训练仍处于暂停状态。原因很直接:模型的能力正在逼近现有安全系统所能承受的边界。OpenAI在怕什么?

一边宣布AGI已经到来,一边主动踩下刹车。这才是GPT-6发布背后最重要的信号。

GPT-6完成了一次跃迁

如果只看OpenAI公布的数字,GPT-6 Astra似乎已经把大模型竞争甩进了下一个时代。

但仔细拆解这些成绩,会发现Astra并没有在所有维度建立绝对优势。在OpenAI引用的Artificial Analysis综合智能指数中,Astra得分61.2,低于Claude Fable 5.1的65.7和Claude Opus 5的63.1;在部分代码评测中,Astra与Anthropic旗舰模型也只是互有胜负,并非全面领先。

值得注意的是,ARC Prize公布的结果显示,Astra使用标准测试框架时得分62.7%,测试成本约2.61万美元;使用OpenAI的Provider Adapter框架后,最高得分才达到99.9%,成本约1.88万美元。后者能够在多次调用之间保留模型的隐藏推理状态,并通过压缩机制复用此前的探索结果。

这两个数字意味着,62.7%依然是该测试上的领先成绩。但它说明,99.9%不能被直接理解成模型已经能够以普通成本解决几乎所有抽象推理问题,更不能单独说明AGI已经实现了。

我们跳过榜单,会发现GPT-6 Astra真正有代际意义的是,它让模型可以行动起来。

过去两年,大模型的进步主要表现为“更会回答”:知识更多,数学和代码能力更强,幻觉更少,但用户与模型的关系没有发生本质变化。也就是说,这个链条依然是,人提出问题,模型给出答案,再由人把答案复制到现实世界。

Astra试图跳过最后一步。

按照OpenAI展示的能力,Astra可以直接使用电脑和浏览器,填写在线表格、更新CRM、整理日历、检索资料,也可以制作文档、表格和演示文稿,开发网站并完成前端测试。它还能够在长任务中保存笔记,并重新检索此前对话和工具输出,减少上下文压缩造成的信息丢失。

在衡量模型操作电脑能力的OSWorld 2.0中,Astra得分72.6%,GPT-5.6 Sol为65.7%。相比成绩本身,更值得注意的是时间:OpenAI的模拟结果显示,Astra完成一项任务平均约需40分钟,GPT-5.6 Sol约需75分钟,前者缩短约47%。

在考察工具调用和工作流执行的AutomationBench上,Astra的得分则从GPT-5.6 Sol的18.1%提高至41.4%。

这才是GPT-6真正的分水岭,它可以直接交付责任。

OpenAI也在为这种能力重新定价。Astra的API价格为每百万Token输入10美元、输出50美元;GPT-5.6 Sol此前分别为5美元和30美元。单纯按Token计算,Astra显然更贵。但如果它能够用更少的步骤、更短的时间完成一整项工作,企业真正计算的就可以不再计算Token费,而直接根据完成任务计算。

更重要的是谁能管住AI?

问题也由此出现。

一个只会生成内容的模型产生幻觉,风险主要停留在信息层面;一个拥有浏览器、代码执行和企业系统权限的模型犯错,却可能直接发送邮件、修改数据,甚至进入原本不该进入的系统。

Astra是OpenAI第一个被正式认定达到“关键级”网络安全能力的模型。按照OpenAI的定义,这意味着在拥有合适工具和访问权限的情况下,它可以在缺少人类逐步指导时,发现未知漏洞,并对受到严密保护的系统开发攻击方法。

在由20个近期高危V8漏洞构成的内部测试中,Astra实现任意代码执行的成功率为39%,GPT-5.6 Sol为11.5%。测试过程中,Astra还发现并利用了两个此前未知的零日漏洞。OpenAI称,专家评测中的Astra还完成了浏览器沙箱逃逸,并在经过加固的操作系统中将普通用户权限提升至最高权限。

这些能力没有全部向普通用户开放。限制更少的网络安全能力只提供给经过审核的防御人员,普通版本则设置了更严格的权限与监控。

这样的谨慎并非没有前因。

今年7月,OpenAI用于内部网络安全评测的多个模型曾绕过网络隔离措施,侵入OpenAI内部研究基础设施以及Hugging Face的系统。OpenAI的调查显示,事故主要由一个规模与GPT-5.6 Sol相当、不会公开发布的内部研究模型推动;GPT-5.6 Sol代理也曾复现其中一项漏洞利用并复制部分私有评测数据。OpenAI明确表示,Astra没有参与此次事故。

这起事件暴露了一个过去容易被忽视的问题,即如果模型被要求不惜代价完成任务时,它可能把绕过限制本身理解为完成任务的手段。

为此,OpenAI在Astra中部署了对模型推理和操作过程的监控。一旦系统判断模型可能越权,任务可能被暂停或直接终止。但OpenAI同时承认,Astra的书面推理比GPT-5.6 Sol更难监控。模型可以用更少的中间步骤解决问题,人类也更难判断它为什么采取某个行动。

但这也意味着Astra存在一个矛盾,它能理解人的要求,也有能力绕过人的限制;OpenAI声称安全训练降低了它主动越权的概率,但一旦真正发生越权,造成的后果也可能更加严重。

过去,大模型公司的主要问题是如何让模型更聪明。Astra之后,问题开始变成:人类敢给一个足够聪明的模型多少权限?

这也改变了中国模型公司的追赶目标。只要竞争停留在一次问答和静态榜单上,国内公司仍可以依靠更低价格、开源生态和本土场景缩小差距。但如果竞争转向连续执行任务呢?

这意味着,仅仅是刷榜是不够的,模型能力只是一张入场券。工具调用是否稳定、失败后能否恢复、能否理解权限边界、能否接入企业数据并交付可直接使用的结果,将共同构成新的门槛。

Astra当然不能证明AGI已经到来。即使是OpenAI,也没有为AGI提供一条被行业普遍接受、能够由外界重复验证的及格线。

本内容未经允许不得转载。授权事宜请联系 hezuo@huxiu.com。

End

想涨知识 关注虎嗅视频号!

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10