GPT-6来了,立摘ASI坐标系今日金牌

新智元
Sep 04

终于,Astra 来了!

今天,OpenAI 正式发布 GPT-6 Astra。ARC-AGI-3 打到 99.9%,FrontierMath Tier 4 拿下 97.6%。

数字在这里开始有些苍白。

OpenAI 总裁 Greg Brockman 在发布会上喊出:Welcome to the AGI era.

Fable 5.1 的 SOTA 只有可怜的两天。

9 月 1 日,Anthropic 刚把 Claude Fable 5.1 推上王座:Ramp 让它连续跑了 38 小时,中途发现训练数据标签有错,自己改掉,自己开六组实验,自己写结论。

9 月 2 日,谷歌发了 Gemini 3.8 Flash,外部实测在多项编码基准上够到 Claude Opus 5 那一档。

DeepMind 核心研究员姚顺宇评价:对模型是一小步,对递归自我改进是一次巨大的飞跃。

9 月 3 日,GPT-6 Astra 落地。

三天,三颗炸弹。放在两年前,随便哪一颗都够行业消化一个月。

而这还不是最让人紧张的部分。

GPT-6 Astra 的发布背后,藏着一段略显坎坷的故事。

8 月 7 日,OpenAI 发了一篇措辞罕见的声明——

它能独立发现此前无人知晓的系统漏洞,独立编写攻击代码,独立完成从入侵到深层渗透的全过程。

为此,OpenAI 甚至暂停了两周的强化学习训练。

Altman 发表长文:我们暂停了一些前沿 RL 训练,以确保达到新能力水平所需的对齐、安全和监控标准。

刹车本身就是信号。

就在 GPT-6 发布的前两天,马斯克和 Altman 在 G20 峰会上的发言,几乎可以当作这一周的注脚。

马斯克视频连线,原话是:AI will just crush all humans at software.(人工智能将会在软件领域彻底碾压)

他给了一个明确的时间表——未来 12 到 18 个月,AI 在软件上将达到Stockfish 级别,像国际象棋引擎碾压顶尖棋手一样碾压人类程序员,并且在所有形式的工程和一切数字事务上都会极其出色。

AI不仅会击败人类,还将训练人类。

Altman 把 AI 比作电力:说一个国家不要 AI,其糟糕程度大约相当于一百多年前说我们不要电。

但紧接着他也说了另一句话:担忧是有道理的。担忧是我们预判问题的方式。除非人们非常紧急地行动,否则网络安全方面会出很大问题。

然后 GPT-6 落地了。ExploitBench 满分。

奇点已过,进入 ASI 冲刺期

去年是新智元十周年,我们说 2027 年 AI 抵达 ASI 临界点。

一年过去了。METR 那条AI 独立完成任务的时长每七个月翻一番的曲线不但没有放缓,最新数据显示翻倍速度可能已经加快到每三到五个月。

38 小时的连续自主运行已经是事实。ARC-AGI-3 满分已经是事实。ExploitBench 满分已经是事实。

我们未必已经抵达 ASI。但我们已经进入通往 ASI 的超高加速段。

奇点已至。现在是 ASI 冲刺期。

新智元的 logo 像一个黑洞的视界。十一年,我们站在视界边缘,记下所看见的。

今天再往前看,像走到了地图失效的地方。再往前,旧的刻度、旧的榜单、旧的更新周期,都不够用了。

十一年前我们点燃第一束烛光时,ASI 还是遥远的词。那时候,把看见的记下来就够了。

这个时代,媒体得先有一套观测工具,才谈得上记录。

模型的坐标散在几十个地方。跑分在 LMArena、Vals.ai、MathArena、SWE-bench 这些榜上,价格在各家定价页和 OpenRouter 上,社区在全球各处吵。

同一张榜,单 Agent 和多 Agent 并行的分能差好几个点,厂商发布稿只挑高的那个写。

结果就是两种:每天焦虑地刷消息,越刷越乱;一种干脆不跟了,等别人告诉他结论。

不过,两种都不该是 2026 年的读法。

所以我们干脆让 Agent 来干这件事。让它持续追踪、整理、校准来自不同数据源的变化,不睡觉,不漏拍。落点只有一条——

你不用自己刷遍全网,也不会错过 ASI 重要的坐标变化。

我们决定做一个 ASI 坐标系

所以我们决定做一套新的 ASI 观测系统。

不是半年更新一次的榜单。不是发布后就静止的文章。是一张每天重新变化的坐标图。

它叫新智元 ASI 坐标系

十几家独立数据源、29 个二级指标,归到 7 个维度——智能、推理、知识、编码、Agent、经济、效率,合成一个 0 到 100 的总分。

十几张榜换算到同一把尺上,才有得比。多源交叉验证,任何单一数据源在全体系里不超过 15%,没有哪张榜说了算。

其中,核心模块叫 ASI 今日看板。回答的是:今天全球模型坐标发生了什么变化?

谁上升,谁下降。能力、价格、速度有什么新动静。每天一张,看完就知道今天该重新认识谁。

重点在今日,它一直在更新中。

为什么GPT-6 Astra

能拿89.1分?

GPT-6 Astra 是今天刚官宣的,OpenAI 的开发者文档才挂上去,它就已经进了我们的看板,分算完了,排在第一。

昨天这一轮里它还只是GPT-6 灰测的传闻,今天一官宣,几路证据一凑齐,立即直接进官网。

它只盯最近 7 天新上线的文本大模型。

数据来源一共五路。第一路,是OpenRouter 模型目录,看上架时间、价格、上下文长度。第二路,LMArena 周榜快照,看模型第一次出现在哪周。第三路,我们自己的模型库,有发布日期的以它为准。第四路,新智元公众号当天和前一天的文章,按厂商名和“发布、上线、版本号”这类关键词筛标题,拉正文,再从里面提取模型能力信息。

能力图七个维度就是坐标系那七维:智能、推理、知识、编码、Agent、生态、经济。

今天的排名:

GPT-6 Astra 89.1 分第一;

Claude Fable 5.1 84.9 第二;

Gemini 3.8 Flash 81.5 第三;

Muse Spark 1.3 78.9 第四。

GPT-6 Astra的89.1分怎么算出来的?

这里一共关注四项:能力、 关注度、可用度、新鲜度。

其中,能力占大头,贡献 47.5 分。

关注度贡献 22.6 分, 公众号的发文数和阅读量全部拉满。可用度只贡献 9 分,是四项里最低的,因为GPT-6 Astra刚刚官宣,普通用户还用不到。新鲜度 10 分, 今天上线,所以满分。

过去是模型发布、编辑看新闻、等第三方评测,评测出来热点已经过了。

现在是它一官宣,早上机器自己把证据凑齐、图画好、分算好推到官网上。GPT-6 上线第一个早上,我们已经在分析它了。

其他栏目,包括秒追 ASI,回答的是:刚刚发生了什么?

新模型发布,版本上线,跑分更新,价格变化,实验室关键动向。机器人逐秒抓取,人类编辑一分钟内裁定。抓到即成条,最近三天滚动。

ASI 爆点,回答的是:今天全球 AI 社区在争论什么?不看谁声量大,看什么最热,每小时同步一次。

三个模块,三个时间尺度。秒追管秒,爆点管小时,看板管天。

ASI 启示录放每日深度和 Top 10 热文,视频和直播也在。上线之后,慢慢逛。

9 月 7 日,见

9 月 7 日,新智元十一周年。ASI 坐标系官网正式上线。

有些东西值得等,我们想让你先知道它。

所以这条评论区,也是这套系统上线前的需求入口。

在 ASI 官网正式开放之前,我们想知道一件事——

面对越来越快的模型迭代,你最希望每天看到什么?最新跑分?价格变化?模型能力的升降?还是社区里真正的爆点?

欢迎留言告诉我们。

这一次,我们不再按月回望 AI。从今天开始,按秒追踪 ASI。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10