刚刚,GPT-6 Astra全量开放!

智通财经网
Sep 05

GPT-6 Astra,全量开放了!

就在刚刚,OpenAI 官宣,所有 Pro、Enterprise 和 Business Premium 用户,已经能在 ChatGPT Work 和 Codex 里直接用上 GPT-6 Astra了,API 同步上线。

只不过,Plus 和普通 Business 用户还得再等几天。

9 月 3 日 OpenAI 宣布 Astra 分阶段上线。两天后的今天,付费高档用户全部放开。

先叫你删提示词

这么大的发布,OpenAI 工程师 Victor Nunez 给大家的第一条建议,居然是删掉你的提示词。

他说:趁 Astra 开始推出,回头清理一下你的 AGENTS.md 和 Skills,顺便重新想想推理级别怎么用。

AGENTS.md,就是写给 AI 的员工手册:你是谁、该干啥、不能干啥。Skills,就是教它干活的说明书:遇到这种情况按这个流程来。

这几年,开发者对付模型的办法简单粗暴:不断往手册里加东西。它听不懂,多解释一步。它老犯错,就多加一条限制。它还犯,再补一个例子。

就像给一个总会忘事的新员工贴便签。日积月累,贴满了整张桌子。

但 Astra 来了之后,这满桌子的便签,反而变成了负担。

OpenAI 在 Astra 的模型指南中写到:Astra 对 skill 和 AGENTS.md 里的指令更敏感了。

以前那些只是摆设的旧规矩,现在会被它逐条执行。一条含糊的规则,会让它停下来反复确认;两条互相冲突的规则,直接让它懵逼。

打个比方。以前你写了句“所有方案要经过审批”,老模型看见就当没看见,照样往下干。

Astra 不会。它真的会停下来问你:“请问这个方案找谁审批?”然后就……等着。

所以指南用了“强烈建议”四个字,让开发者审计模型能读到的每一个 skill 文件。

不光如此。Astra 还比前代更爱问问题。

你让它干个活,它干到一半突然停了:“这里有两种做法,你想要哪种?”拜托,你自己挑一个往下干不行吗?写代码也是,还没动手先给你跑一圈测试,改个按钮颜色都要先写单元测试。

这些都得靠提示词去调。而调的方向,大多是往回收

更绝的是,指南里甚至附了一段现成的提示词,让 Astra 别用“delve”“值得注意的是”这类套话,连“先否定再翻转”的句式(比如“这不是关于 X,而是关于 Y”)也被点名禁了。

写这些套话的是模型,教你怎么防套话的,也是模型的厂家。就有一种“我自己挖的坑我自己教你填”的诚实。

说到这儿,可能有人要问:这跟我有啥关系?

关系太大了。

Astra 的逻辑变了,意味着你和 AI 打交道的方式也该变了。

以前你跟 ChatGPT 聊天,发现它答得不好,本能反应是加限制、加要求。一条不够加两条,两条不够加五条。

这就是加法思维——模型越笨,你写的规矩越多。

现在 Astra 告诉你:别写那么多了。

它已经能从上下文中推断出你的意图,能在指令有歧义时主动问你,能记住多步任务里的全局目标。

你写的那些补丁式提示词,不但多余,还可能让它走弯路。

所以 OpenAI 官方迁移指南里反复强调的一个词是:审计。审计你给它的所有指令,把过时的、冗余的、冲突的,统统删掉。

模型越强,你写的规矩反而该越少。

这个道理,不管你是开发者还是普通用户,都一样。

强到什么程度

说了这么多“减法”,那 Astra 到底“加”了多少能力?

拿到早期访问的开发者,已经交出了答卷。

开发者 Matt Shumer 让 Astra 在虚幻引擎里造了一座曼哈顿,一条街一条街地建,花了一周。

他发明了一套叫“管理者循环”的玩法:一个 Astra 当经理,把整个任务拆成清单和阶段;再开一个 Astra 当执行者。

经理一次只派一段活,干完了再给下一段,绝不提前剧透。干活的那头呢,最猛的时候 96 个子智能体同时上手,流水线一样往前推。

Shumer 还发现了一个极有趣的措辞细节:让模型把每个阶段做到“极好”,它就乖乖往前走;一旦改成“完美”,它立刻一头钻进细枝末节里出不来。一个词的差别,决定了项目是推进还是停滞。

开发者 Anshu 惊呼:Astra 简直就是 3D 游戏领域的超级 AGI 机器之神。

Astra只用了 45 分钟就搞定了一个画质超棒的开放游戏世界。

免疫学家 Derya Unutmaz 只输入了一句话——“做一个 5 分钟的 T 细胞教学视频”。

Astra 自己写解说、用 Remotion 做动画、用 Imagegen 出图,还主动建议用 HeyGen 配旁白,一次出片。

这位研究 T 细胞 35 年的科学家看完后说:自己肯定讲不了这么好。 他现在打算做一整套免疫学视频课放到网站上。

Tom Krcha 给了 Astra 一张蒸汽火车的旧图纸。

几分钟后,Blender 里跑出来 3295 个可编辑对象,每个零件都能单独拆开改。

这条推文已经有超过 75 万次浏览。

他又试了一辆更冷门的 Commodore Vanderbilt 火车,车头的弧度还得手工修,但起点已经高得吓人。

OpenAI 自己亮出的数字也够硬。

在 OSWorld 2.0(让模型像人一样操作电脑桌面)上,Astra 做到 72.6%,上一代 GPT-5.6 Sol 是 65.7%;每个任务的耗时从 75 分钟压到 40 分钟——准确率上去了,速度还快了将近一倍。

当然,Astra 也不是全方位碾压。Artificial Analysis 的独立综合智能指数上,Astra 拿到 61.2 分,Anthropic 本周刚发的 Claude Fable 5.1 是 65.7 分。

双雄这一局,还没有分出胜负。

减法时代

过去几年,AI 开发的故事是加法。

模型不够聪明,就用规则来补,规则越补越厚。

现在,短板补上了。规则本身变成了新的错误来源。

OpenAI 用一份模型指南,悄悄把 AI 工程的方向掉了个头:以前是教它每一步怎么做,现在是把挡路的旧规矩一层层拆掉,给它空间

人和模型的关系也跟着变了。

以前是教它。现在是——别挡它。

本文来源“新智元”,智通财经编辑:陈秋达

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10