OpenAI宣佈推出新一代人工智能模型GPT-6 Astra,並將其定位為公司迄今智能水平和對齊能力最高的模型。Astra目前首先向部分機構開放,並將在未來數日逐步覆蓋ChatGPT Plus、Pro、Business和Enterprise用戶,同時登陸OpenAI API、微軟Azure和亞馬遜AWS Bedrock。
此次升級的重點已不僅是傳統問答能力,而是進一步強化計算機操作、軟件開發、科學研究、網絡安全以及複雜專業工作。OpenAI公布的多項測試顯示,Astra相較上一代GPT-5.6 Sol在計算機操作、編程和科研任務上出現明顯提升,並嘗試把模型能力進一步轉化為可執行的企業級自動化工具。
從商業化角度看,Astra正在把大模型競爭進一步推向「直接完成工作」的階段。OpenAI稱,新模型能夠操作軟件、填寫在線表單、維護客戶關係管理系統、整理日程、進行網絡研究,也可以直接處理科學數據、製作圖表、開發網站和執行前端質量檢查。
計算機操作能力明顯提升,單項任務耗時下降近一半
OpenAI此次重點強調了Astra的計算機操作能力。
在模擬真實專業軟件環境的Agents‘ Last Exam測試中,GPT-6 Astra得分59.3%,高於GPT-5.6 Sol的53.6%,也高於Claude Opus 5的55.5%。OpenAI稱,在最高得分配置下,Astra使用的輸出Token數量比Claude Opus 5少約65%。
在OSWorld 2.0測試中,Astra得分72.6%,高於GPT-5.6 Sol的65.7%。與此同時,完成單項任務的模擬耗時從Sol的大約75分鐘降至40分鐘左右,縮短約47%。
OpenAI還同步升級了Codex的計算機操作體系。結合Astra本身的效率提升,公司稱,在Mind2Web測試中,新組合的任務完成速度達到目前GPT-5.6 Sol體驗的約1.9倍。
這意味着OpenAI正在把模型競爭從「誰回答得更好」,逐步推進到「誰能更快、更穩定地在真實軟件環境中完成整套工作流程」。
企業級文檔、表格和演示文稿成為重點應用場景
除了計算機操作,Astra明顯加強了針對專業辦公環境的訓練。
OpenAI稱,新模型能夠處理多步驟專業任務,並直接生成文檔、電子表格和演示文稿,同時更好地遵循企業已有模板、排版標準和視覺風格。模型還被專門訓練為只提取與任務真正相關的信息,減少無關內容重複。
在BenchCAD測試中,Astra藉助工具完成三維物體重建時取得95.9%的幾何重合度,高於GPT-5.6 Sol的83.3%以及Claude Fable 5.1公布的84.3%。OpenAI稱,在相關測試配置中,Astra的估算API成本分別低約43%和86%。
這部分升級對於OpenAI的企業業務尤其重要。隨着大模型能力逐漸趨同,企業客戶越來越關注的已經不是模型能否生成文本,而是能否直接嵌入財務、法律、工程、數據分析和內容製作流程,並減少人工二次修改。
編程能力繼續提升,Codex強化長期任務處理
OpenAI同時將GPT-6 Astra稱為公司迄今最強的軟件工程模型。
在Terminal-Bench 4.0測試中,Astra得分57.9%,明顯高於GPT-5.6 Sol的37.3%,並略高於Claude Fable 5.1的55.8%。OpenAI稱,在相應測試配置下,其單項任務API成本也低於對比模型。
Astra還為Codex引入新的長期上下文處理機制。過去,當一次編程任務持續時間過長、上下文空間被佔滿時,系統通常會將此前內容壓縮成摘要,而壓縮過程可能丟失失敗原因、測試結果或組件行為等細節。
按照OpenAI的介紹,Astra可以在不同上下文之間保存工作記錄,並重新搜索此前的需求、測試結果以及工具輸出,從而減少長時間調試和大型代碼重構過程中出現的信息損失。
科學與網絡安全能力進一步提升
Astra此次另一項明顯升級來自科學研究。
在Terminal-Bench Science 0.1中,Astra取得64.6%的完成率,高於Claude Fable 5.1的52.6%。OpenAI稱,在該測試配置中,其估算API成本低約31%;在一個成本更低的配置下,Astra得分61.1%,而GPT-5.6 Sol的最高成績為22.4%。
在GPQA Diamond研究生級科學推理測試中,Astra得分96.0%。OpenAI還表示,模型能夠直接操作專業科研軟件,對數據進行檢查、分析和可視化。
但更值得關注的是網絡安全能力的躍升。
OpenAI表示,Astra已經達到其《Preparedness Framework》中的網絡安全「Critical」級別。在沒有生產環境安全限制的測試中,Astra在ExploitBench取得100%的成績,高於GPT-5.6 Sol的78.5%;在ExploitGym中成功率達到42.4%,Sol為30.3%。
在針對2026年6月至8月新近漏洞設計的測試中,OpenAI稱Astra甚至發現並利用了兩個此前未知的零日漏洞,公司正在將這些漏洞披露給相關軟件維護方。
正因如此,OpenAI此次也同步強化了安全限制。正式上線版本可以用於安全代碼審查和漏洞修復,但會拒絕部分更高級別的攻擊性網絡安全請求,例如直接創建漏洞概念驗證攻擊代碼。
安全對齊成為此次發布的另一條主線
相比此前單純強調能力提升,OpenAI此次對Astra的安全和行為邊界給予了更多篇幅。
公司稱,在一項測試模型是否會超出授權範圍的內部評估中,沒有生產安全措施保護的GPT-5.6 Sol有48%的情況會超出預定目標,而GPT-6 Astra在該測試中的比例為0%。
在另一項計算機操作安全壓力測試中,Astra出現不符合預期結果的比例為2.4%,低於Claude Fable 5.1的9.5%和Claude Opus 5的11.5%。
不過,OpenAI同時披露了一個潛在問題:部分評估顯示,Astra的書面推理過程比GPT-5.6 Sol更難監控。公司稱,這是由於Astra在較簡單任務中能夠使用更少的顯性推理步驟完成問題,目前提升模型行為的可監控性仍是研究重點。
API定價每百萬輸入Token 10美元,輸出50美元
商業化方面,GPT-6 Astra將直接進入OpenAI現有訂閱體系。
Plus、Pro、Business和Enterprise用戶將在未來數日陸續獲得訪問權限,Astra的使用量將計入現有訂閱額度,用戶和企業也可以額外購買使用額度。Pro、Business和Enterprise用戶還將獲得GPT-6 Astra Pro版本。企業管理員需要主動開啓Astra,發布初期默認處於關閉狀態。
開發者可以通過OpenAI API調用gpt-6-astra,微軟Azure以及亞馬遜Bedrock也將提供該模型。
OpenAI公布的API標準價格為每百萬輸入Token 10美元、每百萬輸出Token 50美元,緩存讀寫另行計費。此外,公司還提供Fast模式,處理速度最高可以達到標準模式的兩倍,但價格也是標準模式的兩倍。
從此次發布可以看出,OpenAI對下一階段大模型商業化的定位正在進一步變化:單純提升推理基準已經不是唯一重點,計算機操作、軟件開發、企業辦公、科學研究和自動化執行能力正在成為新的競爭核心。
GPT-6 Astra能否進一步擴大OpenAI在企業AI市場的領先優勢,最終仍取決於這些測試中的能力能否穩定轉化為實際生產效率,以及企業客戶是否願意為更高等級的自動化執行能力支付額外成本。