OpenAI更新GPT-6 Astra發布頁:明確開放範圍,測試成績以及網絡安全測試結果

金融界
09/07

來源:環球市場播報

OpenAI宣佈推出新一代人工智能模型GPT-6 Astra,並將其定位為公司迄今智能水平和對齊能力最高的模型。Astra目前首先向部分機構開放,並將在未來數日逐步覆蓋ChatGPT Plus、Pro、Business和Enterprise用戶,同時登陸OpenAI API、微軟Azure和亞馬遜AWS Bedrock。

此次升級的重點已不僅是傳統問答能力,而是進一步強化計算機操作、軟件開發、科學研究、網絡安全以及複雜專業工作。OpenAI公布的多項測試顯示,Astra相較上一代GPT-5.6 Sol在計算機操作、編程和科研任務上出現明顯提升,並嘗試把模型能力進一步轉化為可執行的企業級自動化工具。

從商業化角度看,Astra正在把大模型競爭進一步推向「直接完成工作」的階段。OpenAI稱,新模型能夠操作軟件、填寫在線表單、維護客戶關係管理系統、整理日程、進行網絡研究,也可以直接處理科學數據、製作圖表、開發網站和執行前端質量檢查。

計算機操作能力明顯提升,單項任務耗時下降近一半

OpenAI此次重點強調了Astra的計算機操作能力。

在模擬真實專業軟件環境的Agents‘ Last Exam測試中,GPT-6 Astra得分59.3%,高於GPT-5.6 Sol的53.6%,也高於Claude Opus 5的55.5%。OpenAI稱,在最高得分配置下,Astra使用的輸出Token數量比Claude Opus 5少約65%。

在OSWorld 2.0測試中,Astra得分72.6%,高於GPT-5.6 Sol的65.7%。與此同時,完成單項任務的模擬耗時從Sol的大約75分鐘降至40分鐘左右,縮短約47%。

OpenAI還同步升級了Codex的計算機操作體系。結合Astra本身的效率提升,公司稱,在Mind2Web測試中,新組合的任務完成速度達到目前GPT-5.6 Sol體驗的約1.9倍。

這意味着OpenAI正在把模型競爭從「誰回答得更好」,逐步推進到「誰能更快、更穩定地在真實軟件環境中完成整套工作流程」。

企業級文檔、表格和演示文稿成為重點應用場景

除了計算機操作,Astra明顯加強了針對專業辦公環境的訓練。

OpenAI稱,新模型能夠處理多步驟專業任務,並直接生成文檔、電子表格和演示文稿,同時更好地遵循企業已有模板、排版標準和視覺風格。模型還被專門訓練為只提取與任務真正相關的信息,減少無關內容重複。

在BenchCAD測試中,Astra藉助工具完成三維物體重建時取得95.9%的幾何重合度,高於GPT-5.6 Sol的83.3%以及Claude Fable 5.1公布的84.3%。OpenAI稱,在相關測試配置中,Astra的估算API成本分別低約43%和86%。

這部分升級對於OpenAI的企業業務尤其重要。隨着大模型能力逐漸趨同,企業客戶越來越關注的已經不是模型能否生成文本,而是能否直接嵌入財務、法律、工程、數據分析和內容製作流程,並減少人工二次修改。

編程能力繼續提升,Codex強化長期任務處理

OpenAI同時將GPT-6 Astra稱為公司迄今最強的軟件工程模型。

在Terminal-Bench 4.0測試中,Astra得分57.9%,明顯高於GPT-5.6 Sol的37.3%,並略高於Claude Fable 5.1的55.8%。OpenAI稱,在相應測試配置下,其單項任務API成本也低於對比模型。

Astra還為Codex引入新的長期上下文處理機制。過去,當一次編程任務持續時間過長、上下文空間被佔滿時,系統通常會將此前內容壓縮成摘要,而壓縮過程可能丟失失敗原因、測試結果或組件行為等細節。

按照OpenAI的介紹,Astra可以在不同上下文之間保存工作記錄,並重新搜索此前的需求、測試結果以及工具輸出,從而減少長時間調試和大型代碼重構過程中出現的信息損失。

科學與網絡安全能力進一步提升

Astra此次另一項明顯升級來自科學研究。

在Terminal-Bench Science 0.1中,Astra取得64.6%的完成率,高於Claude Fable 5.1的52.6%。OpenAI稱,在該測試配置中,其估算API成本低約31%;在一個成本更低的配置下,Astra得分61.1%,而GPT-5.6 Sol的最高成績為22.4%。

在GPQA Diamond研究生級科學推理測試中,Astra得分96.0%。OpenAI還表示,模型能夠直接操作專業科研軟件,對數據進行檢查、分析和可視化。

但更值得關注的是網絡安全能力的躍升。

OpenAI表示,Astra已經達到其《Preparedness Framework》中的網絡安全「Critical」級別。在沒有生產環境安全限制的測試中,Astra在ExploitBench取得100%的成績,高於GPT-5.6 Sol的78.5%;在ExploitGym中成功率達到42.4%,Sol為30.3%。

在針對2026年6月至8月新近漏洞設計的測試中,OpenAI稱Astra甚至發現並利用了兩個此前未知的零日漏洞,公司正在將這些漏洞披露給相關軟件維護方。

正因如此,OpenAI此次也同步強化了安全限制。正式上線版本可以用於安全代碼審查和漏洞修復,但會拒絕部分更高級別的攻擊性網絡安全請求,例如直接創建漏洞概念驗證攻擊代碼。

安全對齊成為此次發布的另一條主線

相比此前單純強調能力提升,OpenAI此次對Astra的安全和行為邊界給予了更多篇幅。

公司稱,在一項測試模型是否會超出授權範圍的內部評估中,沒有生產安全措施保護的GPT-5.6 Sol有48%的情況會超出預定目標,而GPT-6 Astra在該測試中的比例為0%。

在另一項計算機操作安全壓力測試中,Astra出現不符合預期結果的比例為2.4%,低於Claude Fable 5.1的9.5%和Claude Opus 5的11.5%。

不過,OpenAI同時披露了一個潛在問題:部分評估顯示,Astra的書面推理過程比GPT-5.6 Sol更難監控。公司稱,這是由於Astra在較簡單任務中能夠使用更少的顯性推理步驟完成問題,目前提升模型行為的可監控性仍是研究重點。

API定價每百萬輸入Token 10美元,輸出50美元

商業化方面,GPT-6 Astra將直接進入OpenAI現有訂閱體系。

Plus、Pro、Business和Enterprise用戶將在未來數日陸續獲得訪問權限,Astra的使用量將計入現有訂閱額度,用戶和企業也可以額外購買使用額度。Pro、Business和Enterprise用戶還將獲得GPT-6 Astra Pro版本。企業管理員需要主動開啓Astra,發布初期默認處於關閉狀態。

開發者可以通過OpenAI API調用gpt-6-astra,微軟Azure以及亞馬遜Bedrock也將提供該模型。

OpenAI公布的API標準價格為每百萬輸入Token 10美元、每百萬輸出Token 50美元,緩存讀寫另行計費。此外,公司還提供Fast模式,處理速度最高可以達到標準模式的兩倍,但價格也是標準模式的兩倍。

從此次發布可以看出,OpenAI對下一階段大模型商業化的定位正在進一步變化:單純提升推理基準已經不是唯一重點,計算機操作、軟件開發、企業辦公、科學研究和自動化執行能力正在成為新的競爭核心。

GPT-6 Astra能否進一步擴大OpenAI在企業AI市場的領先優勢,最終仍取決於這些測試中的能力能否穩定轉化為實際生產效率,以及企業客戶是否願意為更高等級的自動化執行能力支付額外成本。

美股頻道更多獨家策劃、專家專欄,免費查閱>>

責任編輯:山上

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10