出品|虎嗅科技組
作者|餘楊
編輯|苗正卿
頭圖|視覺中國
7月10日消息,OpenAI 正式推出 GPT-5.6 系列模型,包括新旗艦模型 Sol,適合日常工作的均衡模型 Terra,以及最具成本效益的模型Luna 。
在這次發布的主題中,OpenAI 重點強調了智能的尖端、動態的成長和自身的協作性。以及一個醒目的細節:它直接將性價比打在了公屏上。
「每個代幣都能帶來更多智能,每美元能帶來更強的性能,並可根據您的最艱鉅工作需求提供更多功能。」
模型試圖絲滑進入你的工作
在過去的幾個周,GPT-5.6 在世界的各個角落被不同程度地使用。使用者包括日本的農場主Hiroki 和紐約的一個三口之家。Ian 、Margaret以及他們的兒子Alice在起居室裏使用GPT-5.6 完成一系列的事情。此外還有波蘭的數學領域,Batosz用GPT-5.6 解決無法解決的問題。
宣傳片開始於日本北海道的一個農場,農場主 Hiroki 正在通過GPT-5.6管理溫室。他說,「我不是一個工程師,但我已經在使用Codex來使工作更有效率了。」他使用GPT-5.6打開和關閉溫室:「人們過去手動把溫室側面的塑料薄膜捲起來通風。」但現在,GPT-5.6 幫助規劃多年的採購,妥善安排維修以及安裝它們,而且它確實有效。
Hiroki 表示,GPT-5.6 處理prompt並且一直跟進到結果。「使用之前的模型,我不得不反覆做提升,給出新說明,現在,使用單個prompt,它能讀取整個對話線索,選擇正確的工具,自主判斷並完成任務直到結束。這是一個難以置信的變化。」
GPT-5.6同樣在一些小事情上幫助人們。Jake 在「Three Wishes」團隊工作,這是一個美國早餐麥片品牌,由 Ian 和 Margaret Wishingrad 於2019年共同創立,主打健康、無穀物、高蛋白的麥片產品,目標人群為注重營養與口感的消費者。其產品線包括多種口味,如「Fruity」、「Cocoa」等,強調「Sneaky Delicious, Sneaky Nutritious」,即在美味中隱藏營養。
過去,「Three Wishes」由 Ian 和Margaret自己從頭到尾運營。Jake 展示瞭如何對模型進行提示。
他使用 GPT-5.6 完成一個佈置開發銷售儀表盤的任務。首先,他給出了一個銷售儀表盤的組件,要求從六個不同的零售商那裏抓取數據,拉取這些數據後,還要創建一個 Codex 自動化程序,把它固定在聊天裏,讓它每小時同步並拉取一次這些信息,這樣 Margaret 就能擁有一個實時更新的數據儀表盤。他們即將有一個新產品發布,因此需要把這次新發布的品牌素材以及新包裝盒的圖片拉取進來,確保儀表盤能反映出這些內容。
GPT-5.6 在五分鐘內製定了計劃。它拉取了相關的數據,包括品牌等等,以及可使用的潤色版本,設計了演示環節和傳播表格。
GPT-5.6也能幫助科研人員做一些新發現。在波蘭的波茲南,Batosz在同一個數學難題上耗費了3年,但解決不了它,新Codex的到來幫助了他。「Codex能夠提出新點子,也能幫助演算和證明,解決了三年來沒有解決的問題。」 GPT-5.6可以劃分關鍵協作事項,匹配不同工作流,從而解決不同部分的問題。「新發現讓他感到很興奮」。
宣傳片想要表達,GPT-5.6 使工作不僅僅停留在螢幕上,而是進入到現實的世界,從生活中的小事情到農場主的工作,再到最好的數學研究領域,大模型正在嘗試進入每一件事。
GPT-5.6 的成績單
GPT-5.6 Sol 在智能和效率方面均有大幅提升。尤其是在編碼、知識工作、網絡安全和科學等領域,消耗更少的token,完成更復雜的任務,性價比極高。它的特點在於,協調多個代理在並行工作流中運行,這種成熟的協作能力使它能夠檢查、改進並交付可直接使用的成果,從而超越了以往的同類前沿模型。
在對 55 個領域長期運行的專業工作流程進行評估後,GPT-5.6 Sol 創下 53.6 的新高,比 Claude Fable 5(自適應推理)高出 13.1 分。即使在中等推理水平下,它也比 Fable 5 高出 11.4 分,而成本約為其預估成本的四分之一。這種效率也體現在更小的模型上,而這些模型對於實現更豐富、更經濟的智能至關重要:GPT-5.6 Terra 和 GPT-5.6 Luna 的性能優於 Fable 5,而成本約為其十六分之一。
在人工智能分析智能指數(AII)上(在新窗口中打開)GPT-5.6 Sol 的推理能力涵蓋了智能的廣泛衡量標準,包括自主工作、編碼、科學推理和一般能力。其推理能力最高時,得分僅比 Fable 5 低 1 分,完成任務的時間減少了 61%,成本也只有預估成本的一半左右。
GPT-5.6 Sol 在人工智能分析編碼代理指數 (ACI) 上取得了 80 分的全新最佳成績,比 Fable 5 高出 2.8 分,同時輸出標記數量不到 Fable 5 的一半,運行時間不到一半,成本也降低了約三分之一。
不僅如此,在整個GPT-5.6 系列模型中,Terra 的性能也略高於 Fable 5,而 Luna 的性能優於 Opus 4.8;它們的運行時間分別約為 Fable 5 的三分之一,輸出標記數量約為其一半,成本約為其預估成本的四分之一。
此外,GPT-5.6 Sol 在 Terminal-Bench 2.1 和 DeepSWE 測試中也取得了新的最佳成績,這兩個測試旨在評估真實代碼庫中複雜的命令行工作流和長期工程。
同時,GPT-5.6 可以編寫和運行輕量級程序,協調各種工具、處理中間結果、監控進度,並在工作進行過程中選擇下一步操作。這使得工具密集型任務能夠以更少的標記、更少的模型往返次數和更少的指導推進。宣傳片中的北海道農場和「Three Wishes」麥片公司都用到了這個功能。
開發者不需要編寫每個步驟的腳本或將每個工具響應都傳遞給模型,僅僅調用程序化工具就可以實現這一點。響應 API 可以過濾大量中間數據,只保留重要信息,並在此過程中調整其工作流程。
對於那些需要投入更多時間和計算資源才能解決的問題,GPT-5.6 可以超越這種高效的默認設定,並行協調四個智能體,以更高的令牌消耗換取更優的結果和更快的響應速度。以下是比較了 ultra 的默認四智能體配置與單智能體基準在 BrowseComp(瀏覽計算)、SEC-Bench Pro 和 Terminal-Bench 2.1 上的表現;
在所有三個評估中,添加並行智能體都會使得分-延遲曲線向上向左移動,從而在更短的時間內獲得更優的結果。
這也就不難理解,GPT-5.6獲得了包括來自CURSOR、qodo、Notion、Cognition等公司的開發者的一衆好評。
要知識,還要漂亮
與此同時,GPT-5.6 在設計判斷方面實現了質的飛躍。
它能夠檢查和優化渲染結果——而不僅僅是生成底層代碼或內容——從而發現視覺和功能上的問題,並在最終交付作品前進行潤色。其前端功能還可以將自然語言請求轉換為 ChatGPT Work 中精美的交互式解釋和可視化效果。
在知識型工作方面,它的優勢體現在涵蓋長期專業分析、瀏覽、工具使用和計算機使用的各項評估中。
GPT-5.6 Sol 在BrowseComp和OSWorld 2.0測試中分別取得了92.2% 和62.6%的優異成績;在 OSWorld 測試中,它超越了 Opus 4.8,同時輸出令牌數量減少了 85%。
這一系列的性價比優勢也十分顯著。Luna 的性能幾乎達到了 GPT-5.5 的峯值水平,而成本卻不到其一半;Terra 的性能則更勝一籌,且成本更低。
這帶來的結果是,當使用模板和參考資料時,提高尤為顯著。
GPT -5.6 可以推斷出資料的設計系統——佈局、字體、間距、顏色和重複出現的內容模式(包括嵌入在幻燈片母版中的規則)——並將這些規範一致地應用於新內容。
例如,當要求根據參考文件更新數字時,GPT-5.5 的輸出缺少母版幻燈片中的關鍵組件,而 GPT-5.6 則能更忠實地遵循參考結構。
安全,但不絕對安全
OpenAI 表示,GPT-5.6 是其迄今為止最強大的網絡安全模型。
在ExploitBench 2測試中(該測試衡量從找到易受攻擊代碼到執行任意代碼的進展),GPT-5.6 的得分為 73.5%,而 GPT-5.5 在類似的輸出令牌預算下得分為 47.9%。
在ExploitGym 3測試中(該測試要求代理將真實世界的漏洞轉化為可用的攻擊代碼),GPT-5.6 的峯值通過率幾乎是 GPT-5.5 的兩倍,在兩小時的測試時間內從 15.1% 提升至 24.9%;在六小時的測試時間內,其通過率達到了 33.7%。
在SEC-Bench Pro測試中(該測試測試複雜軟件的概念驗證生成能力),GPT-5.6 的得分為 71.2%,而 GPT-5.5 的得分為 45.8%,並且延遲更低。
GPT-5.6 支持重要的防禦任務,例如安全代碼審查、補丁程序修補、威脅建模和藍隊演練。OpenAI Daybreak 的「網絡安全可信訪問」計劃中符合資格的個人和組織可以通過更精準的安全保障措施,在授權環境中執行經過驗證的工作,從而獲得更多防禦功能,包括漏洞分類和驗證、惡意軟件分析、檢測工程和補丁驗證。
在 OpenAI 內部,研究人員將其應用於整個開發流程:診斷故障、優化訓練系統、運行實驗和解讀結果。
但「絕對的安全」是不存在的,OpenAI 同樣聲明瞭其侷限。
GPT-5.6 模型在生物學和網絡安全領域均比之前的模型更強大,但在這兩個領域均未達到「關鍵」標準。在網絡安全領域,GPT-5.6 更擅長髮現和修復漏洞,但難以可靠地對強化目標發起自主的端到端攻擊——這使得防禦者有機會在漏洞被利用之前加強系統。在生物學領域,GPT-5.6 可以支持合法的研究,但並不具備創建、設計或合成高危新型威脅所需的端到端能力。
「一分錢一分貨」
GPT-5.6 即日起在 ChatGPT、Codex 和 OpenAI API 上線,具體的使用上也附帶了說明。這次推送將在全球範圍內進行,並在未來 24 小時內逐步覆蓋所有版本。
Chat: Plus、Pro、Business 和 Enterprise 用戶可以通過中等和較高難度設定訪問 GPT-5.6 Sol。Pro 和 Enterprise 用戶還可以選擇 GPT-5.6 Sol Pro,以獲得複雜任務的最高質量結果。
ChatGPT Work 和 Codex:免費版和 Go 版用戶可使用 GPT-5.6 Terra 版本。Plus、Pro、Business 和 Enterprise 版用戶可以選擇 GPT-5.6 Sol、Terra 和 Luna 版本,並為每個版本設定工作量級別。所有在 ChatGPT Work 和 Codex 中擁有 GPT-5.6 訪問權限的用戶均可使用此功能,並且可以在設定中啓用。在 ChatGPT Work 中,此功能僅對 Pro 和 Enterprise 版用戶可用。在 Codex 中,此功能僅對 Plus 及更高級別的套餐用戶可用。
API:開發者可以通過 OpenAI API 訪問 Sol、Terra 和 Luna。在響應 API 中,程序化工具調用功能允許 GPT-5.6 在內存中編寫和運行程序,以協調工具並處理中間結果,從而實現零數據保留 (ZDR) 兼容。多智能體功能(目前以 Beta 版形式提供)允許 GPT-5.6 運行多個子智能體,並在單個請求中綜合它們的運行結果。
GPT-5.6 的定價基於每百萬代幣,分為三種模型:Sol 為 5 美元輸入/30 美元輸出;Terra 為 2.50 美元輸入/15 美元輸出;Luna 為 1 美元輸入/6 美元輸出。
與此同時,OpenAI 更是拿專業、編程、科學與健康、計算機使用、網絡安全性、自我提升、多模態、學術研究、工具使用等一系列維度的數據說明了自己的「一分錢一分貨」。
OpenAI 更加「接地氣」了
OpenAI 年中節點的這場發布,從跑分宣傳覆蓋到了性能的落地應用。與技術進步相比,更為重要的可能是,GPT-5.6 比以往任何時候都更加務實,更「接地氣」了。
首先是按需分配算力,告別了傳統的「一刀切」,GPT-5.6 的產品越來越矩陣化。過去OpenAI 的策略是「做一個最強的模型,讓所有人用它」, GPT-5.6則把模型變成了類似手機一樣的產品線,讓不同預算的用戶都能找到合適的方案。
Sol旗艦版主打極致性能,Terra均衡版主打性價比,Luna輕量版主打極速和低成本。
而且旗艦版 Sol 的定價,輸入5美元/百萬token,輸出30美元,這僅僅是其競爭對手 Anthropic 同級產品 Fable 5 的一半,但性能更優。
其次,GPT-5.6 也不再僅僅滿足於「回答問題更聰明」,而是開始把「理解意圖、調用工具、拆分任務」連接成完整的工作流,推出由 Codex 驅動的 ChatGPT Work,一鍵生成 PPT、表格並直接導出到 Microsoft Office,讓 AI 真正落地打工人的日常辦公場景。
這既是一種技術選擇,也是一種商業策略。OpenAI 還通過和 Cerebras 合作定製芯片等一系列策略降本增效,改善公司的現金流。一些觀點認為,這是OpenAI 在為自己2027年的IPO計劃做準備。
也就是說,OpenAI 正在努力從一個「昂貴的極客玩具」,變成普通人和企業「用得起、用得順」的生產力基礎設施,深入「everything」。
直播中,農場主Hiroki 表示身邊的人都問他如何使用AI ,而他自己感覺,「那幾乎像是在變魔術。」 從中可以嗅到的信號是,世界的一些角落,正在悄悄發生變化。
當蝴蝶扇動翅膀,在時間的催化下,可能會變成現實的魔術。
本內容由作者授權發布,觀點僅代表作者本人,不代表虎嗅立場。如對本稿件有異議或投訴,請聯繫 tougao@huxiu.com。
End
想漲知識 關注虎嗅視頻號!