文| Tech星球 華衛
今天(9月4日),OpenAI 發布新一代前沿模型 GPT-6 Astra,並直接甩下一句:Welcome to the AGI era(歡迎來到AGI時代)。
最近的大模型行業,新模型的出現簡直像坐火箭。9月僅僅過去了四天,就有四家海外巨頭輪番上陣。第一天,Anthropic宣佈推出Claude Fable 5.1和Mythos 5.1。第二天,谷歌發布了Gemini 3.8 Flash和專攻網絡安全的Gemini 3.8 Flash Cyber,Meta祭出Muse Spark 1.3。
國內市場的發布節奏同樣快得驚人。上一周,三家國內開源模型廠商發了新模型,阿里千問Qwen3.8-Flash、智譜GLM-5.3-Flash和騰訊混元Hy4 preview都上線了。再往前推兩周,DeepSeek V4 Pro、Grok 4.6、谷歌Gemini 3.7 Flash、智譜GLM-5.3接連在48小時內亮相。
Benchmark排行榜上,最強模型的保質期越來越短了,從登頂榜首到被超越,現在根本撐不過一周。模型廠商似乎要完成某種KPI一樣,扎堆上線,「周拋」,正在成為大模型的新常態。
大模型廠商,已經等不起了
在最新模型的發布中,OpenAI 和谷歌都不約而同地提到RSI機制上的巨大飛躍。該機制的核心是AI 參與乃至改進自身研發流程、從而持續縮短模型迭代周期,全稱是Recursive Self-Improvement(遞歸式自我改進)。
OpenAI 強調,Astra是第一款由前代模型深度參與訓練監督的旗艦產品。谷歌 DeepMind 大牛姚順宇表示,Gemini 3.8 Flash對 RSI 來說是一次巨大飛躍。
作為本輪模型發版加速的重要推手,RSI 即將開啓模型發布的新周期,可以預見模型進化的速度將會更快,周拋馬上要成為過去式。
除了用模型加速自身的內部研究,另一個重要原因是,大模型研發正在從一次「造神」的大工程,變成越來越標準化的「流水線」式訓練。
過去,新模型發布是一件很重的事情。無論是數據、訓練周期還是算力,都需要鉅額投入,研發周期動輒幾個月甚至更久。模型廠商也不會輕易發版,一旦推出新模型,就意味着一次重大的「代際升級」,可能要被討論上幾個月。
但現在,這套節奏正在被打破。
基礎模型訓練方法越來越成熟,後訓練、強化學習、推理優化、數據處理等環節也越來越工程化。一個新模型不一定意味着從頭訓練一個完全不同的巨型模型,而能夠基於已有模型底座,通過強化推理、代碼、Agent、視覺等特定能力,或者進一步優化速度、成本和上下文能力,快速推出一個新版本。
模型的「代際」概念也因此開始變得模糊。新模型不一定意味着一次徹底的技術躍遷,更像軟件產品小版本迭代:能力有提升,體驗有變化,價格可能更低,但底層架構未必發生翻天覆地的變化。
此前,智譜就明確表示,GLM-5.3 和 5.2 使用同一個基礎模型,所有提升全部來自後訓練。阿里通義團隊在發布 Qwen3.8-Flash-Next 的開源權重時透露,Next 新架構將是全新一代 Qwen4 系列模型的雛形。
還有一個變化是,模型廠商開始越來越頻繁地發布「小版本」和「專用版本」。他們的發版目標,從追求「做出一個最強模型」,拆成推出「瞄準某個具體需求而且可以馬上用起來」的專項版本。
這也是為什麼今年「Flash」越來越密集地出現在各家模型產品線中。它們並不一定追求在所有指標上擊敗旗艦模型,而是把速度、成本、推理能力或者特定場景做到更極。並且,Flash 參數規模相對較小,修改和重新訓練模型所消耗的算力更低,進一步降低了模型發布的門檻和周期。
與此同時,開源模型「閃電戰」般的密集發布,正在把大模型競爭拉進一個更加實時的維度。對開源陣營來說,它們甚至不一定需要在每次發布中都全面擊敗最強模型,只需要不斷縮短與其的距離。而這種持續追趕,本身就是一種競爭壓力。
過去,大模型行業「分工」清晰,開源模型「卷速度」,閉源巨頭則更習慣集中資源做長周期研發,每次發布就是一次重磅升級。但現在,連過去最有能力「憋大招」的閉源巨頭,也開始運行這套高頻迭代的發布規則。從Gemini 3.7 Flash到3.8 Flash,谷歌只用了3周。
模型發布的常規周期一旦縮短,整個行業的「時間感」都會改變。以前半年不更新,市場覺得正常。現在幾周不更新,大家就會開始懷疑:「你是不是掉隊了」。如今,模型的更新速度本身,已經開始成為競爭壁壘了。
沒有絕對TOP,模型越來越像「快消品」
如果說2023年的大模型是「奢侈品」,稀缺、昂貴、少數巨頭獨佔。那麼,2026年的模型市場,正在變成一場「快消品的盛宴」。
現在,「絕對領先」已經不適用於這個行業了。Benchmark排行榜越來越像模型的「實時股價」。「誰是第一?」 不再是用戶口中討論的焦點,大家只關心: 「今天哪個模型最好用?」換個任務場景選擇可能就不同了。
OpenAI 剛發的 GPT-6 Astra 就是一個典型例子。在其內部測試中,GPT-6 Astra以同樣的標準版定價,在多項基準都拿到了高於Claude Fable 5.1的得分。但在「人類最後的考試」測試中,Astra 使用工具的得分為 57.2%,低於 Sol 的 65.0% 和 Claude Fable 5.1 的 63.8%。在第三方機構 Artificial Analysis的橫測中,Astra 的 Coding Agent Index 比 Fable 5.1低 3分。
模型越來越多,能力差距收窄了。每家都有自己的「第一」,沒有誰一騎絕塵。
價格也被打下來了,「最強模型」越來越不值錢。 Anthropic剛發布的Fable 5.1,緩存讀取費用下調75%,每百萬 token 只需 0.25 美元。對於常規任務來說,整體的成本比 Fable 5 降低了約 25%;大量使用 AI 智能體的複雜任務能夠節省的成本更多,最高能夠達到 45%。
8 月,OpenAI 還發帖宣佈:未來三個月內,GPT-5.6 Sol 的 API 調用價格與超額信用額度全面下調超過 20%。數據服務商Silicon Data公開的最新數據顯示,今年全球每百萬token推理均價已從5月底的2.04美元跌至8月初的1.16美元,創年內新低。
更關鍵的是,各家模型正在主動降低切換的技術門檻,接入新模型不一定意味着從底層重寫一套系統。騰訊最新發布的 Hy4 preview 支持 OpenAI Chat Completions、OpenAI Responses以及Anthropic Messages 三種API協議,Qwen和智譜的GLM-5.3同樣提供兼容OpenAI Chat Completion和Anthropic Messages規格的API。
上下文長度也不再能「綁定」特定模型,現在有更多替代方案了。Gemini 3.7和3.8 Flash都支持約104.8萬Token輸入上限,Hy4採和Qwen3.8-Flash都提供了1M Token上下文窗口。
當然,這並不意味着所有用戶真的會在實際任務中每周換一次模型。但需要注意的是,用戶越來越沒有理由對某一個模型保持長期忠誠。現在的大模型市場,品牌崇拜正在退場,取而代之的是一種「超市貨架式」的隨取隨用,沒有稀缺性、迭代速度賊快且切換無負擔。
誰最焦慮,誰又在狂歡?
於是,一個很有意思的局面出現了:模型廠商越來越焦慮,開發者和普通用戶卻越來越開心。
當模型進入高頻迭代,模型廠商幾乎沒有「喘息期」。一次發布建立的領先優勢,很快就可能被下一輪更新追上。它們不僅要做出比上一代更強的模型,還需持續證明自己沒有落後。
但對於開發者和普通用戶來說,感受卻完全不同。模型發布越來越快,數量越來越多,他們反而越方便「貨比三家」,重要的是只有三個問題:好不好用、夠不夠便宜、能不能完成任務。
情況稍顯棘手的,可能是那些把大模型深度嵌入業務流程的企業。模型越來越多之後,持續的模型評估、選擇正在變成企業新的工程負擔。不同模型在推理、代碼、Agent、速度、價格等維度各有優劣,而模型又在持續更新,今天的最優解很可能很快被新的版本打破。
更麻煩的是,企業很難像普通用戶一樣「說換就換」。企業已經圍繞原有模型搭建了Prompt、知識庫、工具調用、Agent工作流和評測體系,模型一旦更換,不僅是修改一個API參數,實際上可能很多業務流程與環節都需要重新測試和調優。
因此,在B端市場,大模型比拼的下一階段,可能不只是模型廠商之間爭奪用戶,而是圍繞「誰能更低成本地選擇、切換和組合模型」展開,這或將成為新的競爭力。
今天的行業TOP,只屬於今天。因為下一代模型,可能下周就來了。
「周拋」改變的,或許不只是模型發布的頻率,而是大模型行業的競爭邏輯:「領先一次」遠遠不夠,真正決定勝負的,是誰能更快進入下一輪。