
谷歌又回來了!
就在啱啱,谷歌正式發布了新一代前沿AI模型——Gemini 4 Argon。
沉寂了半年多,被GPT-6和Claude 5按在地上摩擦後,這次谷歌直接掀翻了牌桌!
Gemini 4 Argon,是谷歌 7 個月來首款非 Flash 級專有模型。
在文本競技場(Text Arena)中,啱啱發布的Gemini 4 Argon排名第一,得分1533碾壓Opus 5.5。

在權威的Artificial Analysis智能指數上,Gemini 4 Argon斬獲53分,直接追平GPT-6 Astra,領先GPT-6.1 Sol。

在成本上,谷歌祭出了喪心病狂的「骨折價」:單任務成本僅需1.99美元,只有GPT-6 Astra的60%!直接處於帕累託前沿。

在能力上,它史無前例地將單次輸出上限拉升至100萬Token,甚至在谷歌內部直接用安全語言重寫了80萬行底層系統內核代碼。
在Vals RSI指數上, Gemini超過 GPT-6 Astra,超過了30%!


目前,該模型只開放給 Google Fairwind 計劃裏的一批網絡安全防禦方,之後會開放給給付費 API 用戶和 AI Ultra 訂閱者。
一位谷歌DeepMind研究員在X上疑似玩梗:RSI來了,沒什麼可教它的,是時候去追逐我的咖啡師夢想了。不過隨後又秒刪。

不過,至少有一點可以確定:谷歌又回來了。

畢竟,Argon只是Gemini 4的入門款。

谷歌掀起價格戰:1.99美元,直接背刺GPT-6
這次,谷歌的定價堪稱驚人。
百萬輸入 Token: 2美元
百萬輸出 Token: 10美元
緩存輸入折扣: 喪心病狂的 95% off(0.5折!)

這是什麼概念?我們來看看 Artificial Analysis 統計的「每項智能指數任務」的綜合成本。
GPT-6.1 Sol: 0.72 美元
Gemini 4 Argon: 1.99 美元
GPT-6 Astra: 3.26 美元
Claude Opus 5.5: 5.98 美元
Claude Fable 5.1: 7.63 美元
在智力水平與 GPT-6 Astra 完全持平的情況下,Argon 的成本只有 Astra 的 60%!
雖然它不是絕對價格最便宜的,但在「前沿頂級智力」這個檔位,Argon 的性價比無敵了。
顯然,谷歌此舉意圖明顯:利用自身龐大的TPU算力集群優勢,打一場不對稱的價格戰,逼迫OpenAI和Anthropic降價,放血競爭對手的利潤空間。

1M 上下文輸出限制:從「讀完一本書」到「寫完一本書」
另一個大招,就是大幅擴展了模型token上線,從以前的64K token 提升到 1M token。
Argon將輸出上限直接拉升至100萬Token,這就意味着模型擁有了前所未有的「思考餘量」。
用谷歌的話說,當模型擁有足夠的空間進行深度思考,並在單次運行中生成數十萬 token 時,它就能在推理中達到新的深度層次,一次性解決棘手問題。


現在,AI在完成複雜推理時,再也不會說到一半斷氣了。
這種深度的連續推理能力,直接讓Argon在各大基準測試中「屠榜」。
DeepSWE v1.1(真實長程軟件工程能力): 取得 77.9% 的 SOTA 成績。
Vals Index(衡量金融、編程、法律綜合經濟價值): 位列第一(68.9%)。
AutomationBench(Zapier評估的企業端到端執行能力): 以 51.3% 拿下頭名。
LVBench(多模態長視頻理解): 拿到 91.7% 的超高分。
Blueprint-Bench 2(3D理解):位列第一
|
|
|
內部實戰曝光:Argon在谷歌幹下的三件大事
說起來,谷歌這個模型為什麼叫「Argon」?
Argon,化學元素氬,是一種惰性氣體。古希臘語中,ἀργόν (argos) 的意思是「懶惰的」。

與「氬」同族的化學元素「氖」,此前被 OpenAI 原後訓練研究副總裁發布了同名模型「Periodic Neon」
這次,Gemini 4打破了以往「Pro / Flash / Ultra」的傳統後綴。
據悉,在正式發布前,「Argon」其實只是谷歌內部開發的一個代號,外界曾一度猜測它就是Gemini 4 Pro。

Gemini 4 Argon和當時爆料的「Gemini 4 Pro」主要區別就是輸出上限不一樣。
結果發布時,谷歌直接把這個代號「轉正」了。總之目前還沒有官方解釋。
據報道,在全面發布之前,數千名谷歌員工已經將Argon深度接入了日常研發,而且它幹下了三件驚人的大事。

第一件,就是狂省300 TiB內存,幫谷歌省下天價電費。
由Argon組成的智能體團隊,自主分析了谷歌全網海量的性能分析遙測數據,敏銳地抓住了內存優化的空間,並自主提交了修改建議。
這些代碼上線後,直接為谷歌釋放了超過300 TiB的寶貴內存!
不僅如此,預計後續總節省量可達500 TiB到1 PiB。在谷歌的體量下,這背後節約的是以千萬美元計的電費和服務器採購成本。
第二件,就是重寫了80萬行系統內核代碼。
搞開發的都知道,重構C/C++內核代碼,稍微漏掉一個指針,或者搞錯一個內存分配,整個系統就會瞬間崩潰。
但Argon正在主導一項浩大的工程:將谷歌底層的C/C++代碼遷移到以「內存安全」著稱的Rust語言。
目前,這個AI經手的內核代碼規模已經超過了80萬行(包括Fuchsia Zircon內核)。
當然,這些重構在部署前進行了嚴格的自動化審計和人工審查。但讓AI觸碰80萬行內核,這簡直是人類向AI下放自主權的里程碑級大事。
第三件,就是手撕3.2萬行SIMD底層指令,視頻解碼飆升2.7倍。
這是最硬核的一個案例。谷歌的開源視頻解碼項目libgav1裏,有一段3.2萬行的SIMD代碼,人類程序員寫起來都極其痛苦。
Argon智能體通過多輪編譯實驗、研究編譯器輸出,直接用安全的Rust語言重寫了這3.2萬行代碼!
結果是:新版本的運行速度比原Rust移植版本快了整整2.7倍,性能直接持平高度優化的C++版本,而且輸出的視頻畫面每一幀都一模一樣,完美替代!
kimmonismus評價說:「這些都是在谷歌已經運營的基礎設施裏、成本極高的工程活。這次發布,可能比大家以為的要重要得多!」


網安界「天網」來了:無護欄版本首度曝光
而且, Argon 在網絡安全防禦上能力也很恐怖。它已經是一個能「自主發現、驗證、生成PoC、並修補高危漏洞」的全自動白帽黑客。
在 CWE-bench v1(漏洞修復能力評估)上,Argon以 68% 的得分並列行業第一。

更震撼的是實戰。雲安全巨頭 Wiz 已經在其「Scan for Good」項目中接入了 Argon。
在一次早期演示中,Argon 成功挖出了全球多家醫院正在使用的醫療軟件中的重大關鍵漏洞,這個漏洞隱藏之深,連此前的幾代前沿模型都完全漏掉了。
因為深知這把雙刃劍的威力,谷歌採取了極其謹慎的「分層釋放策略」。
1.無護欄特供版(No-guardrail): 僅通過 Fairwind 計劃,向部分受信任的網絡防禦機構(如Wiz)和谷歌內部團隊開放。
2.受限API版: 積極參與美國政府的自願發布前審查。
3.公衆版: 後續才逐步推送給付費 API 開發者和 Google AI Ultra 訂閱用戶。
在全面開放前,谷歌甚至部署了極端的「系統加固」——在高風險訓練前將沙箱環境徹底物理級密封隔離;並且實時監控模型的思維鏈,一旦發現模型企圖偏離用戶意圖,系統會立刻「拔網線」。
谷歌特意說明:這些監控數據絕對不會反饋到訓練集中,以防止模型「學精了」從而僞裝思維來逃避監管。
研發內幕大揭祕:谷歌的「至暗時刻」
這次發布背後,其實掩藏着谷歌AI部門長達幾個月的焦慮。
據彭博社報道,Argon的誕生可謂是「踩着屍體上位」。
首先,5月I/O大會上承諾的Gemini 3.5 Pro夭折了。
本來,谷歌說的是6月發布,但直接難產了,這種級別的模型訓練,單次成本高達4億美元!
再加上頂級AI研究員的天價薪資,這波取消讓谷歌付出了慘痛代價。
而且,據爆料,雖然 Argon 跑分無敵,但在谷歌內部,其實存在強烈的懷疑情緒。

有能夠直接接觸內部評估的員工爆料:Argon 的編程能力「參差不齊」。它在處理前端設計時錶現掙扎。
AI專家 Edwin Chen 更是直言不諱地指出了行業的通病——「Benchmaxxing」(刷榜綜合症)。

工程師們為了讓模型在基準測試中拿高分,瘋狂讓模型適應特定語言的代碼題,卻忽略了讓模型開發出「真正好用、設計精良的應用」。
據報道,有谷歌員工認為內部存在「廣泛共識」——Gemini 4處於前沿水平,而且否認新模型在實際編程任務中表現不佳。

另外,就是人才流失與高層大洗牌。
在這幾個月的陣痛期,谷歌流失了大量明星研究員。前有Jeff Dean的淡出,後有諾獎得主 John Jumper 以及核心發明人 Noam Shazeer 的離去。
今年8月,Demis Hassabis 更是升任董事長,將 DeepMind 經營權交給了副手 Koray Kavukcuoglu。
面對內部質疑,Kavukcuoglu 在上周發聲穩住軍心:「我向團隊致以最高的信任。在我看來,我們永遠都會處於最前沿是一件確定的事。」
谷歌太需要 Argon 的成功了。
因為 Gemini 模型支撐着谷歌從搜索到 Maps、Gmail 的整個帝國,一旦模型掉隊,這些擁有超10億用戶的入口級產品,隨時可能被 OpenAI 和 Anthropic 蠶食。

AI三強格局大洗牌:終局遠未到來
在 Argon 發布之前,長達7個月的時間裏,谷歌一直處於非常被動挨打的局面。
Gemini 4 Argon 的發布,也並沒有徹底打垮對手,但它成功地將谷歌重新拉回了牌桌,形成了三強格局鼎立格局。
1.Google(Gemini 4 Argon): 強勢迴歸頂尖實驗室行列。在企業知識工作、超長上下文處理(1M輸出)、網絡安全以及多模態上確立了護城河。
2.OpenAI(GPT-6 Astra): 依然是行業的標杆,在科學、數學終端任務和 Agentic Coding上處於領先。
3.Anthropic(Claude 系列): 還是程序員的心頭好。在最新的 Terminal-Bench 4.0 等硬核編程智能體任務上,Claude Fable 5.1 依然領先。
總而言之,當前的格局是:沒有絕對的霸主,只有一時的交替領先。

不過,Argon 1.99美元的價格屠刀,確實在競家的基本盤上撕開了一道口子。
AGI最後一站RSI開始了。

參考資料:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon


