Gemini 4震撼發布,已實現RSI?谷歌80萬行內核已被重寫

新智元
10/01

谷歌又回來了!

就在啱啱,谷歌正式發布了新一代前沿AI模型——Gemini 4 Argon。

沉寂了半年多,被GPT-6和Claude 5按在地上摩擦後,這次谷歌直接掀翻了牌桌!

Gemini 4 Argon,是谷歌 7 個月來首款非 Flash 級專有模型。

在文本競技場(Text Arena)中,啱啱發布的Gemini 4 Argon排名第一,得分1533碾壓Opus 5.5。

在權威的Artificial Analysis智能指數上,Gemini 4 Argon斬獲53分,直接追平GPT-6 Astra,領先GPT-6.1 Sol。

在成本上,谷歌祭出了喪心病狂的「骨折價」:單任務成本僅需1.99美元,只有GPT-6 Astra的60%!直接處於帕累託前沿。

在能力上,它史無前例地將單次輸出上限拉升至100萬Token,甚至在谷歌內部直接用安全語言重寫了80萬行底層系統內核代碼。

在Vals RSI指數上, Gemini超過 GPT-6 Astra,超過了30%!

目前,該模型只開放給 Google Fairwind 計劃裏的一批網絡安全防禦方,之後會開放給給付費 API 用戶和 AI Ultra 訂閱者。

一位谷歌DeepMind研究員在X上疑似玩梗:RSI來了,沒什麼可教它的,是時候去追逐我的咖啡師夢想了。不過隨後又秒刪。

不過,至少有一點可以確定:谷歌又回來了。

畢竟,Argon只是Gemini 4的入門款。

谷歌掀起價格戰:1.99美元,直接背刺GPT-6

這次,谷歌的定價堪稱驚人。

百萬輸入 Token: 2美元

百萬輸出 Token: 10美元

緩存輸入折扣: 喪心病狂的 95% off(0.5折!)

這是什麼概念?我們來看看 Artificial Analysis 統計的「每項智能指數任務」的綜合成本。

GPT-6.1 Sol: 0.72 美元

Gemini 4 Argon: 1.99 美元

GPT-6 Astra: 3.26 美元

Claude Opus 5.5: 5.98 美元

Claude Fable 5.1: 7.63 美元

在智力水平與 GPT-6 Astra 完全持平的情況下,Argon 的成本只有 Astra 的 60%!

雖然它不是絕對價格最便宜的,但在「前沿頂級智力」這個檔位,Argon 的性價比無敵了。

顯然,谷歌此舉意圖明顯:利用自身龐大的TPU算力集群優勢,打一場不對稱的價格戰,逼迫OpenAI和Anthropic降價,放血競爭對手的利潤空間。

1M 上下文輸出限制:從「讀完一本書」到「寫完一本書」

另一個大招,就是大幅擴展了模型token上線,從以前的64K token 提升到 1M token。

Argon將輸出上限直接拉升至100萬Token,這就意味着模型擁有了前所未有的「思考餘量」。

用谷歌的話說,當模型擁有足夠的空間進行深度思考,並在單次運行中生成數十萬 token 時,它就能在推理中達到新的深度層次,一次性解決棘手問題。

現在,AI在完成複雜推理時,再也不會說到一半斷氣了。

這種深度的連續推理能力,直接讓Argon在各大基準測試中「屠榜」。

DeepSWE v1.1(真實長程軟件工程能力): 取得 77.9% 的 SOTA 成績。

Vals Index(衡量金融、編程、法律綜合經濟價值): 位列第一(68.9%)。

AutomationBench(Zapier評估的企業端到端執行能力): 以 51.3% 拿下頭名。

LVBench(多模態長視頻理解): 拿到 91.7% 的超高分。

Blueprint-Bench 2(3D理解):位列第一

內部實戰曝光:Argon在谷歌幹下的三件大事

說起來,谷歌這個模型為什麼叫「Argon」?

Argon,化學元素氬,是一種惰性氣體。古希臘語中,ἀργόν (argos) 的意思是「懶惰的」。

與「氬」同族的化學元素「氖」,此前被 OpenAI 原後訓練研究副總裁發布了同名模型「Periodic Neon」

這次,Gemini 4打破了以往「Pro / Flash / Ultra」的傳統後綴。

據悉,在正式發布前,「Argon」其實只是谷歌內部開發的一個代號,外界曾一度猜測它就是Gemini 4 Pro。

Gemini 4 Argon和當時爆料的「Gemini 4 Pro」主要區別就是輸出上限不一樣。

結果發布時,谷歌直接把這個代號「轉正」了。總之目前還沒有官方解釋。

據報道,在全面發布之前,數千名谷歌員工已經將Argon深度接入了日常研發,而且它幹下了三件驚人的大事。

第一件,就是狂省300 TiB內存,幫谷歌省下天價電費。

由Argon組成的智能體團隊,自主分析了谷歌全網海量的性能分析遙測數據,敏銳地抓住了內存優化的空間,並自主提交了修改建議。

這些代碼上線後,直接為谷歌釋放了超過300 TiB的寶貴內存!

不僅如此,預計後續總節省量可達500 TiB到1 PiB。在谷歌的體量下,這背後節約的是以千萬美元計的電費和服務器採購成本。

第二件,就是重寫了80萬行系統內核代碼。

搞開發的都知道,重構C/C++內核代碼,稍微漏掉一個指針,或者搞錯一個內存分配,整個系統就會瞬間崩潰。

但Argon正在主導一項浩大的工程:將谷歌底層的C/C++代碼遷移到以「內存安全」著稱的Rust語言。

目前,這個AI經手的內核代碼規模已經超過了80萬行(包括Fuchsia Zircon內核)。

當然,這些重構在部署前進行了嚴格的自動化審計和人工審查。但讓AI觸碰80萬行內核,這簡直是人類向AI下放自主權的里程碑級大事。

第三件,就是手撕3.2萬行SIMD底層指令,視頻解碼飆升2.7倍。

這是最硬核的一個案例。谷歌的開源視頻解碼項目libgav1裏,有一段3.2萬行的SIMD代碼,人類程序員寫起來都極其痛苦。

Argon智能體通過多輪編譯實驗、研究編譯器輸出,直接用安全的Rust語言重寫了這3.2萬行代碼!

結果是:新版本的運行速度比原Rust移植版本快了整整2.7倍,性能直接持平高度優化的C++版本,而且輸出的視頻畫面每一幀都一模一樣,完美替代!

kimmonismus評價說:「這些都是在谷歌已經運營的基礎設施裏、成本極高的工程活。這次發布,可能比大家以為的要重要得多!」

網安界「天網」來了:無護欄版本首度曝光

而且, Argon 在網絡安全防禦上能力也很恐怖。它已經是一個能「自主發現、驗證、生成PoC、並修補高危漏洞」的全自動白帽黑客。

在 CWE-bench v1(漏洞修復能力評估)上,Argon以 68% 的得分並列行業第一。

更震撼的是實戰。雲安全巨頭 Wiz 已經在其「Scan for Good」項目中接入了 Argon。

在一次早期演示中,Argon 成功挖出了全球多家醫院正在使用的醫療軟件中的重大關鍵漏洞,這個漏洞隱藏之深,連此前的幾代前沿模型都完全漏掉了。

因為深知這把雙刃劍的威力,谷歌採取了極其謹慎的「分層釋放策略」。

1.無護欄特供版(No-guardrail): 僅通過 Fairwind 計劃,向部分受信任的網絡防禦機構(如Wiz)和谷歌內部團隊開放。

2.受限API版: 積極參與美國政府的自願發布前審查。

3.公衆版: 後續才逐步推送給付費 API 開發者和 Google AI Ultra 訂閱用戶。

在全面開放前,谷歌甚至部署了極端的「系統加固」——在高風險訓練前將沙箱環境徹底物理級密封隔離;並且實時監控模型的思維鏈,一旦發現模型企圖偏離用戶意圖,系統會立刻「拔網線」。

谷歌特意說明:這些監控數據絕對不會反饋到訓練集中,以防止模型「學精了」從而僞裝思維來逃避監管。

研發內幕大揭祕:谷歌的「至暗時刻」

這次發布背後,其實掩藏着谷歌AI部門長達幾個月的焦慮。

據彭博社報道,Argon的誕生可謂是「踩着屍體上位」。

首先,5月I/O大會上承諾的Gemini 3.5 Pro夭折了。

本來,谷歌說的是6月發布,但直接難產了,這種級別的模型訓練,單次成本高達4億美元!

再加上頂級AI研究員的天價薪資,這波取消讓谷歌付出了慘痛代價。

而且,據爆料,雖然 Argon 跑分無敵,但在谷歌內部,其實存在強烈的懷疑情緒。

有能夠直接接觸內部評估的員工爆料:Argon 的編程能力「參差不齊」。它在處理前端設計時錶現掙扎。

AI專家 Edwin Chen 更是直言不諱地指出了行業的通病——「Benchmaxxing」(刷榜綜合症)。

工程師們為了讓模型在基準測試中拿高分,瘋狂讓模型適應特定語言的代碼題,卻忽略了讓模型開發出「真正好用、設計精良的應用」。

據報道,有谷歌員工認為內部存在「廣泛共識」——Gemini 4處於前沿水平,而且否認新模型在實際編程任務中表現不佳。

另外,就是人才流失與高層大洗牌。

在這幾個月的陣痛期,谷歌流失了大量明星研究員。前有Jeff Dean的淡出,後有諾獎得主 John Jumper 以及核心發明人 Noam Shazeer 的離去。

今年8月,Demis Hassabis 更是升任董事長,將 DeepMind 經營權交給了副手 Koray Kavukcuoglu。

面對內部質疑,Kavukcuoglu 在上周發聲穩住軍心:「我向團隊致以最高的信任。在我看來,我們永遠都會處於最前沿是一件確定的事。」

谷歌太需要 Argon 的成功了。

因為 Gemini 模型支撐着谷歌從搜索到 Maps、Gmail 的整個帝國,一旦模型掉隊,這些擁有超10億用戶的入口級產品,隨時可能被 OpenAI 和 Anthropic 蠶食。

AI三強格局大洗牌:終局遠未到來

在 Argon 發布之前,長達7個月的時間裏,谷歌一直處於非常被動挨打的局面。

Gemini 4 Argon 的發布,也並沒有徹底打垮對手,但它成功地將谷歌重新拉回了牌桌,形成了三強格局鼎立格局。

1.Google(Gemini 4 Argon): 強勢迴歸頂尖實驗室行列。在企業知識工作、超長上下文處理(1M輸出)、網絡安全以及多模態上確立了護城河。

2.OpenAI(GPT-6 Astra): 依然是行業的標杆,在科學、數學終端任務和 Agentic Coding上處於領先。

3.Anthropic(Claude 系列): 還是程序員的心頭好。在最新的 Terminal-Bench 4.0 等硬核編程智能體任務上,Claude Fable 5.1 依然領先。

總而言之,當前的格局是:沒有絕對的霸主,只有一時的交替領先。

不過,Argon 1.99美元的價格屠刀,確實在競家的基本盤上撕開了一道口子。

AGI最後一站RSI開始了。

參考資料:

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10