谷歌反擊!Gemini 4 Argon性能比肩Astra,成本僅60%

智東西
10/01

智東西

編譯 | 楊京麗

編輯 | 心緣

智東西10月1日消息,今天凌晨,谷歌發布新一代旗艦模型Gemini 4 Argon,重點面向軟件工程、法律與金融等企業知識工作,以及網絡安全防禦等複雜、長周期任務。

在衡量長程軟件工程能力的DeepSWE v1.1測試、評估金融、編程、法律和稅務等企業知識工作的Vals Index、測試企業端到端自動化執行能力的AutomationBench,以及考察長視頻理解能力的LVBench中,Gemini 4 Argon均領先GPT-6 Astra、Claude Fable 5.1和Claude Opus 5.5等模型;在評估漏洞修復能力的CWE-bench v1中,Argon以68%的成績與GPT-6 Astra並列第一。

在Text Arena的模型成本與得分對比中,Gemini 4 Argon High以1525分和每百萬Token 8美元的混合價格,進入成本-性能前沿。

目前,在Artificial Analysis Intelligence Index中,Gemini 4 Argon得分53分,僅落後於Claude Opus 5.5和Claude Sonnet 5.5,得分與Claude Fable 5.1、GPT-6 Astra並列。

▲Gemini 4 Argon在Artificial Analysis上測評情況(圖源:Artificial Analysis)

不過,彭博社援引知情人士稱,部分谷歌員工認為,Gemini 4雖然在行業基準測試中表現亮眼,但在實際工作中並不總能達到同等水平,尤其是在部分編程任務上仍較為喫力,這與谷歌當天發布的測試成績形成反差。

Gemini 4 Argon現已通過「Fairwind計劃」向一批經過篩選的網絡安全防禦團隊開放。谷歌計劃先收集早期測試反饋、繼續完善安全護欄,隨後逐步向開發者、企業和消費者開放,首批用戶將包括付費API客戶和Google AI Ultra訂閱者。

Argon API初始價格為每百萬輸入Token 2美元(約合人民幣13.4元)、每百萬輸出Token 10美元(約合人民幣67元),緩存輸入Token價格在輸入Token基礎上降低95%,即每百萬Token約0.1美元(約合人民幣0.67元)。

根據Artificial Analysis,按折扣定價,Gemini 4 Argon的每任務成本為1.99美元,較GPT-6 Astra(max)降低40%。

▲Gemini 4 Argon每任務成本與其他模型對比(圖源:Artificial Analysis)

谷歌首席執行官桑達爾·皮查伊(Sundar Pichai)稱,外界對下一代模型的討論很多,因此希望儘早展示Gemini 4 Argon。谷歌內部團隊已廣泛將其用於編程、量子計算等工作,反饋良好。

▲皮查伊發文官宣Gemini 4 Argon(圖源:X)

一位X用戶認為,Gemini 4對提示詞格外敏感,輸出內容和風格受提示詞影響的程度超過其他模型,默認風格不佳,但增加一句提示詞就容易改善。他還展示了用不同提示詞復刻《樂高星球大戰》關卡的效果。

▲開發者對於Gemini 4 Argon的評價(圖源:X)

另一位開發者認為,在一次生成細節豐富、美感出色的3D場景方面,Gemini 4 Argon尚未達到Opus 5的水平。Gemini 4 Argon在畫面細節上,效果略顯粗糙。

▲開發者對比Gemini 4 Argon(上)和Claude Opus 5(下)的生成效果(圖源:X)

一、輸出上限提升至100萬Token,編程能力與企業任務測試突出

Gemini 4 Argon將模型輸出Token上限從此前的6.4萬Tokens提升至100萬Tokens,成為目前業內輸出容量最高的模型之一。更大的輸出空間允許模型在單次任務中深度思考,並生成數十萬甚至上百萬Token,用於處理大型代碼庫、複雜研究和多步驟企業流程。

編程方面,Gemini 4 Argon在衡量真實世界長期軟件工程能力的DeepSWE v1.1測試中取得77.9%的成績,刷新該測試的最好紀錄。

在覆蓋金融、編程、法律和稅務等工作的Vals Index中,Argon排名第一。Argon還在Vals Finance Agent v2測試(多步驟金融研究)、Harvey法律Agent測試(法律研究與起草)中取得領先成績。

在Zapier用於評估企業端到端自動化執行能力的AutomationBench中,Argon得分51.3%,位列第一,明顯領先GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5等模型。

Argon的多模態能力也被用於長視頻和專業圖表分析。在評估長視頻理解能力的LVBench中,該模型得分91.7%,達到現有模型最優水平。

二、深入谷歌內部工作流,完成量子算法優化與大規模代碼遷移

在谷歌內部,數千名員工已將Gemini 4 Argon用於日常調試、算法設計、研究和大規模代碼遷移等工作。

谷歌舉例稱,Argon曾幫助量子計算研究人員優化量子算法的時空資源,在數分鐘內將一項公開基線結果提升40%。另外,一組Argon Agent分析了覆蓋谷歌整個服務器集群的性能分析遙測數據,自主識別並實施數據中心內存優化方案。相關方案部署後,可釋放超過300TiB內存,預計總節省量將達到500TiB至1PiB。

Argon Agent還參與了谷歌內部C/C++代碼向Rust的遷移,覆蓋數萬行的核心庫代碼,以及超過80萬行的Fuchsia Zircon內核。考慮到相關係統的重要性,谷歌稱,所有大規模重寫都必須經過自動化和人工審計、仿真測試及代碼審查,確認安全後才能部署到生產環境。

以開源視頻解碼器libgav1為例,Argon Agent通過多輪性能分析和實驗,重寫了約3.2萬行SIMD代碼,使編譯器能夠自動完成向量化。遷移後的Rust版本在保持視頻輸出完全一致的情況下,運行速度達到原Rust版本的2.7倍,性能進一步接近經過優化的C++版本。

三、強化網絡安全能力,可自主發現和修復漏洞

谷歌還針對網絡安全防禦能力對Gemini 4 Argon進行了專項訓練。Argon可以自主發現、驗證並修復軟件漏洞。對於經過信任認證的網絡安全防禦團隊和谷歌內部團隊,谷歌將提供不帶網絡安全護欄的Argon版本,以便其發揮完整的漏洞分析和防禦能力。

網絡安全公司Wiz已通過「Scan for Good」項目使用Argon,為關鍵公共基礎設施免費發現和修復高風險暴露。谷歌稱,在一次早期測試中,Argon發現了一個影響全球醫院所使用醫療軟件的嚴重漏洞,該漏洞可能導致敏感個人信息暴露,且此前的前沿模型沒有識別出這一風險。

在評估漏洞修復能力的CWE-bench v1中,Argon以68%的成績並列第一,得分與Grok 4.7和GPT-6 Astra相當。

谷歌內部的綜合漏洞基準測試顯示,Argon可以在覆蓋20種編程語言的複雜代碼庫中發現多類安全暴露。在Wiz的黑盒滲透測試中,Argon在識別真實網站攻擊面、發現漏洞以及生成概念驗證方面,也超過了此前的Gemini 3.8 Flash Cyber。

四、擴大安全測試,重點防範模型濫用與提示注入

在正式擴大開放前,谷歌將繼續強化四類前沿安全能力。

防範濫用方面,Argon會拒絕可能用於網絡攻擊以及化學、生物、放射性和核武器攻擊的有害請求,同時保留合法的雙重用途科學研究能力。谷歌還在加強對模型內部激活狀態的監測,以識別潛在的濫用行為。

Argon在防禦間接提示注入方面也取得進展。此類攻擊會通過惡意指令或外部上下文劫持模型行為。經過自動化紅隊測試和對抗訓練後,Argon在Gray Swan的間接提示注入測試中取得領先成績。

監測目標偏離方面,為防止Argon在執行任務時越過邊界、採取超出用戶意圖的行動,谷歌部署了目標偏離緩解機制,對Argon的思維鏈和行為進行監測,並在必要時停止執行。谷歌還使用類似系統監測模型訓練過程,並在發現異常時向專門的事件響應團隊發出警報。

強化系統環境方面,隨着前沿模型的能力不斷增強,安全測試也需要與模型能力相匹配的安全環境。按照Agent控制路線圖,谷歌將在高風險訓練或評估開始前,對沙盒環境進行隔離和封閉,以進一步強化安全性。

結語:瞄準複雜Agent任務,實際效果仍待驗證

Gemini 4 Argon在長周期軟件工程、金融和法律Agent任務、長視頻理解及網絡安全防禦等測試中取得多項領先成績,100萬Token輸出上限也增強了其處理大型代碼庫和複雜工作流的能力。

不過,當前多數成績仍來自谷歌披露的內部案例和基準測試,模型尚未全面開放。Argon在真實使用中的穩定性、調用成本、漏洞修復可靠性及安全邊界,仍需等待開發者和企業用戶進一步驗證。

來源:谷歌、Arena、X

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10