谷歌終於交卷了
出品|虎嗅科技組
作者|黃天媛
編輯|苗正卿
頭圖|AI生成
當OpenAI、Anthropic等公司已經把競爭重心推向Agent,Google的新一代旗艦模型才姍姍來遲。
當地時間9月30日,Google正式發布Gemini 4系列首款旗艦模型Gemini 4 Argon。
按照Google的說法,這是一款面向真實軟件工程、企業知識工作和網絡安全防禦的前沿模型,也是目前Gemini家族能力最強的一款模型。
這距離上一款Gemini旗艦模型已經過去了相當長一段時間。
7月彭博報道稱,3.5 Pro已經比原定計劃晚了數月,Google當時仍在集中補強它最大的一塊短板——Coding。
今天,Google直接跳過3.5 Pro,發布了Gemini 4 Argon。
Argon在主流Benchmark上表現亮眼。但彭博報道顯示,一旦進入真實工作狀態,其性能會有所下降。有Google 員工認為,Anthropic和OpenAI的旗艦模型迭代速度已經快於Gemini。
一場遲到,且有爭議的交卷。
長任務能力與低價策略
這一次,Argon的核心升級,在於輸出窗口升級成為100萬Token,是目前已公開商業模型裏最大的輸出窗口。作為對比,GPT-6 Astra的最大輸出只有12.8萬Token,Gemini上一代還僅為6.4萬Token。
按照英文文本粗略折算,相當於一次生成數十萬單詞。這意味着,模型的複雜任務能力被顯著提升,可以一次性處理過去很容易被上下文和輸出長度截斷的複雜任務。
在定價上,也是保持了Google一貫的性價比策略。Argon首發推廣價為每百萬Token輸入2美元、輸出10美元——輸入價格與Gemini 3.1 Pro持平,輸出反而從12美元降至10美元。
谷歌官方表示,Argon還在Coding和深度研究方面有非常顯著的進步。
在谷歌內部,已經有數千名員工使用模型完成任務:
算法優化:在量子計算團隊,一個Argon參與的算法優化項目只用了幾分鐘,就把公開基線提高了40%
代碼遷移:在Google開源的視頻解碼器libgav1中,Argon Agent還基於編譯器輸出進行了多輪性能實驗,替換了3.2萬行SIMD代碼。按照Google公布的結果,最終得到的Rust版本運行速度達到原Rust移植版的2.7倍,同時保持相同的視頻輸出結果。
再來經典跑分環節。
先看它最想證明自己的編程能力。Argon在衡量真實、長周期軟件工程能力的DeepSWE v1.1上,拿下了77.9%的新高。谷歌公布的對照成績裏,Claude Opus 5.5是74.2%,GPT-6 Astra是74.1%。Argon高了約4個百分點。
而企業任務中,AutomationBench顯示,Argon拿到51.3%,Opus 5.5和Astra分別是42.5%、41.4%,差距擴大到了接近10個百分點。
金融研究也有類似表現。Vals Finance Agent v2中,Argon拿到65.4%,超過Opus 5.5的58.6%和Astra的53.5%。
法律任務的數字更搶眼。Harvey的法律Agent測試裏,Argon得分19.6%,谷歌列出的三個對手都沒超過7%。
多模態方面,Google 表示,模型可以分析專業圖表、從長視頻裏識別細節,並根據一系列文檔採取行動。在長視頻理解Benchmark LVBench中,它得到91.7%,Google稱其達到當前最佳水平。
而在目前廣泛關注的網絡安全方面。Argon在防禦型網絡安全任務上的能力,並用它驅動網絡安全Agent,不僅可以尋找漏洞,還能自主驗證漏洞,並進一步生成補丁。
在與安全公司Wiz合作的「Scan for Good」項目,Argon已經在一套被全球醫院使用的醫療軟件中發現一個高危漏洞,該漏洞可能導致敏感個人信息泄露,而此前測試的其他前沿模型均沒有發現這一問題。
在專門測試漏洞修復能力的CWE-bench v1上,Argon得到68%,並列第一。在Wiz自己的黑盒滲透測試中,它還可以在看不到源代碼的情況下分析真實Web系統,發現攻擊面、尋找漏洞,並生成PoC來驗證漏洞是否真的存在。
但目前Argon 不走全面開放路線,而是通過「Fairwind 計劃」先向一小批可信的網絡安全防禦者推出,同時正參與美國政府的自願性發布前模型准入流程。後續纔會逐步向開發者、企業和消費者開放。
不過,Argon這份漂亮成績單也不是沒有爭議。
最直接的質疑來自Google內部。彭博援引直接接觸Gemini 4項目的人士稱,Argon雖然在主流Benchmark上表現亮眼,但員工真正把它放進工作流後,表現會明顯下降,尤其在部分Coding和界面設計任務上仍會「卡殼」。
但Google方面否認了「真實Coding能力明顯落後」的說法,稱公司內部普遍認為Gemini 4已經處於前沿水平。
獨立評測網站提醒,Argon主要在長上下文、企業知識工作和部分軟件工程任務上尤其突出,並不是一個可以橫掃所有Coding場景的「絕對第一」。
Google的現狀
Gemini 4的出現,結束了Google過去近一年略顯混亂的旗艦模型節奏。
今年以來,Google並不是沒有發模型。相反,Flash產品線的迭代非常快,3.6、3.7、3.8在幾個月內接連上線。
但今年6月本該出現的Gemini 3.5 Pro遲遲沒有交付。到7月,Google仍然只能告訴外界,模型還在合作伙伴中有限測試。最終,這款模型被整個取消,Google直接跳到了Gemini 4。
這段空窗期讓外界產生了非常多質疑,Google是不是又掉隊了?
路透社稱,Gemini 3.5 Pro的延期與Google DeepMind內部調整、人員變動等因素有關。Google DeepMind 的聯合創始人兼CEO Demis Hassabis淡出主要管理職責,包括Jeff Dean在內的多名Gemini核心負責人離職,OpenAI和Anthropic同期還從Google挖走了明星研究人員。
今年7月,Google CEO桑達爾·皮查伊也在財報電話會上,罕見地花了不少篇幅為Google的AI戰略辯護。
他反駁Google正在AI競爭中失去位置,而是強調外界「不應該只看一款Pro模型」,Google的Flash系列仍在快速迭代,Gemini 4將帶來更大躍升。同時真正衡量Google AI競爭力,還要把Cloud、自研TPU和整個產品生態一起算進去。
確實,如果把視線從模型排行榜拉回到Google這家公司,「掉隊」又很難成立。
Alphabet最新公布的2026年第二季度營收達到1198億美元,按年增長24%。
其中Google Cloud收入按年暴漲82%至248億美元,營業利潤從去年同期的28億美元升至88億美元。Google稱,Gemini模型目前每分鐘處理約220億個API Token,Gemini App月活用戶已經達到9.5億,接近九成財富100強企業正在使用Gemini Enterprise。
連一度被認為最容易被ChatGPT顛覆的搜索業務,也還沒有出現衰退。
二季度Google Search及其他業務收入按年增長17%至632.7億美元。Alphabet表示,AI功能正在推動搜索查詢量增長。
這也是Google和大部分AI創業公司最大的不同。Google手裏則已經有Search、Cloud、YouTube、Android、Chrome,以及自己的TPU基礎設施。
少有一家企業有它那麼巨大的分發和資源優勢。但船大難掉頭,擁有的東西越多,需要協調的人、資源也越多。
在各家都已經步入Agent大戰的時候,Google的船頭在哪呢?
本內容來源於網絡,觀點僅代表作者本人,不代表虎嗅立場。如涉及版權問題請聯繫 hezuo@huxiu.com,我們將及時覈實並處理。
End
想漲知識 關注虎嗅視頻號!