Gemini 4震撼发布,已实现RSI?谷歌80万行内核已被重写

新智元
Oct 01

谷歌又回来了!

就在刚刚,谷歌正式发布了新一代前沿AI模型——Gemini 4 Argon。

沉寂了半年多,被GPT-6和Claude 5按在地上摩擦后,这次谷歌直接掀翻了牌桌!

Gemini 4 Argon,是谷歌 7 个月来首款非 Flash 级专有模型。

在文本竞技场(Text Arena)中,刚刚发布的Gemini 4 Argon排名第一,得分1533碾压Opus 5.5。

在权威的Artificial Analysis智能指数上,Gemini 4 Argon斩获53分,直接追平GPT-6 Astra,领先GPT-6.1 Sol。

在成本上,谷歌祭出了丧心病狂的“骨折价”:单任务成本仅需1.99美元,只有GPT-6 Astra的60%!直接处于帕累托前沿。

在能力上,它史无前例地将单次输出上限拉升至100万Token,甚至在谷歌内部直接用安全语言重写了80万行底层系统内核代码。

在Vals RSI指数上, Gemini超过 GPT-6 Astra,超过了30%!

目前,该模型只开放给 Google Fairwind 计划里的一批网络安全防御方,之后会开放给给付费 API 用户和 AI Ultra 订阅者。

一位谷歌DeepMind研究员在X上疑似玩梗:RSI来了,没什么可教它的,是时候去追逐我的咖啡师梦想了。不过随后又秒删。

不过,至少有一点可以确定:谷歌又回来了。

毕竟,Argon只是Gemini 4的入门款。

谷歌掀起价格战:1.99美元,直接背刺GPT-6

这次,谷歌的定价堪称惊人。

百万输入 Token: 2美元

百万输出 Token: 10美元

缓存输入折扣: 丧心病狂的 95% off(0.5折!)

这是什么概念?我们来看看 Artificial Analysis 统计的“每项智能指数任务”的综合成本。

GPT-6.1 Sol: 0.72 美元

Gemini 4 Argon: 1.99 美元

GPT-6 Astra: 3.26 美元

Claude Opus 5.5: 5.98 美元

Claude Fable 5.1: 7.63 美元

在智力水平与 GPT-6 Astra 完全持平的情况下,Argon 的成本只有 Astra 的 60%!

虽然它不是绝对价格最便宜的,但在“前沿顶级智力”这个档位,Argon 的性价比无敌了。

显然,谷歌此举意图明显:利用自身庞大的TPU算力集群优势,打一场不对称的价格战,逼迫OpenAI和Anthropic降价,放血竞争对手的利润空间。

1M 上下文输出限制:从“读完一本书”到“写完一本书”

另一个大招,就是大幅扩展了模型token上线,从以前的64K token 提升到 1M token。

Argon将输出上限直接拉升至100万Token,这就意味着模型拥有了前所未有的“思考余量”。

用谷歌的话说,当模型拥有足够的空间进行深度思考,并在单次运行中生成数十万 token 时,它就能在推理中达到新的深度层次,一次性解决棘手问题。

现在,AI在完成复杂推理时,再也不会说到一半断气了。

这种深度的连续推理能力,直接让Argon在各大基准测试中“屠榜”。

DeepSWE v1.1(真实长程软件工程能力): 取得 77.9% 的 SOTA 成绩。

Vals Index(衡量金融、编程、法律综合经济价值): 位列第一(68.9%)。

AutomationBench(Zapier评估的企业端到端执行能力): 以 51.3% 拿下头名。

LVBench(多模态长视频理解): 拿到 91.7% 的超高分。

Blueprint-Bench 2(3D理解):位列第一

内部实战曝光:Argon在谷歌干下的三件大事

说起来,谷歌这个模型为什么叫“Argon”?

Argon,化学元素氩,是一种惰性气体。古希腊语中,ἀργόν (argos) 的意思是“懒惰的”。

与“氩”同族的化学元素“氖”,此前被 OpenAI 原后训练研究副总裁发布了同名模型“Periodic Neon”

这次,Gemini 4打破了以往“Pro / Flash / Ultra”的传统后缀。

据悉,在正式发布前,“Argon”其实只是谷歌内部开发的一个代号,外界曾一度猜测它就是Gemini 4 Pro。

Gemini 4 Argon和当时爆料的“Gemini 4 Pro”主要区别就是输出上限不一样。

结果发布时,谷歌直接把这个代号“转正”了。总之目前还没有官方解释。

据报道,在全面发布之前,数千名谷歌员工已经将Argon深度接入了日常研发,而且它干下了三件惊人的大事。

第一件,就是狂省300 TiB内存,帮谷歌省下天价电费。

由Argon组成的智能体团队,自主分析了谷歌全网海量的性能分析遥测数据,敏锐地抓住了内存优化的空间,并自主提交了修改建议。

这些代码上线后,直接为谷歌释放了超过300 TiB的宝贵内存!

不仅如此,预计后续总节省量可达500 TiB到1 PiB。在谷歌的体量下,这背后节约的是以千万美元计的电费和服务器采购成本。

第二件,就是重写了80万行系统内核代码。

搞开发的都知道,重构C/C++内核代码,稍微漏掉一个指针,或者搞错一个内存分配,整个系统就会瞬间崩溃。

但Argon正在主导一项浩大的工程:将谷歌底层的C/C++代码迁移到以“内存安全”著称的Rust语言。

目前,这个AI经手的内核代码规模已经超过了80万行(包括Fuchsia Zircon内核)。

当然,这些重构在部署前进行了严格的自动化审计和人工审查。但让AI触碰80万行内核,这简直是人类向AI下放自主权的里程碑级大事。

第三件,就是手撕3.2万行SIMD底层指令,视频解码飙升2.7倍。

这是最硬核的一个案例。谷歌的开源视频解码项目libgav1里,有一段3.2万行的SIMD代码,人类程序员写起来都极其痛苦。

Argon智能体通过多轮编译实验、研究编译器输出,直接用安全的Rust语言重写了这3.2万行代码!

结果是:新版本的运行速度比原Rust移植版本快了整整2.7倍,性能直接持平高度优化的C++版本,而且输出的视频画面每一帧都一模一样,完美替代!

kimmonismus评价说:“这些都是在谷歌已经运营的基础设施里、成本极高的工程活。这次发布,可能比大家以为的要重要得多!”

网安界“天网”来了:无护栏版本首度曝光

而且, Argon 在网络安全防御上能力也很恐怖。它已经是一个能“自主发现、验证、生成PoC、并修补高危漏洞”的全自动白帽黑客。

在 CWE-bench v1(漏洞修复能力评估)上,Argon以 68% 的得分并列行业第一。

更震撼的是实战。云安全巨头 Wiz 已经在其“Scan for Good”项目中接入了 Argon。

在一次早期演示中,Argon 成功挖出了全球多家医院正在使用的医疗软件中的重大关键漏洞,这个漏洞隐藏之深,连此前的几代前沿模型都完全漏掉了。

因为深知这把双刃剑的威力,谷歌采取了极其谨慎的“分层释放策略”。

1.无护栏特供版(No-guardrail): 仅通过 Fairwind 计划,向部分受信任的网络防御机构(如Wiz)和谷歌内部团队开放。

2.受限API版: 积极参与美国政府的自愿发布前审查。

3.公众版: 后续才逐步推送给付费 API 开发者和 Google AI Ultra 订阅用户。

在全面开放前,谷歌甚至部署了极端的“系统加固”——在高风险训练前将沙箱环境彻底物理级密封隔离;并且实时监控模型的思维链,一旦发现模型企图偏离用户意图,系统会立刻“拔网线”。

谷歌特意说明:这些监控数据绝对不会反馈到训练集中,以防止模型“学精了”从而伪装思维来逃避监管。

研发内幕大揭秘:谷歌的“至暗时刻”

这次发布背后,其实掩藏着谷歌AI部门长达几个月的焦虑。

据彭博社报道,Argon的诞生可谓是“踩着尸体上位”。

首先,5月I/O大会上承诺的Gemini 3.5 Pro夭折了。

本来,谷歌说的是6月发布,但直接难产了,这种级别的模型训练,单次成本高达4亿美元!

再加上顶级AI研究员的天价薪资,这波取消让谷歌付出了惨痛代价。

而且,据爆料,虽然 Argon 跑分无敌,但在谷歌内部,其实存在强烈的怀疑情绪。

有能够直接接触内部评估的员工爆料:Argon 的编程能力“参差不齐”。它在处理前端设计时表现挣扎。

AI专家 Edwin Chen 更是直言不讳地指出了行业的通病——“Benchmaxxing”(刷榜综合症)。

工程师们为了让模型在基准测试中拿高分,疯狂让模型适应特定语言的代码题,却忽略了让模型开发出“真正好用、设计精良的应用”。

据报道,有谷歌员工认为内部存在“广泛共识”——Gemini 4处于前沿水平,而且否认新模型在实际编程任务中表现不佳。

另外,就是人才流失与高层大洗牌。

在这几个月的阵痛期,谷歌流失了大量明星研究员。前有Jeff Dean的淡出,后有诺奖得主 John Jumper 以及核心发明人 Noam Shazeer 的离去。

今年8月,Demis Hassabis 更是升任董事长,将 DeepMind 经营权交给了副手 Koray Kavukcuoglu。

面对内部质疑,Kavukcuoglu 在上周发声稳住军心:“我向团队致以最高的信任。在我看来,我们永远都会处于最前沿是一件确定的事。”

谷歌太需要 Argon 的成功了。

因为 Gemini 模型支撑着谷歌从搜索到 Maps、Gmail 的整个帝国,一旦模型掉队,这些拥有超10亿用户的入口级产品,随时可能被 OpenAI 和 Anthropic 蚕食。

AI三强格局大洗牌:终局远未到来

在 Argon 发布之前,长达7个月的时间里,谷歌一直处于非常被动挨打的局面。

Gemini 4 Argon 的发布,也并没有彻底打垮对手,但它成功地将谷歌重新拉回了牌桌,形成了三强格局鼎立格局。

1.Google(Gemini 4 Argon): 强势回归顶尖实验室行列。在企业知识工作、超长上下文处理(1M输出)、网络安全以及多模态上确立了护城河。

2.OpenAI(GPT-6 Astra): 依然是行业的标杆,在科学、数学终端任务和 Agentic Coding上处于领先。

3.Anthropic(Claude 系列): 还是程序员的心头好。在最新的 Terminal-Bench 4.0 等硬核编程智能体任务上,Claude Fable 5.1 依然领先。

总而言之,当前的格局是:没有绝对的霸主,只有一时的交替领先。

不过,Argon 1.99美元的价格屠刀,确实在竞家的基本盘上撕开了一道口子。

AGI最后一站RSI开始了。

参考资料:

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10