Gemini 4震撼发布,已实现RSI?谷歌80万行内核已被重写

新智元
10/01

谷歌又回来了!

就在刚刚,谷歌正式发布了新一代前沿AI模型——Gemini 4 Argon。

沉寂了半年多,被GPT-6和Claude 5按在地上摩擦后,这次谷歌直接掀翻了牌桌!

Gemini 4 Argon,是谷歌 7 个月来首款非 Flash 级专有模型。

在文本竞技场(Text Arena)中,刚刚发布的Gemini 4 Argon排名第一,得分1533碾压Opus 5.5。

在权威的Artificial Analysis智能指数上,Gemini 4 Argon斩获53分,直接追平GPT-6 Astra,领先GPT-6.1 Sol。

在成本上,谷歌祭出了丧心病狂的“骨折价”:单任务成本仅需1.99美元,只有GPT-6 Astra的60%!直接处于帕累托前沿。

在能力上,它史无前例地将单次输出上限拉升至100万Token,甚至在谷歌内部直接用安全语言重写了80万行底层系统内核代码。

在Vals RSI指数上, Gemini超过 GPT-6 Astra,超过了30%!

目前,该模型只开放给 Google Fairwind 计划里的一批网络安全防御方,之后会开放给给付费 API 用户和 AI Ultra 订阅者。

一位谷歌DeepMind研究员在X上疑似玩梗:RSI来了,没什么可教它的,是时候去追逐我的咖啡师梦想了。不过随后又秒删。

不过,至少有一点可以确定:谷歌又回来了。

毕竟,Argon只是Gemini 4的入门款。

谷歌掀起价格战:1.99美元,直接背刺GPT-6

这次,谷歌的定价堪称惊人。

百万输入 Token: 2美元

百万输出 Token: 10美元

缓存输入折扣: 丧心病狂的 95% off(0.5折!)

这是什么概念?我们来看看 Artificial Analysis 统计的“每项智能指数任务”的综合成本。

GPT-6.1 Sol: 0.72 美元

Gemini 4 Argon: 1.99 美元

GPT-6 Astra: 3.26 美元

Claude Opus 5.5: 5.98 美元

Claude Fable 5.1: 7.63 美元

在智力水平与 GPT-6 Astra 完全持平的情况下,Argon 的成本只有 Astra 的 60%!

虽然它不是绝对价格最便宜的,但在“前沿顶级智力”这个档位,Argon 的性价比无敌了。

显然,谷歌此举意图明显:利用自身庞大的TPU算力集群优势,打一场不对称的价格战,逼迫OpenAI和Anthropic降价,放血竞争对手的利润空间。

1M 上下文输出限制:从“读完一本书”到“写完一本书”

另一个大招,就是大幅扩展了模型token上线,从以前的64K token 提升到 1M token。

Argon将输出上限直接拉升至100万Token,这就意味着模型拥有了前所未有的“思考余量”。

用谷歌的话说,当模型拥有足够的空间进行深度思考,并在单次运行中生成数十万 token 时,它就能在推理中达到新的深度层次,一次性解决棘手问题。

现在,AI在完成复杂推理时,再也不会说到一半断气了。

这种深度的连续推理能力,直接让Argon在各大基准测试中“屠榜”。

DeepSWE v1.1(真实长程软件工程能力): 取得 77.9% 的 SOTA 成绩。

Vals Index(衡量金融、编程、法律综合经济价值): 位列第一(68.9%)。

AutomationBench(Zapier评估的企业端到端执行能力): 以 51.3% 拿下头名。

LVBench(多模态长视频理解): 拿到 91.7% 的超高分。

Blueprint-Bench 2(3D理解):位列第一

内部实战曝光:Argon在谷歌干下的三件大事

说起来,谷歌这个模型为什么叫“Argon”?

Argon,化学元素氩,是一种惰性气体。古希腊语中,ἀργόν (argos) 的意思是“懒惰的”。

与“氩”同族的化学元素“氖”,此前被 OpenAI 原后训练研究副总裁发布了同名模型“Periodic Neon”

这次,Gemini 4打破了以往“Pro / Flash / Ultra”的传统后缀。

据悉,在正式发布前,“Argon”其实只是谷歌内部开发的一个代号,外界曾一度猜测它就是Gemini 4 Pro。

Gemini 4 Argon和当时爆料的“Gemini 4 Pro”主要区别就是输出上限不一样。

结果发布时,谷歌直接把这个代号“转正”了。总之目前还没有官方解释。

据报道,在全面发布之前,数千名谷歌员工已经将Argon深度接入了日常研发,而且它干下了三件惊人的大事。

第一件,就是狂省300 TiB内存,帮谷歌省下天价电费。

由Argon组成的智能体团队,自主分析了谷歌全网海量的性能分析遥测数据,敏锐地抓住了内存优化的空间,并自主提交了修改建议。

这些代码上线后,直接为谷歌释放了超过300 TiB的宝贵内存!

不仅如此,预计后续总节省量可达500 TiB到1 PiB。在谷歌的体量下,这背后节约的是以千万美元计的电费和服务器采购成本。

第二件,就是重写了80万行系统内核代码。

搞开发的都知道,重构C/C++内核代码,稍微漏掉一个指针,或者搞错一个内存分配,整个系统就会瞬间崩溃。

但Argon正在主导一项浩大的工程:将谷歌底层的C/C++代码迁移到以“内存安全”著称的Rust语言。

目前,这个AI经手的内核代码规模已经超过了80万行(包括Fuchsia Zircon内核)。

当然,这些重构在部署前进行了严格的自动化审计和人工审查。但让AI触碰80万行内核,这简直是人类向AI下放自主权的里程碑级大事。

第三件,就是手撕3.2万行SIMD底层指令,视频解码飙升2.7倍。

这是最硬核的一个案例。谷歌的开源视频解码项目libgav1里,有一段3.2万行的SIMD代码,人类程序员写起来都极其痛苦。

Argon智能体通过多轮编译实验、研究编译器输出,直接用安全的Rust语言重写了这3.2万行代码!

结果是:新版本的运行速度比原Rust移植版本快了整整2.7倍,性能直接持平高度优化的C++版本,而且输出的视频画面每一帧都一模一样,完美替代!

kimmonismus评价说:“这些都是在谷歌已经运营的基础设施里、成本极高的工程活。这次发布,可能比大家以为的要重要得多!”

网安界“天网”来了:无护栏版本首度曝光

而且, Argon 在网络安全防御上能力也很恐怖。它已经是一个能“自主发现、验证、生成PoC、并修补高危漏洞”的全自动白帽黑客。

在 CWE-bench v1(漏洞修复能力评估)上,Argon以 68% 的得分并列行业第一。

更震撼的是实战。云安全巨头 Wiz 已经在其“Scan for Good”项目中接入了 Argon。

在一次早期演示中,Argon 成功挖出了全球多家医院正在使用的医疗软件中的重大关键漏洞,这个漏洞隐藏之深,连此前的几代前沿模型都完全漏掉了。

因为深知这把双刃剑的威力,谷歌采取了极其谨慎的“分层释放策略”。

1.无护栏特供版(No-guardrail): 仅通过 Fairwind 计划,向部分受信任的网络防御机构(如Wiz)和谷歌内部团队开放。

2.受限API版: 积极参与美国政府的自愿发布前审查。

3.公众版: 后续才逐步推送给付费 API 开发者和 Google AI Ultra 订阅用户。

在全面开放前,谷歌甚至部署了极端的“系统加固”——在高风险训练前将沙箱环境彻底物理级密封隔离;并且实时监控模型的思维链,一旦发现模型企图偏离用户意图,系统会立刻“拔网线”。

谷歌特意说明:这些监控数据绝对不会反馈到训练集中,以防止模型“学精了”从而伪装思维来逃避监管。

研发内幕大揭秘:谷歌的“至暗时刻”

这次发布背后,其实掩藏着谷歌AI部门长达几个月的焦虑。

据彭博社报道,Argon的诞生可谓是“踩着尸体上位”。

首先,5月I/O大会上承诺的Gemini 3.5 Pro夭折了。

本来,谷歌说的是6月发布,但直接难产了,这种级别的模型训练,单次成本高达4亿美元!

再加上顶级AI研究员的天价薪资,这波取消让谷歌付出了惨痛代价。

而且,据爆料,虽然 Argon 跑分无敌,但在谷歌内部,其实存在强烈的怀疑情绪。

有能够直接接触内部评估的员工爆料:Argon 的编程能力“参差不齐”。它在处理前端设计时表现挣扎。

AI专家 Edwin Chen 更是直言不讳地指出了行业的通病——“Benchmaxxing”(刷榜综合症)。

工程师们为了让模型在基准测试中拿高分,疯狂让模型适应特定语言的代码题,却忽略了让模型开发出“真正好用、设计精良的应用”。

据报道,有谷歌员工认为内部存在“广泛共识”——Gemini 4处于前沿水平,而且否认新模型在实际编程任务中表现不佳。

另外,就是人才流失与高层大洗牌。

在这几个月的阵痛期,谷歌流失了大量明星研究员。前有Jeff Dean的淡出,后有诺奖得主 John Jumper 以及核心发明人 Noam Shazeer 的离去。

今年8月,Demis Hassabis 更是升任董事长,将 DeepMind 经营权交给了副手 Koray Kavukcuoglu。

面对内部质疑,Kavukcuoglu 在上周发声稳住军心:“我向团队致以最高的信任。在我看来,我们永远都会处于最前沿是一件确定的事。”

谷歌太需要 Argon 的成功了。

因为 Gemini 模型支撑着谷歌从搜索到 Maps、Gmail 的整个帝国,一旦模型掉队,这些拥有超10亿用户的入口级产品,随时可能被 OpenAI 和 Anthropic 蚕食。

AI三强格局大洗牌:终局远未到来

在 Argon 发布之前,长达7个月的时间里,谷歌一直处于非常被动挨打的局面。

Gemini 4 Argon 的发布,也并没有彻底打垮对手,但它成功地将谷歌重新拉回了牌桌,形成了三强格局鼎立格局。

1.Google(Gemini 4 Argon): 强势回归顶尖实验室行列。在企业知识工作、超长上下文处理(1M输出)、网络安全以及多模态上确立了护城河。

2.OpenAI(GPT-6 Astra): 依然是行业的标杆,在科学、数学终端任务和 Agentic Coding上处于领先。

3.Anthropic(Claude 系列): 还是程序员的心头好。在最新的 Terminal-Bench 4.0 等硬核编程智能体任务上,Claude Fable 5.1 依然领先。

总而言之,当前的格局是:没有绝对的霸主,只有一时的交替领先。

不过,Argon 1.99美元的价格屠刀,确实在竞家的基本盘上撕开了一道口子。

AGI最后一站RSI开始了。

参考资料:

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon

免责声明:投资有风险,本文并非投资建议,以上内容不应被视为任何金融产品的购买或出售要约、建议或邀请,作者或其他用户的任何相关讨论、评论或帖子也不应被视为此类内容。本文仅供一般参考,不考虑您的个人投资目标、财务状况或需求。TTM对信息的准确性和完整性不承担任何责任或保证,投资者应自行研究并在投资前寻求专业建议。

热议股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10