据Business Insider报道,谷歌内部正在悄悄测试Gemini 4的一个新版本,代号“Carbon”。
这个版本很可能是本月初发布的Gemini 4 Argon的后续更新。
Argon主打长文本处理,能应付更长、更复杂的任务,但在复杂编程场景存在短板;而Carbon的研发重心,正是补齐代码编写这块能力。
有内部员工透露,它的编码体验已经能媲美Anthropic在上个月刚发布的Claude Opus 5.5。
谷歌悄悄试炼Carbon
代号Carbon的新版模型,近日已经上线谷歌内部编码平台Jetski,供内部员工开展测试试用。
从内部反馈来看,Carbon的表现收获不少肯定。一位员工透露,其编码体验“感觉就像Opus 5.5”,不过也补充说还需要更多测试。还有人直接点赞:“Carbon真不错!”
就在10月1日,谷歌DeepMind正式推出Gemini 4 Argon,这也是谷歌迄今最强的AI模型。
官方介绍,该模型在软件工程、法律金融等企业知识工作、网络安全防御等复杂任务具备前沿能力,支持最高 100万词元上下文,相比前代6.4万词元的上限大幅提升,能够处理更长、更复杂的任务。
不过,尽管Argon在各类基准测试成绩亮眼,但内部员工在实际使用中发现,模型落地效果不及跑分。
知情人士表示,员工实操体验没有预期惊艳,部分编程场景的短板尤为明显。
而正在内测的Carbon,很大概率就是谷歌用来补齐这一短板的版本。
需要注意的是,谷歌内部研发代号,并不等同于最终对外发布的正式名称。
内部文件显示,谷歌同步测试了多款Gemini 4模型,内部代号分别为Argon、Barium、Carbon。其中,内部代号 Barium-B的模型,最终对外定名Argon。
目前外界尚无法确定,Carbon究竟是Argon的迭代升级版,还是Gemini 4系列里独立的全新型号。
外部AI厂商竞争加剧
在测试新版Carbon的同时,谷歌正承受不小压力,需要向市场证明,自身在大模型赛道依旧稳居第一梯队。
这份竞争压力并非凭空而来。
自今年2月推出Gemini 3.1 Pro小幅更新之后,谷歌已经近十个月没有推出全新旗舰模型。
原定6月亮相的Gemini 3.5 Pro,因未能达到内部性能标准,上线时间一再延后。
在7月的财报电话会议上,Alphabet首席执行官皮查伊坦言:“我们的模型一直处于行业前沿,很多方面我们仍然保持领先。但我们也承认,部分领域仍存在提升空间,AI编程与智能体编程就是其中之一。”
当下,AI编码、自主智能体正是行业竞争最白热化的两大赛道。OpenAI、Anthropic等竞争对手持续加快模型迭代节奏,不少投资者担忧谷歌在前沿AI赛道的优势正在流失。
9月初,OpenAI发布新一代旗舰GPT-6 Astra,官方称其为全球智能水平与对齐程度最高的模型,软件工程相关能力得到显著增强。
9月22日,Anthropic推出Claude Opus 5.5,在开发者圈子里收获大量好评。不少工程师评价,它擅长读懂庞大代码库、完成跨文件重构与bug排查,是处理大型工程任务的优选工具。
这也是谷歌内部测试Carbon时,直接对标Claude Opus 5.5的核心原因。
随着Gemini 4系列持续迭代,谷歌正主动缩小与行业领跑者的性能差距,试图巩固前沿AI赛道的竞争优势,不过能否如愿仍有待观察。