“芯片大佬”Pat Gelsinger:从存储、光互联、电气到网络架构,当下是硬件创新的黄金时代

华尔街见闻
Yesterday

在AI重塑全球算力版图的当下,前英特尔CEO Pat Gelsinger一针见血地指出:AI让芯片设计变得简单,但制造、内存与能源的物理瓶颈正引发一场史无前例的硬件复兴。

10月9日,硅谷创投机构a16z 播出一期深度访谈节目。在对谈中,Playground Global普通合伙人、前英特尔CEO Pat Gelsinger与a16z的Raghu Raghuram、Guido Appenzeller展开了一场跨越芯片设计、存储创新、光互联、能源瓶颈乃至AI代理(Agent)基础设施的深度讨论。这位亲手设计了英特尔386和486处理器、见证了现代EDA行业诞生的芯片老兵,以其数十年的一线经验,为当前AI硬件浪潮提供了罕见的底层视角。

(左:Guido Appenzeller;中:Pat Gelsinger;右:Raghu Raghuram)

Gelsinger开门见山地抛出了一个核心判断:“对于我们所有硬件人来说,这就像是文艺复兴。”在他看来,从存储到光互联、从电力架构到网络拓扑,当下的硬件创新机会密度,是他职业生涯中前所未有的。

“能源容量即经济产能”,数据中心或面临违约潮

在AI基础设施建设如火如荼的当下,市场最容易忽视的硬约束是电力。Gelsinger将能源问题提升到了宏观经济的高度。

“在AI数字时代,能源容量就等于经济产能。” Gelsinger指出,过去15年美国在增加可再生能源的同时淘汰煤炭,导致国家整体能源容量几乎停滞,即便近期激增,年化增速也仅约4%。这与AI动辄需要百万级GPU集群的庞大胃口形成严重错位。

他发出了明确的市场警告:“为什么还要建新的数据中心?如果我买了一百万个GPU却无法为它们供电,你将会看到越来越多此类数据中心项目发生违约,因为根本没有足够的能源。” 甲骨文此前关于核能数据中心的言论,在Gelsinger看来只是行业面临供电瓶颈的“初步信号”。

为了解决这一问题,他提出供电网络的底层重构迫在眉睫,“800伏直流电(DC)重返数据中心,可以说是‘爱迪生的复仇’。” 从发电、输电到利用垂直GaN(氮化镓)技术进行一步到位的降压转换,以及液冷等散热技术的升级,整个电气系统正迎来25年未见的复兴周期。

“HBM是极其糟糕的内存”,30年来最大的存储创新即将来临

针对当前市场备受追捧的HBM(高带宽内存),Gelsinger给出了极具冲击力的评价:

“HBM是一种极其糟糕的内存(hideous memory)。只不过它是我们目前能拿到的最好的。”

他直言不讳地指出了HBM的物理局限:极差的比特密度、受限于边缘的带宽、高昂的功耗以及严重的散热问题(DRAM非常怕热)。然而,正是这些痛点,加上AI对内存计算的极度依赖以及过去四年存储行业增加的2.5万亿美元市值,正在催生行业的质变。

“准确地说,过去30年里我们到底经历了多少次重大的新型内存创新?只有DRAM、SRAM和Flash。”Gelsinger表示,“30年来的首次内存创新已经近在眼前。” 他极度看好铁电材料(ferroelectrics)等新材料在非电容、高密度、可堆叠内存中的应用,并透露自己已投资相关的隐形初创公司。

对于芯片堆叠技术(3D Packaging),他保持了理性的克制。他认为受限于良率呈指数级下降的数学规律,“我不是一个疯狂追求16层或32层堆叠的人。我认为2到4层的内存堆叠将是最佳的甜点区(sweet spot)。”

设计只需3个月,制造却要9个月:摩尔定律后的“制造时间差”

AI正在大幅缩短芯片前端设计的时间。Gelsinger认为,当前AI辅助芯片设计就像当年486处理器引入现代EDA工具一样具有划时代意义。利用AI工具,一个优秀的团队可以在三个月内完成一款AI加速器的逻辑设计。

但技术的进步总是将瓶颈转移到别处。“现在已经没有单纯的‘芯片’了,一切都是‘机架’(Rack)。”

Gelsinger详细拆解了当前的制造地狱:

“我花了3个月设计,但我至少需要3个月才能让晶圆出厂,再花3个月进行复杂的3D高级封装,最后还要把它集成到机架级解决方案中。也就是我用了3个月设计,但实际上要等9个月才能真正开始使用它。”

如果算上部署软件和模型迭代的速度,这种长达一年半的硬件交付周期,往往会导致“芯片刚落地,AI工作负载已经发生改变”的尴尬局面(如Graphcore曾面临的困境)。

100家AI芯片公司大乱斗终将“九九归一”

面对当前市场上涌现的近百种AI推理加速芯片,Gelsinger做出了“天下大势合久必分,分久必合”的断言。他认为当前的架构异构化只是暂时的,市场最终将收敛至少数几家主导平台。

他的逻辑基于三点:

  1. 工作负载的演进:大语言模型(LLM)正在接近瓶颈,未来的AI将融入更多传统的HPC(高性能计算)特性(如对64位高精度计算的需求,用于分子或化学分析),过度专门化的芯片将难以适应2-4年后的模型。

  2. 资本与规模的壁垒:建立AI算力规模需要数百亿美元的资本支出。“建立这些东西需要庞大的资本,这违背了你能同时维持100种不同芯片架构的逻辑。”

  3. 巨头的选择:OpenAI、Nvidia和Anthropic等头部玩家会主动挑选赢家,因为软硬件生态的协同演进成本极高。

光互联:铜的死亡,迟早会来

“我宣布铜的死亡大约已经有20到25年了。终有一天我会是对的。”

Gelsinger在光互联问题上态度鲜明:所有IO功能都应该迁移到光学互联,但核心计算-存储复合体本身不需要走这条路。他认为,当前数据中心中铜缆的波导特性正在让铜缆在5米距离的成本超过光纤在100米距离的成本,物理规律正在逼迫迁移发生。

对于关键的时间节点,他指出2028-2029年将是行业转折点——英伟达已明确表示将在这一时间窗口采用NPO/CPO(近封装光学/共封装光学)方案,其他厂商也将跟进。

“NVL72在工程上是奇迹,在制造上是噩梦。如果我们当时有更成熟的光学供应链,我们今天会更先进。”

在网络架构层面,Gelsinger支持向光路交换(OCS,Optical Circuit Switching)演进。他引用网络专家Nick McKeown的观点:

传统互联网是为“数据包可能去任何地方”而设计的,而AI工作负载“几乎完全相反——流量是大规模且可预测的。这更像是电路交换而不是包交换。”

AI代理时代的"新VMware"

对谈最后,Gelsinger回归到他在VMware时代的管理经验,讨论AI代理(Agent)时代的基础架构范式。

“每一次创新都会引出下一个抽象层。”他认为,虚拟机抽象依然是计算层级中值得保留的核心范式,但服务对象正在从"硬件与人类"转变为"代理"。

“虚拟化和管理的每一个基本要素,都需要在下一个计算层级中被重新创建。”

Gelsinger指出,新一代“代理VMware”需要解决:如何让代理高效运行、如何为代理构建安全配置、如何管理代理性能,同时还需要保留人类设定策略、描述“宪法”(引用Anthropic创始人Dario Amodei的概念)和查看仪表盘的能力。

访谈全文实录如下(由AI辅助翻译)

第 1 章:Intro

Pat Gelsinger:

在AI数字时代,能源容量等于经济容量。为什么要建新的数据中心?买上百万块GPU,如果没有电力支撑,你会看到越来越多的数据中心项目出现违约,因为电力根本跟不上。

Guido Appenzeller:

每当你拥有某种技术让某件事变得容易,瓶颈就会转移到其他地方。

Pat Gelsinger:

现在没有什么单纯的芯片了,它已经是一个机架,我花了三个月来设计它,但还要再等9个月才能真正开始使用。过去30年里到底出现过多少种全新的存储技术?存储领域30年来首次迎来真正的创新,就在眼前。我大约在二十二五年前就宣告了铜互连的死亡。终究我会被证明是对的。对我们所有硬件人来说,这就像文艺复兴一样。AI推理加速芯片,我肯定连名字都叫不全。你们为什么要资助这么多这类项目?

Raghu Raghuram:

你自己也资助了不少。

Guido Appenzeller:

历史上从来没有哪个行业同时存在100家相互竞争的处理器厂商。这只是暂时现象吗?最终会收敛到少数几家吗?

第2章:从技工学校到18岁加入英特尔

Raghu Raghuram:

我今天邀请到了我们尊贵的嘉宾、亲爱的朋友,也是我的前任老板——Pat Gelsinger先生,欢迎Pat。Pat目前是Playground Global的普通合伙人,但他在业内以领导才能而广为人知,曾担任英特尔首席技术官,后来领导VMware,以及许多其他职务。欢迎你的到来。

Pat Gelsinger:

嘿,谢谢你。Raghu,很高兴能和你还有Guido在一起,对吧?对我来说,这感觉有点像回到了老地方,你知道,就像……是啊,感觉就像我们叠加了一年的变化,但你们两个看起来还是一样,我也很有活力,那我们就开始吧。

Raghu Raghuram:

那可不是在说David,你也停不下来,一直都这么有活力,这不是什么新鲜事。不过,让我们从你在英特尔的职业生涯说起。最近,Andreessen Horowitz创办了一个学院,旨在发掘16到22岁之间的有才华的人,然后将他们放入现代教育环境中,让他们为自主创业或加入当今的公司做好充分准备。你有过类似的经历,你上了一所普通的职业技工学校,然后在18岁或19岁的时候就直接进入了英特尔,是吗?

Pat Gelsinger:

是的,那真的是一段非常神奇的时光。我16岁的时候,偶然赢得了一个奖学金,去了一所技工学校,跳过了高中最后一年半的学业,18岁的时候英特尔来招募我。 你知道,我那时从来没坐过飞机,但已经深深爱上了技工学校的学习。面试官,他叫Ron Smith,他在纸上写着——我是他那天面试的第12个人,如果你连续面试了12个人,到最后你根本分不清男女,对吧?他写道:聪明、积极、有点傲慢,他会适应的,就这样。

Pat Gelsinger:

于是我被邀请加入英特尔,那真的是一段非常辉煌的经历。从一名技术员开始,后来进入设计团队,参与了286的收尾工作,成为386的第4号工程师,再到486的架构师和设计经理。 与此同时,我完成了本科、硕士和博士的学业。这简直是最完美的职业发展路径——白天在工作中学习,晚上把所学付诸实践。

Raghu Raghuram:

而且这完全是你热爱的芯片领域,我敢说,你在那里所热爱的和所构建的东西,之所以有巨大突破,是因为你在开拓新的领域。

Pat Gelsinger:

是的,在很多方面都是如此。那真的是行业里一段相当不可思议的时光。我记得在斯坦福的一门课上,一位教授提出了一种新的进位前瞻设计方案。我当时正在做386的进位前瞻,所以我就想,让我去试试看。两天后我回来告诉教授:这个方案行不通。

Pat Gelsinger:

然后我就开始和我在斯坦福的教授争论起来,接下来的两节课,就变成了我和教授争论为什么他的设计不可行。他当时有一本正要出版的书里用了那个设计,这让他非常恼火。我们还开始研究他的自测试方法,我记得斯坦福的Ed McCluskey教授,他可以说是这一领域的奠基人,我们就他的很多想法展开了精彩的争论——那些想法对真实芯片来说并不实用。 但我当时正在把内建自测试应用到386上。我的论文导师是John Hennessy,他后来也做得很好。

Pat Gelsinger:

我说嘛,我帮助了他的职业生涯,他后来成了校长,之后一直如此。

Raghu Raghuram:

是啊,之后我们会聊到CISC和RISC之争,但我想先聊聊486。不好意思,你先说。

Guido Appenzeller:

我在斯坦福教书时也有过同样的经历。你带着你认为是真理的东西走进课堂,然后一个在业界工作的学生说:嗯,实际上并不完全是这样。所以下一节课你回来说:好吧,我查了一下,你是对的,这是更新后的内容。

Pat Gelsinger:

是的,你知道,这正是学生互动的一部分,我认为这也是硅谷之所以如此独特的原因之一。这里有那么多公司,创业精神就像融在水里一样,创业、新想法、挑战教授……在斯坦福这样的地方当教授,你必须做好被挑战的准备,并且享受这个过程。

Guido Appenzeller:

那栋楼里人来人往,流量还挺大的。

第3章:486与现代EDA的诞生

Raghu Raghuram:

是的,486是你的重大成就,当然,很多人都参与其中。你们在芯片设计上开辟了一些新领域,增加了芯片应该具备的功能,等等。

Pat Gelsinger:

是的,那也是一段相当神奇的时期,因为那是在你所认为的EDA行业诞生之前。

Raghu Raghuram:

哇,是的。

Pat Gelsinger:

你知道,386末期有一点点苗头,但486才是真正第一款采用现代EDA技术的芯片。我们做了高层设计,对吧?就是RTL描述,但那时候还没有Verilog,所以我们发明了HDL,对吧?就是英特尔硬件描述语言,我自己写了一门语言。当然,你还得为这门语言构建一个编译器,对吧?所以我们为这门语言创建了一个编译器。那时候还没有自动布局布线,所以我们不得不发明它,我们与Alberto Sangiovanni-Vincentelli以及他在伯克利的一些学生合作,完成了第一个布局布线、第一个自动时序管理。

Guido Appenzeller:

所以他们在某种程度上创造了EDA……

Pat Gelsinger:

是的,在很大程度上是这样,486不仅是一款兼容的流水线微处理器,我们还奠定了现代EDA行业的许多基础,那真的是这个行业一段相当神奇的时期。

第4章:AI如何改变芯片设计

Guido Appenzeller 如果我们看看今天,人们回顾Blackwell时会说,这是AI接管微处理器设计流程之前最后一代精心设计的芯片,我们现在是否正处于类似的转变之中?

Pat Gelsinger:

我认为某些方面确实如此。所以我认为,当你看看今天像Jalapeno这样的东西,你会说,这是在芯片设计流程中从第一性原理使用AI的方式,抛弃了很多传统的东西。当然,设计中有些部分在这个意义上仍然非常困难。很多模拟方面的工作,Circs可能是最好的例子,仍然无法用AI来完成,对吧?你只是需要大量的硅片数据才能搞定这些。所以你要么在模拟设计上非常保守,从而能够用AI来处理,要么……

Pat Gelsinger:

你就得用老办法来做,但是现在很多逻辑功能真的可以用AI工具和技术以相当令人难以置信的方式来完成,对吧?你的晶体管预算足够大,设计工具越来越智能,少数专家指导工具如何应用,我真的认为这将有点像486那个时代,对吧?

Pat Gelsinger:

你们回过头来会说,是的,那是芯片设计新纪元的开始。

第5章:为什么芯片制造仍然需要九个月

Guido Appenzeller:

每当你拥有某种技术让某件事变得容易,那就意味着瓶颈会转移到其他地方。那么,我们现在能猜到未来的瓶颈会在哪里吗?有些事情AI似乎做得非常好,对吧?比如处理软件层,编写内核,还有很多……我认为很多是能够在更高层面上指定目标,然后将其转化为非常长的……那么新的前沿是什么?未来什么事情会变得困难?

Pat Gelsinger:

你知道,看看今天的情况,假设Guido和Pat,我们要一起做一次伟大的新旅程。我们要去构建一个……对吧?这将是一个领先的东西,因为我们了解架构,了解AI工作负载,了解如何组合这些,然后是正确的乘累加运算和寄存器结构。

Guido Appenzeller:

还能完美地看清明天的模型工作负载。

Pat Gelsinger:

所有这些东西。假设我们把AI工具全部释放出来,那真的太棒了。三个月之内,我们就能得到一个出色的设计,对吧? 当然,在模拟组件方面我们会稍微保守一些。

Pat Gelsinger:

但我们现在仍然有几个重大瓶颈。其中一个就是,我们仍然需要9个月的硅片加工时间。 对吧?就是这样。所以我可以在三个月内完成设计,但实际上要大规模生产出真正的芯片,还需要九个月。这很糟糕,对吧?所以如果我们要推动这种创新,就必须真正改善这个瓶颈。

Raghu Raghuram:

甚至在那之后,我们还有更多的等待周期。

Pat Gelsinger:

你知道,首先,从晶圆厂拿到东西,最快也要三个月,而这还是在设计流程极度优化的情况下。 那我怎么压缩这个时间?然后还要进入先进封装,3D封装越来越复杂,这又要花大约三个月。然后还要把它集成到机架级解决方案中,因为现在没有什么东西只是一块芯片,它是一个机架。所以加起来是9个月,我花了三个月设计,但要真正开始使用它,还需要9个月。 那么我们如何开始压缩设计的这些环节?我认为我们需要新形式的光刻技术来实现这一点,我们需要不需要花费5000万美元掩模成本的设计流程。

Pat Gelsinger:

直到我能够进行原型测试。你告诉我,怎么把这个时间压缩到一两个月?因为我现在可以在三个月内完成设计,但如果要花一年半才能真正实现规模量产并跑通软件,那我对AI工作负载的理解,早就不再适用于最终流片的那块芯片了,对吧? 所以,所有这些……

Guido Appenzeller:

你现在就能看到这个问题在AI领域实时上演。

Pat Gelsinger:

是的。我们可以从历史上看,Graphcore的设计并不差,但世界已经向前走了,对吧? 所以,所有这些方面都在某种程度上抵消了AI让设计变得容易这一事实,所有制造和规模化的问题,对我来说都成了巨大的瓶颈。 当然,另一个瓶颈就是内存,对吧?内存带宽。

Guido Appenzeller:

我们深有体会。是的。

Pat Gelsinger:

你知道,正如我所描述的,HBM是一种糟糕的内存,但它偏偏是目前最好的一种。

Raghu Raghuram:

我们正想问你这个问题。

Pat Gelsinger:

是的,这是一种很糟糕的内存。位密度差,受限于带宽,还有功耗问题、散热问题。DRAM不喜欢高温。

Guido Appenzeller:

把所有东西都堆在一个地方。

Pat Gelsinger:

对于AI这种内存计算密集型工作负载来说,这简直太糟糕了。 所以我需要压缩从开发到真正规模化落地的时间,我需要解决与此相关的内存问题。对我来说,这是另一个关键瓶颈。还有功耗——功耗、散热,现在大多数功耗仿真工具都很差,没有好的3D功耗建模工具,没有功耗热点分析,没有好的电压输入建模。我基本上是在用几乎整个功耗余量来做保护带,这意味着我损失了大约40%的功耗在保护带上。 所以我必须在功耗建模上做得更好,而且我的散热技术也很落后。

Raghu Raghuram:

功耗传输模型也必须改变。

Pat Gelsinger:

是的,所有这些,对我来说,都是下一批重大瓶颈。我怎么逐一改善这些问题?如果我做到了,那我们才真正进入了一个令人兴奋的新时代。 感谢那些出色的AI工具,但即使这些工具全部部署到位,我面临的挑战依然巨大。

Raghu Raghuram:

我们确实看到了芯片数量和芯片架构的某种复兴。

Pat Gelsinger:

是的。

Raghu Raghuram:

这都要归功于这些工作负载。

Pat Gelsinger:

现在大概有100种AI推理加速芯片,我甚至肯定不知道它们全部。

Raghu Raghuram:

是的,确实。所以……

Pat Gelsinger:

你们为什么要投资这么多这类项目呢?

第6章:100种AI芯片会收敛到少数几种吗?

Raghu Raghuram:

你也资助了不少。是的,所以,你知道,它们都很擅长在你提到的那些组件上,或者在它们所针对的帕累托曲线的某个部分上,做出不同的设计假设。那么你认为这些芯片都有存在的空间吗?还是说,部分由于Guido所讲的AI工具链的发展,我们现在有能力构建更多种类的芯片?而且时间也非常充裕。无论你怎么看……

Guido Appenzeller:

更挑衅性地说,从历史上看,任何行业都从未出现过100家相互竞争的处理器厂商,对吧?所以,这是一个更加异构的未来吗?我们会看到——这只是暂时现象吗?最终还是会收敛回少数几家。

Pat Gelsinger:

我认为这更像是一种暂时现象。我预期它最终会收敛。我看到这种情况的原因大概有三点。其中一点是,你在计算环境中看到的这种新兴异构性——好,现在我有了专门用于预填充(prefill)和解码(decode)的不同芯片。然后人们开始说,我们真的需要一个专门针对中间阶段的层,而不只是预填充阶段。所以现在我有了早期预填充,还有中间填充,它们是不同的。

Guido Appenzeller 推测与验证。听听OpenAI怎么说。

Pat Gelsinger:

是的,你知道,突然之间,整个计算集群在不同工作负载之间变得越来越细粒度。我认为,历史上任何时候出现这种情况都是不可持续的。

Pat Gelsinger:

然后突然之间,当你看到这些,人们又开始说,当我转向推理模型时,我希望它看起来更像一个CPU。所以突然间,我并不需要那个层级——那个层级并没有成为我计算能力的主导部分,我反而需要更多这边的资源,对吧?还有模型工作流等等。所以我真的不喜欢——我会说,大规模的专业化,对吧?因为我认为工作负载会持续地、大幅度地调整和迁移。这是第一点。第二点是,我认为当今的模型也即将经历一些演进上的突破。

Pat Gelsinger:

我认为大型语言模型(LLM)正在触及某些极限。现在人们在思考如何真正对三维结构建模——当你涉及分子、化学品和成像时,扁平化的LLM并不好用。所以我认为我们会看到这方面的局限性,这将在算法领域引发不同的转变。我也认为,一些最有趣的工作负载,是那些将高性能计算(HPC)类的东西重新带回AI的场景——比如突然之间,64位精度再次变得重要。

Raghu Raghuram:

能举个例子吗?

Pat Gelsinger:

好,比如说,假设我的AI模型现在正在为一项化学分析推导出最有价值的五个领域。那些化学算法是以高精度运行的——计算量最大的部分,到底是找到我需要运行的那五个算法,还是在不同的化学或生物系统上运行这五个算法? 所以我确实认为,随着我们优化AI系统,它会把我们带回到一些更传统的高性能计算领域。所以我也看到了这方面的工作负载趋势。综上所述,这种极端的专业化,在我这个计算架构师看来,我不太喜欢它,因为我不认为这将是2、3、4年后工作负载的样子。这是我不看好这些越来越专注于计算工作负载某一部分的AI芯片的原因之一。

Pat Gelsinger:

第二点是,现在大概有100家这样的公司,对吧?

Pat Gelsinger:

有多家做光学的,有做概率计算的,它们不可能全部胜出——之所以不能全部胜出,是因为归根结底,这些东西需要规模。而规模需要你赢得市场、获得资本、让工作负载跑在上面。所以我认为,说你会有100家这样的公司,本身就违背逻辑。因此,我认为受资本、市场份额等因素的影响,行业会回归——谁是胜出的团队、胜出的设计、胜出的架构。我认为工作负载会驱动这一点。

Pat Gelsinger:

我预见到行业自然整合会发生。同时我也预期,赢家会挑选出一些赢家——比如OpenAI、英伟达、Anthropic会说,我喜欢这个,因为这不只是硬件,而是硬件和软件如何共同演进。对吧,向前发展。我确实预期,这里有10个我可以选,但我喜欢那个——而且它确实需要在软件和工作负载演进上投入,才能充分利用那些平台。基于这三个原因,我们会看到这个领域的收窄。

Raghu Raghuram:

还有部署复杂性的问题。抱歉,请继续。

Guido Appenzeller:

这完全说得通。我大体上同意。不过让我还是来搅搅局,制造一点争议。

Pat Gelsinger:

你们改变了这一点,对吧?

Guido Appenzeller:

所以,100家公司可能会存在,也可能会整合,对吧?我完全同意你的论点——归根结底,大型消费者会在一定程度上选出赢家。

Guido Appenzeller:

我认为,今天要成为这个领域的先行者,在某种程度上,你是否在其中,取决于你在真正的大玩家那里获得了多少牵引力。同时也有一种说法是:在任何过渡期,你可能会看到更多不同方法的爆发,然后随着时间推移逐渐淘汰。话虽如此,我认为有一个论点可以这样说:从历史上看,我们之所以标准化在一两种架构上,是因为不同的指令集很难处理——我们需要构建多个编译器,基本上是软件复杂性决定了你只能有少数几个硬件平台。这一部分似乎正在随着AI而改变。但如今,为某个芯片编写优化内核——我认为Kleinia是个很好的例子——正如我说的,人类已经无法真正编程这个东西了,但一个Agent可以在一夜之间完成。这就是我们所需要的,对吧?基本上你可以说,如果你能构建一个具备某种能力的芯片,现在在上面构建充分利用它的软件层变得容易多了。这样的结果会不会是,我们拥有更多一点的异构性,只因为对这种异构性编程变得更容易了?

Pat Gelsinger:

我确实认为这改变了瓶颈所在的位置。第一个瓶颈是我要指出的——我们已经谈过了——构建这些东西仍然需要一年半的时间,对吧?第二个瓶颈是,不仅需要一年半才能把这些东西装进机架、实现规模化,要让它们真正有用,你能借到500亿美元吗?

Pat Gelsinger:

我的意思是,我们谈的不是小额资本支出,而是非常巨大的资本支出——数据中心、电力、承诺等等。所以我必须大规模地构建这些东西,这与之相关。这将打破很多异构性。

Pat Gelsinger:

当然,大玩家们——我们看到了英伟达对Groq所做的事情——会在某种程度上拥有一些异构性,对吧?

Pat Gelsinger:

两年后,你不会知道英伟达里面跑的是什么架构,它就会像另一个东西一样,对吧?所以你会看到这些架构,异构性会被隐藏在内部,这对我来说完全没问题。这就是分层、这就是抽象一直以来所做的事情。但我认为那些力量是强大的,会让大量的异构性暴露出来——不对,我认为它会被抽象在这些东西之下。但归根结底,大规模构建这些东西仍然很难。

第 7 章:为什么 HBM 是一种糟糕的内存

Raghu Raghuram:

好的,你提到了 HBM 是一种糟糕的内存。

Pat Gelsinger:

但它却是我们目前拥有的最好的内存。

Raghu Raghuram:

确实。但关于内存的令人沮丧之处在于,我真的不记得上一次内存创新是什么时候了,可能是 eDRAM(嵌入式动态随机存取存储器)。我觉得你可能也参与其中。

Pat Gelsinger:

是的,那个项目死掉了,所以我也算经历了一次失败。

Raghu Raghuram:

我们把它搞死了。那么你认为内存创新即将到来吗?或者说需要发生什么?显然,我们理解规模问题,因为在这方面规模问题更大。但如果把规模问题放一边,即使从技术角度来看……

Pat Gelsinger:

是的,你看看那段历史,我个人可能至少参与过五种不同的新内存架构,eDRAM 只是其中之一,这些架构都没能见到天日。我可能还了解过去 30 年里业内发生的近 100 种类似情况,而在过去 30 年里,我们究竟有过多少种主要的新内存?对吧,你知道,好吧,DRAM、SRAM、闪存,好吧,还有什么?DRAM、SRAM、闪存,是的。所以我确实认为……

Raghu Raghuram:

闪存堆叠稍微算是一点。

Pat Gelsinger:

勉强算吧,是的,对,你知道,不管怎样,对,所以在这方面,确实令人失望,我们还没有创造出下一种物理技术,能够实现低成本、高性能、可靠且可制造的内存。所以我确实认为,在过去三四十年里,内存一直是一个糟糕的行业,因为你可能一年盈利,接下来四年亏损。所以在一个五年中只有一年盈利的行业里搞研发,这实在太难了,因为它一直被如此剧烈的商品化周期所驱动。

Guido Appenzeller:

不过这在一定程度上已经有所改变了。

Pat Gelsinger:

在过去五年里。

Guido Appenzeller:

三大内存公司都跻身全球最有价值的前 20 家公司之列。这是一个疯狂的转变。

Pat Gelsinger:

确实令人惊叹,对吧?谁能想到会这样?任何关注 AI 工作负载的人都知道,预测过去容易,预测未来难,对吧?而当你看这一切时,会说 AI 是一个内存的世界,确实如此,就在其中。所以我认为,资本和技术需求的结合将会推动内存创新。

Pat Gelsinger:

现在有两个领域让我感到兴奋。其一是,我确实认为 HBM 的带宽限制是一个根本性问题。因此,基于这一点,这个想法……显然,我们有一家公司 D-Matrix 正在做这件事,但我认为其他公司也会加入,无论是 Cerebras 及其技术,还是其他公司。

第8章:芯片能叠多高?

Guido Appenzeller:

未来是堆叠式的

Pat Gelsinger:

你必须想办法把内存整合进来

Raghu Raghuram:

而且要从多个维度来考虑

Pat Gelsinger:

你必须把内存和计算整合在一起,对吧?要有一种全新的基础架构。我确实认为,鉴于目前AI领域已经投入了如此巨大的资本来应对这些工作负载,我认为我们实际上也能够突破其中一些物理层面的挑战。所以我相信,你知道,我刚刚……

Raghu Raghuram:

投资了某个项目,对吧?

Pat Gelsinger:

你知道,我刚刚也投资了一家新的内存公司。目前还在隐秘阶段,但你知道吗?

Pat Gelsinger:

我对新内存领域即将发生的一些创新感到非常兴奋。你将会看到新材料的出现,比如用于内存的铁电材料,寻找非电容式、高密度的内存,寻找能够实现高性能、高密度且可堆叠的内存,对吧?但是,你知道,有人正在研究用低成本闪存来实现这一点。我个人对这个想法并不是特别热衷。我认为闪存或MRAM结构在底层单元的速度和性能方面存在一些问题。是的,但我确实认为,内存领域三十年来首次迎来创新。我认为这将是一个令人兴奋的领域。我相信届时会有几家公司在这里涌现。

Pat Gelsinger:

好的,你知道,我们会在这里找到一些可以做的事情。但我认为三十年来首次出现的内存创新就在眼前。

Pat Gelsinger:

你知道,我认为内存行业在过去四年里市值增长了2.5万亿美元。我觉得这个数字大致是对的。

Guido Appenzeller:

我们本可以直接投资那里,而不用做任何差异化的事情。

Raghu Raghuram:

是的,完全正确。用你的钱就行了。嗯,你怎么看?抱歉,你先说。

Guido Appenzeller:

稍微展开说一下堆叠这部分,如果你要预测芯片会以多快的速度"长高",这会是像……你知道,我们会先到2层然后停在那里一段时间,还是说我们会有,比如16层的三明治结构?你知道,逻辑层和内存层愉快地混合在一起?

Raghu Raghuram:

HBM把这个拉低了

Guido Appenzeller:

HBM在Nvidia上在往下走,但你怎么看这个演变趋势?

Pat Gelsinger:

是的,你知道,我认为,堆叠的问题在于,随着堆叠维度的增加,整个堆叠的价值也在增大,这意味着每一层的良率以及堆叠工艺本身必须持续提升。基本上,它不能线性提升,而是必须指数级提升。当你堆到8层或16层高的时候,以指数级方式提升制造和设计特性就会变得极其困难,当你算一算相关的数学,你的制造流程必须接近完美。

Guido Appenzeller:

他们可能会看到一些设计,这些设计会考虑到某种特定的模型类别,就像我们在二维领域看到了很长时间的那样。

Pat Gelsinger:

当然。但请记住,这就是DRAM的本质。你总是有坏块替换机制,比如备用行之类的。所以我不是在任何意义上轻视这一点,但假设你已经做到了这些,你仍然需要良率非常高。你知道,如果我有一颗裂了的芯片,不管你内置了多少冗余,你也没办法,它就是一颗坏芯片,对吧?所以,正因如此,我不是那种疯狂追求16层、32层堆叠的人。我认为会出现3、4、5层的堆叠,这最终会成为最佳平衡点。

Guido Appenzeller:

中层建筑。是的。

Pat Gelsinger:

是的,你知道,部分原因在于制造,部分原因在于相关的复杂性,良率的甜蜜点在哪里,所以这就是我认为大多数事情的落脚点。但即便如此,对吧?比如说,假设我现在有了一块很棒的计算芯片,那块芯片需要多大?现在一切都受到了光刻场的限制,对吧?我能不能用更多的小芯片来获得更好的良率特性、更好的散热,然后你会说我希望在上面有一个内存堆叠。

Pat Gelsinger:

是两层内存堆叠,还是四层内存堆叠?我不认为它会变成八层内存堆叠。所以大概是2层或4层,对吧?但是电源传输也需要集成进去,这就变成了另一个要素,我希望它在Z轴方向上,因为我希望我的电源阵列也从这个方向接入,对吧?然后我需要相当智能的RDL层来在整个平台上分发信号。所以在某种程度上,你知道,当你把所有这些部分加在一起,我的标准结构已经大约有8层厚了,我认为这差不多就是极限了,至少以我们今天对制造工艺的理解来看是这样。

Pat Gelsinger:

当然,我们预计光学技术也会加入进来。所以会有更多III-V族材料结构更靠近这个复杂体,因为我希望我的IO能够深度集成到这个架构中。所以我以硅为核心的部分需要得到这些其他III-V族材料的补充。我如何将光学互连集成进来?我如何将电源轨集成进去?

Pat Gelsinger:

你知道,这是一项工程壮举,也是一场制造噩梦,要把所有这些部分整合在一起,但这就是物理规律随着时间推移带领我们去的地方。因此,16层高的堆叠对我来说太疯狂了,2层或4层高的内存堆叠,我认为这大概就是最佳平衡点所在。

Raghu Raghuram:

你还可以谈谈散热问题以及为此所需的新材料。

Pat Gelsinger:

显然,首先会有很多挑战,你就是不能允许今天存在的那些物理热点。所以你必须更加智能地利用热量和分散热量。但你知道,然后你会说,好的,我如何在这些环境中既能输入电能又能将热量散出去?顺便说一句,如果我能以我想要的电压更高效地输入电能,同时拥有更好的电源响应能力和电压调节能力,那么我产生的热量就会少一些,但我确实需要思考,好的,我如何冷却这些东西?

Pat Gelsinger:

新材料,比如金刚石和其他一些被提出的东西,在改善散热冷却方面能发挥什么作用?我如何采用更好的液冷技术?你知道,直接贴在上面,具有良好的导热特性。所以,你知道,我们工程师正在变成管道工,对吧?确实如此。

Raghu Raghuram:

是的。你担心芯片级别的电磁兼容问题。是的,让我问你一个相反的现象,有些人说,嘿,我们把内存从封装上拿走,在计算和内存之间全部用光学连接。这样可以给你更多的自由度,以及更多构建系统的方式。与堆叠相比,你怎么看这种方式?这是另一个极端。

Pat Gelsinger:

是的,你知道,我认为越多的OEO,对吧,接口,也就是光-电-光的转换,在你的核心计算复合体中需要越多这样的转换,对我来说就越困难,从这个意义上说。而且你总会有与之相关的损耗。

Pat Gelsinger:

你知道,人们正在努力想出更聪明的技术来降低成本和功耗,对吧?我在经过DAC和各种转换时浪费了多少功耗?所以我不喜欢这种方式,因为我认为它虽然让你能够访问大型内存池,但消耗大量功耗才能到达那里。是的,对吧,记住,基本上每次计算的飞焦耳现在已经相当惊人地低了,对吧?但每比特通信的飞焦耳相比之下要差1000倍。如果我要花那么多能量去访问大型内存池,我不喜欢这些方法,我认为它们在某种程度上违背了解决方案的底层物理规律。

Guido Appenzeller:

我的意思是,还有另一种方法,就是说,我们能不能真正直接将计算和内存整合在一起,对吧?把一部分计算移到内存里去?

Pat Gelsinger:

这就是一些PIM(存内计算)的方案。

Guido Appenzeller:

正是。那么,你对此有什么看法?

Pat Gelsinger:

我也不喜欢这些方案,对吧?因为我认为工作负载,你知道,因为现在我必须拿着我的工作负载,然后把这些小块计算推进内存里,对吧?这样我就不需要那么多内存带宽流入我真正的计算单元。但这给工作负载带来了约束。再说一次,我可能是错的,特别是考虑到我们现在能够通过设计手段带来的一些设计灵活性和智能化,但大多数PIM的想法已经存在了25到30年,我认为再过25到30年它们仍然还在那里,从这个意义上说。你知道,给我高密度、高性能的大内存带宽,并让它靠近真正的计算引擎。我预计这将是一个对许多不断演变的工作负载来说更具普适性的解决方案。

Guido Appenzeller:

所以我们还是被困在越来越密集的芯片里,堆叠,更多逻辑,更多功耗。

Pat Gelsinger:

但会好得多。我是,我是,我是光学的超级粉丝,你知道,转向光学来实现所有IO功能。是的,对吧?你知道,我大约在二十到二十五年前就宣布了铜的死亡,最终我会是对的。

Guido Appenzeller:

你还是对的。

Raghu Raghuram:

总有一天会的。

Pat Gelsinger:

很快就会是对的了。但我认为,对我来说,所有IO都应该转向光学,对吧?但核心计算-内存复合体,不。对吧?

Raghu Raghuram:

那么当你第一步迈出去的时候,我们的文章是关于纵向扩展,甚至比横向扩展更多。你对此有什么看法?

Pat Gelsinger:

是的,你知道,我认为我们现在……

Raghu Raghuram:

如果可以的话,驱动工作负载的应用场景会是什么?

Pat Gelsinger:

好吧,我认为驱动工作负载的就是摆在我们面前的这个,对吧?

Pat Gelsinger:

我的意思是,你知道,今天,在我们的纵向扩展环境中,我们铺设了大量铜缆,对吧?你知道,铜缆本质上正在变成一种波导,而且越来越短。 突然之间,你知道,让铜缆在5米距离内工作,比让光纤在100米距离内工作还要贵,对吧?所以,你知道,我认为物理规律正在推动我们走向这条路。那么,Pat,既然如此,我们为什么还没有迁移过去呢?

Pat Gelsinger:

这是一个复杂的供应链,你知道,从未经过大规模测试。 我认为现在,大家都在考虑某种形式的NPO、CPO等,时间节点大约在28、29年,因为如果不做出这种转变,我就无法将纵向扩展环境扩展到大基数的计算集群。所以,很明显Nvidia已经表明了这一点。我认为业内其他所有人都预期,那就是转折点。你知道,说实话,我本不应该构建NVL 72的。它是一个工程奇迹,但也是一个制造噩梦。 你知道,整个行业花了额外一年半的时间来消化这个庞然大物,对吧?

Pat Gelsinger:

真的令人惊叹,你知道,我们能够将其扩展到那种规模。但是,你知道,这确实证明了,如果我们当时拥有更成熟的光学供应链,我们今天会更加先进。 我们今天就能构建更好的纵向扩展环境,更好的功耗表现、更低的成本、更好的能效,但我们当时没有足够成熟的光学供应链来支撑这一切。

Pat Gelsinger:

这些问题解决起来并不简单,还有大量工作要做,但我认为28、29年是产能爆发的年份。

Guido Appenzeller:

我们可能在封装光学器件如何应用于网络方面积累了大量经验,对吧?我认为其中很多经验可以很好地迁移到GPU上。

Pat Gelsinger:

是的,我确实这么认为。但突然之间,你知道,就像,好吧,这些东西必须能在1000万GPU的规模下运行,对吧?它必须能集成进封装里,还有很多其他问题,你知道,很多形式的光学器件不喜欢恶劣的热环境。但猜猜怎么着?恶劣的热环境恰恰是IT领域的常态。 所以我们有热管理问题要处理,封装集成问题要处理。业内激光产能也不够,所以有一堆问题,但我认为这里面没有什么根本性的障碍,只是需要大量艰苦的工作把所有这些部分整合到一起。

Guido Appenzeller:

在网络架构方面,也有一些减法,比如交换,还有什么,更多的电路交换网络,只是因为你无法无限扩展这些非常快速的光网络。

Pat Gelsinger:

好吧,你知道,我喜欢你,Nick McCune或者另一个例子,这里的教授,也是我的好朋友,你知道,我的意思是,你也稍微了解一点,Guido。

Guido Appenzeller:

他是我的论文导师,我……

Pat Gelsinger:

所以,但你知道,他描述得很好,你知道,我们构建网络,是为了能够处理任何数据包去往任何地方,而不需要知道它可能去哪里。当你想到AI的时候,几乎完全相反,对吧?我们处理的是大规模且可预测的数据流。 所以,仅凭这个描述就说明,这看起来更像是电路交换而不是分组交换。所以我确实认为,向光网络迁移与拥有一个更可预测、可管理、大流量的工作负载这两者的融合,对我来说,我确实看到了这一点。是的,我们将一路走到把光引入计算复合体,并且我们将一路走到OCS或某种形式的光交换,你知道,配合更可预测的数据流,那才是正确的架构。

Pat Gelsinger:

然后你会问,这算是纵向扩展还是横向扩展?某种程度上……

Raghu Raghuram:

它某种程度上模糊了这条边界。

Pat Gelsinger:

是的,对吧?如果我的纵向扩展足够大,那么你就只需要问,我的纵向扩展环境的半径是多少? 有一天我想把它连接到其他真正大型的集群上。对我来说,这最终会是一个相当漂亮的答案,你知道,面向未来。但我正看着一个在这方面比我更专业的人。

Guido Appenzeller:

现在,你看,我一直认为纵向扩展与横向扩展在某种程度上是一种人为的区分。你能理解它的来源,对吧?因为我们使用不同的协议,一个是前端,一个是后端网络,等等。所以现在,实际上,它确实有很大的区别,但如果你退一步从系统架构的角度来看,它们实现的是相同的目标,只是略有不同的特点、略有不同的协议,我认为随着时间推移这些会趋于融合。

Raghu Raghuram:

是的,我的意思是,尤其是对于训练工作负载来说。

Guido Appenzeller:

是的,尽管我的意思是训练和推理看起来相当相似。

Pat Gelsinger:

是的,现在我要说,你知道,对吧?你的大脑会停止学习吗?你知道,顺便说一下,这是工作负载演进的另一个特征。我确实认为,训练和推理的分离在未来会越来越少,而不是越来越多,对吧? 这也是反对更多异构架构的一个小论点,我认为是持续学习。我认为会有一些算法领域会说,是的,持续学习成为算法的本质,在那里,是的,我确实希望我的推理环境能够更新我的模型权重,因为,你知道,这给了我越来越多的精细化,在工作负载迁移到那些不那幺正式的训练环境中,或者在那些环境中是更小的数据集的情况下,不断演进。所以我不确定那是不是……

Raghu Raghuram:

但是你需要的节点数量才能有用,推理的直径比训练要小。

Guido Appenzeller:

今天来说确实如此。是的。

Guido Appenzeller:

我仍然认为从另一个角度来看,异构性可能扮演一定角色,那就是不同类型的AI工作负载需要非常不同的底层支持,有些更受算力限制,有些更受内存瓶颈限制。 我们也有小型扩散模型工作负载,对吧?其最优芯片与那种顶级的、拥有……抱歉,50万亿参数权重的LLM看起来非常不同,对吧?后者需要创建大规模集群。我认为这可能会推动异构化。

Pat Gelsinger:

是的,我认为这方面有一定的空间。是的,但我也要说,好吧,现在我在谈论在我的数据中心里让100万个GPU协同工作,对吧?你会说,好吧,对于那个特定的扩散模型工作负载,我确实应该放一些针对性优化的东西,对吧?所以我不会开始放,你知道,1000个那种进去,对吧?而对于那个工作负载,我需要,你知道,2000个这种,然后对于某些……突然之间,你知道,你就失去了规模带来的一些灵活性, 对吧?你会说,你知道,管理和升级、连接、故障域,所有这些事情要花我多少成本?

Guido Appenzeller:

智能体会做所有的升级工作。

Pat Gelsinger:

是的。是的,谢谢你。一切都变得简单了,太好了,我无所谓了。

第9章:能源容量等于经济容量

Raghu Raghuram:

好的,所以车队管理已经讲完了,我们讨论了计算、内存、网络,下一个是电力

Pat Gelsinger:

对对对

Raghu Raghuram:

你提到了芯片内部、芯片上的垂直供电。但我的意思是,还有800伏直流电、数据中心的电力传输,整个生态系统一直延伸到发电,以及相关的社会政治层面,等等。

Pat Gelsinger:

是的,是的。

Pat Gelsinger:

如果你从基本原则出发,我们国家在能源容量方面做得非常糟糕。基本上,我们经历了10到15年,在这段时间里,我淘汰煤炭的速度与增加可再生能源的速度基本持平。

Pat Gelsinger:

国家的整体能源容量基本上停滞不前,这非常不好,因为在人工智能数字时代,能源容量等于经济容量。 所以基本上,作为一个国家,我的经济容量在15年内停滞不前。如果你认同这一点——我认为这在过去五年中是非常可以证明的——我们看到了巨大的涌入,只是为了给我更多的容量。但我认为即便如此,我们国家的能源容量每年增长也只有大约4%,从基本上的0增长到1,对吧?哇,增长了4倍,或者说4%。所以对我来说,这是一个糟糕的局面,我们确实需要更多的能源容量。

Pat Gelsinger:

第一点,显然我们在这个领域有一些公司。

Pat Gelsinger:

我们谈到了核能,其中之一是与Alva合作运营的。我认为核能作为基础负荷是非常好的,我们希望继续建设更多。不幸的是,我们所有的可再生能源都深度依赖中国,这非常令人遗憾。你知道,燃气轮机的交货期目前只需要八年,对吧?所以,我们在快速扩张方面确实面临困难的环境,但首先,我们只是需要更多的容量。这从根本上制约了我们在AI领域能走多远,因为如果我无法为它供电,为什么还要建新的数据中心、购买数百万个GPU呢?我认为你会看到越来越多的数据中心项目出现违约,能源根本无法到位。

Raghu Raghuram:

所以你认为这将是一个重大阻力?

Pat Gelsinger:

我认为这将是一个阻力,而且我认为你已经开始看到一些早期迹象了。Oracle的那个评论,我认为那只是你将要看到的众多案例中的第一个。现在,这并不意味着我们会因此放慢脚步,但我认为人们会开始问:我真的有足够的能源来支撑我为水泥、数据中心机架和GPU采购所做的资本承诺吗?所以你认为这会成为一个上限?我们需要更多的能源容量,需要在这方面进行更多创新,需要在美国建立更多的供应链,核能是我的最爱之一。 美国上一次核反应堆投入使用是什么时候?

Pat Gelsinger:

是20年前了,对吧?我们就这样停止了一个非常有能力的行业。所以这是我们需要更多的领域之一,我们需要在电力传输方面变得更加高效。正如你所说,将数据中心迁移到800伏直流电是绝对必要的,要能够消除沿途许多转换步骤,这些步骤都是由于历史原因和标准化原因造成的。好吧,我们必须解决这个问题,800伏直流电,爱迪生的复仇来临了,我喜欢这么说。我确实认为,我们需要更好的电力转换。我们有几家公司,其中一家做垂直GaN,我认为这将是一项杀手级技术,能够在一个转换步骤中实现800到48、800到12,甚至800到5的转换,这样就能给你提供更多的能量。我们提到了

Raghu Raghuram:

固态变压器,你知道的。

Pat Gelsinger:

是的,所有这些,固态变压器、开关等等,重建整个电力传输网络。我认为这将会有很多创新,就好像,好吧,电力又变得酷了,对吧?然后你在冷却系统中也需要所有这些,对吧?所以会有一系列的创新,涡轮机、制冷剂,突然间它们又成为了令人兴奋的新技术。所以,对于我们所有的硬件人来说,这就像是一场文艺复兴就在我们面前,它将会……

Raghu Raghuram:

25年之后,我不得不回去重新学习卡诺循环

Pat Gelsinger:

卡诺效率,哦是的,这是好东西吗?热力学第一定律是如何对抗的。

Guido Appenzeller:

毕竟这里还有一些东西

Pat Gelsinger:

所以这将是一个令人兴奋的时代。但我们也说,我们需要改变物理规律,因为在过去五代Nvidia芯片中,CMOS在基本功耗、每太浮点运算功耗方面没有任何改善,完全停滞,这是不行的。这就是我们拥有超导公司Snow Cap的意义所在,它提供了从根本上改变物理规律的机会,功耗性能提升一千倍。所以我确实认为,这些创新在不久的将来也将到来。

第 10 章:面向智能体的 VMware

Raghu Raghuram:

在过去这一个小时里,我的时间管理做得很糟糕。有太多话题需要聊,我们没有涵盖到,但在结束之前至少要聊一个。

Pat Gelsinger:

好的,你来主导。

Raghu Raghuram:

好,我是这么想的。现在虚拟机又回来了。你怎么看待这件事,VMware 的未来走向?

Pat Gelsinger:

嗯,你知道……

Guido Appenzeller:

我感觉被排除在这个对话之外了。

Raghu Raghuram:

网络方面也聊聊。

Pat Gelsinger:

是的,我认为每一次创新都会引领出下一个抽象层,对吧?我觉得很多这些想法……你知道,我喜欢说,我们今天的世界有什么新东西?数据结构、算法、抽象……我们把它们追溯到那些基础性的东西。我认为虚拟机这个抽象概念,无论是从基础设施层面还是从应用层面来实现,它仍然是一个基础性的抽象模型,在计算层级中始终有一席之地。 那么,你们觉得呢?我们中有谁要回去重新运营 VMware 吗?

Raghu Raghuram:

是吗?要回到哪一年?

Pat Gelsinger:

是啊。你知道,我确实认为这些抽象概念……但你也要想想。就像我们在 VMware 做的事情,我们基本上管理了计算层级的每一个方面,管理工作负载、管理网络、管理存储系统。你怎么对这些进行抽象?在 AI 的语境下,当我们思考这些智能体的形态时——谁来管理这些智能体?谁来为所有智能体创建安全配置?谁来管理智能体的性能?本质上,虚拟化和管理的每一个基本要素都需要在这个下一代计算层级中被重新构建。会有很多优秀的公司在这方面取得突破,去实现这些事情。

Raghu Raghuram:

你想以网络话题来结尾吗?

Guido Appenzeller:

我想在虚拟机这个话题上再停留一会儿。对我来说最有趣的是,我们现在构建虚拟机是为了让智能体使用,而不是让人类使用。 我们从其他公司迄今看到的是,这会改变很多东西——产品形态会变,你的市场推广方式会变,比如你是否想让智能体来选择你的虚拟机产品,这会改变你能承受的复杂程度,会改变启动速度的要求。人类比智能体耐心得多。所以,如果今天要重建 VMware,它会有什么不同?

Pat Gelsinger:

是的,我确实认为……

Guido Appenzeller:

面向智能体的 VMware。

Pat Gelsinger:

是的。我也确实认为……你知道,需不需要同时有一个面向智能体的 VMware 和一个面向人类的 VMware 呢?

Guido Appenzeller:

我明白你的意思。是的。

Pat Gelsinger:

对。你知道,从某种意义上说,我还是需要人类来参与。

Guido Appenzeller:

我们还是聚焦在智能体上吧,它们现在比人类有趣多了。

Pat Gelsinger:

是的。但是,你知道,我认为这是一个重要的点,因为我确实觉得需要……我借用一下 Dario 的"宪法"概念,就是护栏,或者说能够设置策略。然后你就真的可以说,好,虚拟机的每一个方面,就像我们今天所熟知和喜爱的那样,现在都是在服务智能体,而不是服务硬件和人类。 所以我认为这就成了你的基本设计约束。

Pat Gelsinger:

在这一侧,你要思考:我怎么让智能体变得更好?怎么让它们更安全?怎么让它们性能更强?怎么对它们进行抽象?怎么迁移它们?所有这些问题,都会有新的实现形式,也就是面向智能体的新形态。但同时我也需要思考:人类如何来设置策略、编写"宪法"、获取仪表盘等等。 我认为这才是有趣的地方,因为你两者都需要做,而不是只做其中一个。我要说,就像我们当年为虚拟机所做的那些核心设计难题——是以高性能的方式为应用程序或操作系统抽象硬件——这里,为智能体抽象硬件和操作,是你真正要服务的根本所在。

Raghu Raghuram:

这次讨论非常精彩,非常感谢你的到来,我们下次再聊。

Pat Gelsinger:

两位都是我最喜欢的人,随时奉陪。

Raghu Raghuram:

好的。

Guido Appenzeller:

太棒了,谢谢。

Pat Gelsinger:

谢谢。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10