人类历史上规模最大的资本开支建设正在展开。从衡量系统真实性能的"goodput"指标,到光路交换网络、轨道数据中心,再到十年后的算力形态,谷歌AI基础设施负责人Amin Vahdat在近期一次深度对谈中,系统梳理了这场建设背后的技术逻辑与战略取舍。
谷歌今年资本开支预计超过2000亿美元,大部分用于数据中心建设。Vahdat在接受Sequoia Capital合伙人Sonia Huang访谈时表示,长程智能体(long-horizon agent)的崛起正在从根本上改变数据中心的设计逻辑,不仅推高了对加速器的需求,也让CPU、网络与存储的需求同步"暴涨"。他同时透露,谷歌必须大约每六个月将服务侧token生成能力翻一倍,而这一增长的主要来源并非硬件本身,而是软件与模型优化的持续叠加。
对投资者而言,Vahdat的判断具有直接参考价值:电力是AI基础设施扩张的最根本瓶颈,而非芯片或制造产能;软件优化对容量提升的贡献"很可能不少于硬件";TPU路线图上,推理与训练芯片已于今年首次分拆为独立产品线,折射出推理市场的快速膨胀。
不是FLOPS,是Goodput:真实故障条件下的问责逻辑
Vahdat将FLOPS定性为"虚荣指标",认为它只反映单颗芯片的理论上限,而实际工作负载性能取决于数千乃至数万颗加速器、CPU、网络和存储如何协同运作。
"在10万加速器规模上,总会有东西在坏,一直如此,"他说。一旦同步工作负载中任何一个组件失败,整个系统可能需要回滚至上一个检查点重新计算,这部分"无效工功"正是goodput与throughput之间的差值所在。他将其类比为在纸上解题:每次因错误回到第一步,过程本身虽然消耗了计算资源,但并不算作有效交付。
Agent时代重塑数据中心架构:CPU与存储需求同步爆发
Vahdat将长程智能体的兴起视为过去一年内影响数据中心设计的最大结构性变量。
在传统人机交互模式下,用户读取模型响应、思考、再次输入,中间存在数秒乃至数十秒的"人类节拍",这天然限制了请求频率。而在智能体场景中,模型无需等待人类,响应延迟可从秒级压缩至毫秒级,请求密度呈数量级提升。
同时,智能体在推理和编排环节大量依赖CPU:解析上一步响应、判断下一步行动、从本地DRAM、远端内存、SSD或HDD中抓取上下文——这些操作均运行于CPU而非加速器之上。"加速计算需求在上升,但CPU、网络、存储等传统数据中心组件的需求也在暴涨,"Vahdat说。
这直接引发了数据中心布局的两难:若在GPU/TPU机架旁配置大量CPU机架,将破坏针对加速器的专用化设计;若将两类机架分置于不同建筑,则楼间网络将引入数百微秒的排队延迟,并显著拉升可靠性与成本压力。
TPU首度拆分推理与训练:芯片专用化的边界在哪里
谷歌今年发布的TPU第8代首次分拆为两颗独立芯片:8i用于推理,8t用于训练。Vahdat将这一决策定性为对推理市场规模预判的直接结果。
在此前的单芯片策略下,一颗芯片需同时兼顾推理与训练,两类工作负载均无法得到极致优化。随着推理在总算力需求中的占比预计升至50%乃至更高,专门化的边际收益开始超过专用化带来的灵活性损失。
不过,Vahdat强调,这次拆分设置了一个关键安全阀:8i和8t均保留了执行对方工作负载的能力,只是非专长方向性能有所折损。"如果8i完全不能做训练,我们就必须提前精准预测六年生命周期内两类负载各自的需求量,"他解释道,这将带来难以承受的预测风险。
在更宏观的专用化哲学上,Vahdat描述了一条从通用GPU到Transformer原语固化,乃至"将特定模型架构烧入硅片"的连续谱系,并表示已有公司开始探索最后一步。谷歌目前的判断是:Transformer所依赖的矩阵乘法、softMax等线性代数原语已基本固化于硬件,进一步专用化到具体模型层是"非常非常有趣的方向",但尚未落地。
光路交换:从MEMS反射镜到毫秒级故障切换
谷歌约15年前率先将波分复用(WDM)引入数据中心,随后叠加了光路交换(optical circuit switching)技术——后者在纯光域内完成数据路由,绕过了传统电分组交换逐包查表的电域处理环节。
Vahdat介绍,谷歌最初采用MEMS微机电开关,通过在三维空间内精确控制微型反射镜的角度,将任意输入光纤端口的光信号导向指定输出端口,实现可编程的光域路由。这一技术最初服务于两个目标:在高频通信的计算集群与存储集群之间建立光域捷径;以及在无需人工移动光纤的前提下,通过软件控制器动态重构网络拓扑以实现扩缩容。
在TPU集群中,光路交换还具备关键的容错价值:当某个TPU机架发生故障时,系统可在毫秒级内将光路重新指向备用机架,无需任何物理操作,直接压缩goodput损失。
Vahdat透露,轨道数据中心场景下,组件间将真正转向自由空间激光通信——这也是他在地面场景中回避该方案的原因(衰减损耗与大规模三维对准难度过高),但在太空环境中上述限制大幅弱化。
电力是根本瓶颈:与公用事业共同规划多年,吉瓦级需求重塑供电模式
被问及AI基础设施扩张的最大约束,Vahdat的回答直接而明确:"电力是我们面临的最fundamental约束。其他所有问题我们似乎都知道如何在一段时间内解决;电力则是长期binding问题。"
谷歌的首选模式是与公用事业并网,而非自建独立电源。原因在于统计复用效应:若完全自给,达到99.99%以上可靠性意味着需建设两倍装机容量;而通过与公用事业的长期协同,在更大基数上平滑需求波动,双方均可降低冗余成本。谷歌承诺自行承担因其接入所需新增的输电线路和变电站建设费用,以避免将成本转嫁至其他用户。
但供需错配现实存在。Vahdat举例:若某年需要1吉瓦,而公用事业当年只能提供700兆瓦,谷歌可能临时自建太阳能+储能以填补缺口,并在最热月份将本地发电回馈电网。
DeepMind协同设计:在芯片"飞行途中"拦截架构
Vahdat将与DeepMind的协作描述为"深度合作伙伴关系",并以"在芯片架构飞行途中做修改"来形容其紧密程度。
谷歌同时推进五至六代TPU:已量产、调试上线、即将tape-out、设计中、概念阶段,构成一条横跨数年的并行流水线。不同阶段对应不同深度的协同窗口:对已量产芯片,重点在于共同最大化goodput;对即将tape-out的芯片,若DeepMind提出能带来重大收益的模型优化,双方可以紧急评估是否值得推迟tape-out以纳入硬件修改——"叫停一次tape-out是大事,但如果机会足够大,我们绝对会一起努力";对设计阶段的芯片,则进行三至四年维度的模型架构趋势共预测,依托仿真基础设施评估不同硬件架构对未来工作负载的适配度。
Vahdat还披露,谷歌目前已在使用Gemini为未来版本的Gemini设计硬件,形成模型辅助芯片设计的自我强化闭环。他和DeepMind的Koray及Demis"每周都会多次交流"。
2036年的超级计算机:单机架多兆瓦,或直接发射入轨
对于十年后算力形态的预判,Vahdat给出了两条并行路径。
在地面形态上,他预计集成度将大幅提升,机架将从外部可见的繁复光纤束演变为"只有一小束光纤从机架里出来"的高度集成单元。单个机架功耗可能达到数兆瓦量级,进场安装仅需接入电、水、光纤三路即可运行——制造与部署将更趋向模块化工厂预制。
在轨道路径上,谷歌已将轨道数据中心列为正式在推进的moonshot项目,核心逻辑在于能源优势:太空中无大气衰减使可用功率天然高出约40%;太阳同步轨道可实现98%至100%的日照覆盖,而地面设施通常仅为28%至35%,叠加后的能量密度优势可达3至4倍,且无碳排放。
主要挑战在于冷却(太空散热反而更难)、可靠性维修(硬件损坏后维修难度远高于地面)以及组件间通信(将被迫采用自由空间激光而非光纤)。Vahdat表示,这些问题"没有根本性showstopper",并开玩笑称2036年或许真能"把机架发射升空,由空间站机械臂接住,插进正确模块"。
以下为访谈全文:
速看:黄仁勋 GTC 2025 演讲 —— Agentic AI 崛起,物理 AI 重塑世界
2025年3月18日英伟达GTC大会上,黄仁勋围绕“Agentic AI与物理AI的未来”主题,系统阐述了AI技术演进路径、硬件创新、软件生态及行业合作战略,揭示了英伟达在AI领域的核心布局与技术突破。
一、AI技术演进:从生成式到物理AI的跨越黄仁勋提出AI技术发展的三大阶段:
当前进展:AI技术正处于从生成式向Agentic AI过渡的关键阶段,物理AI将成为未来核心方向。
二、硬件创新:算力与能效的双重突破1. 消费级显卡:GeForce RTX 5090 2. 企业级平台:Blackwell Ultra 图:Blackwell Ultra平台通过NVLink 72集群实现算力跃升 3. 下一代架构预告 4. 硅光子技术 三、NVIDIA GB300:新一代AI芯片的革新1. 性能参数 2. 架构设计 3. 应用场景 4. 电源与散热 四、推理算力与软件系统:动态优化与开源生态1. 推理算力需求激增 2. Dynamo操作系统 图:Blackwell架构在推理性能上实现代际跃升 五、物理AI与机器人生态:从模型到产业的落地1. 开源人形机器人模型 2. Omniverse数字孪生 3. 机器人市场前景 图:Isaac GR00T N1模型支持多场景机器人应用 六、软件生态与行业合作:构建AI技术壁垒1. CUDA生态进化 2. 企业AI方案 3. 语义存储与6G合作 4. 量子计算研究 七、市场展望与挑战:技术领先与商业化的平衡总结:黄仁勋的演讲系统展示了英伟达在AI芯片、算法、生态及行业合作上的全面布局。 物理AI与Agentic AI的提出,标志着AI技术从虚拟内容生成向物理世界操控的跨越,而硬件与软件的协同创新将推动这一进程加速。 尽管面临股价波动等挑战,英伟达仍致力于通过技术迭代与生态构建,重塑计算行业的未来格局。
Agent需要多少算力?巴克莱:占总计算需求的70%以上,支出还要3000亿!
到2026年,AI推理计算需求将占总计算需求的70%以上,行业需增加芯片资本支出至近3000亿美元以满足需求。具体分析如下:
重磅!5年破解黎曼猜想,10年接管人类认知,AI超级增长曲线揭秘
AI在算力扩张、认知任务自动化及经济影响方面将呈现超级增长曲线,预计2030年前后在数学领域(如黎曼猜想)取得突破,2035年可能推动经济年增长10%并实现认知任务自动化,最终迈向全面AI经济时代。 以下是具体分析:
一、算力扩张:增速放缓但规模持续扩大 二、数学与物理突破:AI或解黎曼猜想 三、认知任务自动化:2035年成本低于人类 四、经济增长:2035年或达年增10% 五、AI超级增长曲线的三个阶段 六、关键挑战与不确定性总结:AI的超级增长曲线已清晰可见,其算力扩张、认知自动化和经济影响将呈现阶段性爆发。 尽管存在技术、成本和社会挑战,但2030年前后数学突破、2035年经济起飞和全面自动化仍是高概率事件。 未来十年将是人类与AI协同进化的关键期。













发表评论