一年一度的“AI春晚”如期开幕。当地时间3月16日,英伟达创始人兼CEO黄仁勋在美国圣何塞举行的GTC 2026大会上发表主题演讲,正式推出新一代Vera Rubin全栈AI计算平台,并宣布将2025至2027年累计收入指引上调至至少1万亿美元——相比此前预期直接翻倍。
7种芯片+5种机架,重新定义AI工厂
Vera Rubin平台是英伟达为智能体AI时代设计的完整计算系统,共包含7种芯片:Rubin GPU、Vera CPU、NVLink 6交换机、ConnectX-9超级网卡、BlueField-4 DPU、Spectrum-6以太网交换机,以及与Groq协同集成的Groq 3 LPU,覆盖计算、推理、网络与存储全链路。
整套平台由40个机柜组成,分为5种标准化机架:Rubin计算柜、CPU柜、LPX推理柜、存储柜和CPO交换柜,数量配比为16:2:10:2:10。所有机架采用统一MGX模块化架构与100%液冷、无缆化设计,整机安装时间从两天缩短至两小时,部署效率大幅提升。
性能方面,Vera CPU采用88核Arm架构,单线程性能提升50%,成为智能体任务调度的核心;通过NVLink 6互联,整机算力达到3.6 EFLOPS。软件层面,英伟达还推出了面向企业智能体的NemoClaw安全方案,并断言SaaS将全面转向“智能体即服务”(AaaS)。
推理拐点:LPU补上低延迟短板
本届GTC的核心议题之一是“推理拐点”。大模型推理分为Prefill和Decode两个阶段,GPU擅长前者的矩阵计算,但在后者的顺序生成中算力利用率偏低。Groq 3 LPU正是为优化Decode阶段而生:约500MB片上SRAM、近150TB/s的片上带宽、1.2 PFLOPs的FP8算力,通过数据流架构将数据留在芯片内高速流动,大幅降低解码延迟。
在Vera Rubin平台中,GPU与LPU基于Dynamo框架异构协同:GPU处理高吞吐任务,LPU专攻低延迟解码。这一组合使每兆瓦推理吞吐量最高提升35倍,万亿参数模型的收益潜力提升10倍,单Token成本降至Blackwell平台的十分之一。
CPO量产落地,光铜协同路线确立
随着高性能芯片规模化应用,传统可插拔光模块在功耗和带宽密度上逐渐触及物理天花板。大会发布了全球首款量产的Spectrum-X CPO交换机,将信号传输距离从厘米级缩短至1毫米以内,能耗仅为传统铜缆的5%,传输损耗降低60%。
黄仁勋在路线上明确表态“铜和光都会作为选择”,确立了铜缆扩展、光学扩展、CPO扩展并行推进的协同格局,彻底打消了市场对“铜退光进”替代逻辑的忧虑。
影响展望
Vera Rubin平台标志着英伟达从“卖芯片”进一步走向“交付AI工厂”:数据中心正在转型为生产Token的“AI工厂”,Token成为核心数字商品。对产业链而言,平台的全系统设计将带动高端PCB、光模块、导热材料、液冷等环节的升级需求,而推理成本的大幅下降则有望加速智能体在企业核心场景的落地。