三国杀的开局

2026年下半年,AI芯片市场的格局正在从"英伟达一家独大"演变为"三国杀"。

一方是坐稳王座的NVIDIA,携Vera Rubin平台蓄势待发;一方是步步紧逼的AMD,用Helios机架方案撬动Oracle等大客户;第三方则是不按常理出牌的OpenAI,联手Broadcom推出自研推理ASIC——Jalapeño。

这场战争的核心不是训练算力,而是推理成本。随着大模型从实验室走向生产环境,“每百万Token的推理成本"正在取代"训练集群规模"成为竞争焦点。

NVIDIA Vera Rubin:十倍成本压缩

Vera Rubin NVL72是NVIDIA下一代推理平台,核心参数如下:

  • 72 GPU架构的NVL72机架
  • Rubin GPU:3360亿晶体管
  • 288GB HBM4 per GPU
  • 带宽22TB/s
  • 推理Token成本降至Blackwell的1/10

数据来源:NVIDIA GTC 2026秋季发布会

“成本降至1/10"这个数字需要仔细解读。它不是说每块卡的性能提升10倍,而是说在完成同等推理任务时,总拥有成本(TCO)降低到原来的十分之一。这得益于几个因素的叠加:

  1. HBM4带宽提升,减少了数据搬运瓶颈
  2. 新架构对稀疏计算的支持更好
  3. NVLink互连优化,多卡推理效率提升
  4. 软件栈成熟度进一步提高

AMD Helios:用容量打带宽

AMD的Helios机架方案走的是另一条路线——拼显存容量

  • 72块MI455X GPU per机架
  • 每卡432GB HBM4(比NVIDIA Vera Rubin单卡288GB高出50%
  • MXFP4算力40.26 PFLOPS per GPU
  • 整机架2.9 exaFLOPS FP4
  • 整机架31TB HBM4
  • 定价500-550万美元/柜

数据来源:AMD Advancing AI 2026发布会

AMD的策略很清晰:在单卡算力上追赶NVIDIA不现实,但在显存容量上做文章是可行的。大模型推理的瓶颈经常不在计算而在显存——当模型权重、KV Cache、激活值都需要塞进显存时,更大的HBM容量意味着更少的分层计算,反而可能降低推理延迟。

Oracle已经下单50,000块MI450系列GPU,这是AMD在AI推理市场拿到的最大单笔订单。

OpenAI Jalapeño:自己干,便宜一半

最让人意外的选手是OpenAI自己。Jalapeño是OpenAI与Broadcom合作的首款自研推理ASIC

  • 9个月从概念到芯片流片
  • 声称比NVIDIA GPU便宜50%/Token
  • 能效比1.5-1.9倍
  • 延迟低1.7-3.6倍
  • 2026年底开始部署

数据来源:OpenAI技术博客,2026年9月

OpenAI做自研芯片的逻辑很直白:自己每年花在GPU租赁上的钱是天文数字,与其一直给NVIDIA交租,不如自己设计一颗只为推理优化的专用芯片。ASIC不需要像GPU那样兼容通用计算,只需要为Transformer推理做极致优化——面积利用率和能效比自然上来。

但Jalapeño的挑战也很明显:生态。GPU之所以强大,不只是因为硬件,而是因为CUDA生态。一颗只跑推理的ASIC,软件栈能否支撑所有模型架构?这个问题要到2026年底实际部署后才能回答。

财报对比:王座依然稳固

数字最有说服力。我们来看最新的季度财报:

指标NVIDIAAMD
FY2027 Q2营收962.21亿美元(+106%)115亿美元(+50%)
数据中心营收890亿美元67亿美元(+107%)
Q3指引1080亿美元

数据来源:NVIDIA FY2027 Q2财报;AMD 2026 Q2财报

全球十大无晶圆厂IC设计公司Q2合计营收1414.5亿美元(同比+73%),其中NVIDIA独占64%。这个份额意味着,在AI芯片这场战争中,AMD和OpenAI加起来也才刚开始追。

谁是赢家?取决于你问谁

  • 如果你是云厂商(Oracle、AWS):你需要多供应商策略。NVIDIA是基本盘,AMD是议价筹码,OpenAI ASIC是长期对冲。
  • 如果你是大模型公司(OpenAI、Anthropic):Jalapeño这类自研ASIC是战略必然——当推理量到了每年百亿美元级别,省下来的每一分钱都是利润。
  • 如果你是企业IT部门:现在还不是换芯片的时候。Vera Rubin和Helios都要等2027年才能大规模交付,先把现有GPU集群的利用率跑满才是正事。

结语:推理成本才是终局之战

训练算力的竞争正在让位于推理成本的竞争。当大模型从Demo走向生产,每百万Token的价格就是产品定价的底线。

NVIDIA Vera Rubin把成本压到1/10,AMD Helios用50%的显存容量差打差异化,OpenAI Jalapeño直接砍半——三种策略指向同一个方向:让AI推理便宜到可以无限调用

当推理成本趋近于零的时候,真正的竞争才刚开始。

更多AI芯片产业的深度分析,欢迎访问guijiagi.com,也可在硅基AGI论坛 silicon-agi.com参与技术路线讨论。