三国杀的开局
2026年下半年,AI芯片市场的格局正在从"英伟达一家独大"演变为"三国杀"。
一方是坐稳王座的NVIDIA,携Vera Rubin平台蓄势待发;一方是步步紧逼的AMD,用Helios机架方案撬动Oracle等大客户;第三方则是不按常理出牌的OpenAI,联手Broadcom推出自研推理ASIC——Jalapeño。
这场战争的核心不是训练算力,而是推理成本。随着大模型从实验室走向生产环境,“每百万Token的推理成本"正在取代"训练集群规模"成为竞争焦点。
NVIDIA Vera Rubin:十倍成本压缩
Vera Rubin NVL72是NVIDIA下一代推理平台,核心参数如下:
- 72 GPU架构的NVL72机架
- Rubin GPU:3360亿晶体管
- 288GB HBM4 per GPU
- 带宽22TB/s
- 推理Token成本降至Blackwell的1/10
数据来源:NVIDIA GTC 2026秋季发布会
“成本降至1/10"这个数字需要仔细解读。它不是说每块卡的性能提升10倍,而是说在完成同等推理任务时,总拥有成本(TCO)降低到原来的十分之一。这得益于几个因素的叠加:
- HBM4带宽提升,减少了数据搬运瓶颈
- 新架构对稀疏计算的支持更好
- NVLink互连优化,多卡推理效率提升
- 软件栈成熟度进一步提高
AMD Helios:用容量打带宽
AMD的Helios机架方案走的是另一条路线——拼显存容量:
- 72块MI455X GPU per机架
- 每卡432GB HBM4(比NVIDIA Vera Rubin单卡288GB高出50%)
- MXFP4算力40.26 PFLOPS per GPU
- 整机架2.9 exaFLOPS FP4
- 整机架31TB HBM4
- 定价500-550万美元/柜
数据来源:AMD Advancing AI 2026发布会
AMD的策略很清晰:在单卡算力上追赶NVIDIA不现实,但在显存容量上做文章是可行的。大模型推理的瓶颈经常不在计算而在显存——当模型权重、KV Cache、激活值都需要塞进显存时,更大的HBM容量意味着更少的分层计算,反而可能降低推理延迟。
Oracle已经下单50,000块MI450系列GPU,这是AMD在AI推理市场拿到的最大单笔订单。
OpenAI Jalapeño:自己干,便宜一半
最让人意外的选手是OpenAI自己。Jalapeño是OpenAI与Broadcom合作的首款自研推理ASIC:
- 9个月从概念到芯片流片
- 声称比NVIDIA GPU便宜50%/Token
- 能效比1.5-1.9倍
- 延迟低1.7-3.6倍
- 2026年底开始部署
数据来源:OpenAI技术博客,2026年9月
OpenAI做自研芯片的逻辑很直白:自己每年花在GPU租赁上的钱是天文数字,与其一直给NVIDIA交租,不如自己设计一颗只为推理优化的专用芯片。ASIC不需要像GPU那样兼容通用计算,只需要为Transformer推理做极致优化——面积利用率和能效比自然上来。
但Jalapeño的挑战也很明显:生态。GPU之所以强大,不只是因为硬件,而是因为CUDA生态。一颗只跑推理的ASIC,软件栈能否支撑所有模型架构?这个问题要到2026年底实际部署后才能回答。
财报对比:王座依然稳固
数字最有说服力。我们来看最新的季度财报:
| 指标 | NVIDIA | AMD |
|---|---|---|
| FY2027 Q2营收 | 962.21亿美元(+106%) | 115亿美元(+50%) |
| 数据中心营收 | 890亿美元 | 67亿美元(+107%) |
| Q3指引 | 1080亿美元 | — |
数据来源:NVIDIA FY2027 Q2财报;AMD 2026 Q2财报
全球十大无晶圆厂IC设计公司Q2合计营收1414.5亿美元(同比+73%),其中NVIDIA独占64%。这个份额意味着,在AI芯片这场战争中,AMD和OpenAI加起来也才刚开始追。
谁是赢家?取决于你问谁
- 如果你是云厂商(Oracle、AWS):你需要多供应商策略。NVIDIA是基本盘,AMD是议价筹码,OpenAI ASIC是长期对冲。
- 如果你是大模型公司(OpenAI、Anthropic):Jalapeño这类自研ASIC是战略必然——当推理量到了每年百亿美元级别,省下来的每一分钱都是利润。
- 如果你是企业IT部门:现在还不是换芯片的时候。Vera Rubin和Helios都要等2027年才能大规模交付,先把现有GPU集群的利用率跑满才是正事。
结语:推理成本才是终局之战
训练算力的竞争正在让位于推理成本的竞争。当大模型从Demo走向生产,每百万Token的价格就是产品定价的底线。
NVIDIA Vera Rubin把成本压到1/10,AMD Helios用50%的显存容量差打差异化,OpenAI Jalapeño直接砍半——三种策略指向同一个方向:让AI推理便宜到可以无限调用。
当推理成本趋近于零的时候,真正的竞争才刚开始。
更多AI芯片产业的深度分析,欢迎访问guijiagi.com,也可在硅基AGI论坛 silicon-agi.com参与技术路线讨论。