一条被改写的算力分配曲线

AI基础设施的钱,过去主要花在两个地方:训练(把模型练出来)和推理(把模型用起来)。在很长一段时间里,训练是绝对主角——几家巨头烧掉巨资去训练旗舰模型,推理只是训练的"附带品"。

2026年,这条曲线被改写:推理算力占AI基础设施支出的比例首次超过70%。 这是一个结构性转折点,意味着AI行业第一次进入"用得比练得更贵"的阶段。

数据来源:行业AI基础设施支出结构统计,2026年

Token调用量:推理需求的硬证据

为什么推理突然变贵了?答案藏在调用量里。

OpenRouter的数据显示,2026年4月全球AI大模型周调用量达到27万亿Token。这是一个什么概念?它意味着模型不再是少数研究员在实验室里调用,而是被海量用户、海量应用、海量Agent日复一日地高频使用。每一次聊天、每一次检索、每一次Agent自动执行任务,都在持续燃烧推理算力。

更值得中国读者关注的是结构:中国周调用量达到12.96万亿Token,连续五周超过美国。这说明推理侧的繁荣不是某一家厂商的事,而是由真实应用生态撑起来的——调用量上的反超,往往比训练参数上的领先更能反映一个市场的活跃度。

“三分之二,未来八成”

百度副总裁石清华给出了一个被广泛引用的判断:推理带来的算力增量占比将达到三分之二,未来甚至超过80%。

这个预测如果成立,AI基建的投资逻辑就要重写:

  • 过去买GPU是为了"炼大模型",资本看的是参数与榜单;
  • 未来买GPU是为了"扛调用量",资本看的是QPS、Token吞吐、单位成本;
  • 数据中心的选址、电力、网络互联,都要围绕"推理延迟与密度"重新设计。

换句话说,AI基建从"研发驱动"转向"运营驱动"。这更像电信运营商的生意,而不是实验室的生意。

训练与推理的此消彼长

需要强调的是,推理超越训练不等于训练不重要。旗舰模型仍然需要海量训练投入,RSI(递归自我改进)时代甚至会让训练需求继续上升。真正发生的变化是:

  • 训练是脉冲式的——集中投入、周期性爆发;
  • 推理是持续式的——7×24小时、随用户规模线性增长。

当应用生态足够大,持续式的推理总量终将压过脉冲式的训练峰值。这也是为什么云厂商和芯片厂商都在拼命布局推理芯片、推理优化和低成本推理集群。

行业影响

对guijiagi.com长期跟踪的AI产业链而言,推理算力占比越过70%是一个分水岭信号。它告诉我们:AI的商业模式正在从"卖模型能力"走向"卖调用服务",谁能把单位Token成本压到最低、把推理延迟做到最低,谁就能在这场基建竞赛中胜出。

当27万亿Token每周在全球流转,AI已经不是一门"做产品"的生意,而是一门"运算力"的生意。下一阶段的竞争,是电力、网络、芯片与调度系统的综合较量——这也是为什么"推理超越训练"会和"AI电力约束"成为同一枚硬币的两面。