61万亿对21万亿:20周的领跑
2026年9月第二周(9月7日-9月13日),OpenRouter发布了最新一期全球大模型调用量统计。这一次的数据再次刷新了认知:
- 全球总调用量:127万亿Token,环比增长10.43%
- 中国大模型周调用量:61.17万亿Token
- 美国大模型周调用量:21.76万亿Token
数据来源:OpenRouter周度报告,2026年9月14日
中国大模型调用量已经连续20周超过美国。20周,整整五个月——这不再是"偶然波动",而是一个结构性趋势。
更值得关注的是全球前五的排名:
| 排名 | 模型 | 周调用量(万亿Token) | 国别 |
|---|---|---|---|
| 1 | OpenAI GPT系列 | — | 美国 |
| 2 | 腾讯混元Hy4 preview | 16.8 | 中国 |
| 3 | 智谱GLM 5.3 Flash | 11.9 | 中国 |
| 4 | DeepSeek V4 Flash | 11.6 | 中国 |
| 5 | 小米MiMo-V2.5 | 7.77(环比+230%) | 中国 |
数据来源:OpenRouter周度报告,2026年9月14日
全球前五名中,四款是中国模型。这一格局在一年前是不可想象的。
DeepSeek V4.1 Flash:三天冲上第六
9月10日,DeepSeek发布V4.1 Flash。上线仅三天,周调用量已达4.94万亿Token,直接冲到全球第六。这个上升速度在大模型历史上极为罕见。
V4.1 Flash的核心参数:
- 552B参数MoE架构,输入激活8B / 输出激活16B
- Causal-Encoder-Decoder新架构设计
- 原生多模态视觉理解
- KV Cache对HBM需求降至1/4
数据来源:DeepSeek官方技术报告,2026年9月10日
为什么Causal-Encoder-Decoder是关键创新?
传统大模型要么是Decoder-only(GPT系列),要么是Encoder-Decoder(T5系列)。DeepSeek V4.1 Flash提出的Causal-Encoder-Decoder架构,本质上是把Encoder的双向注意力能力和Decoder的自回归生成能力做了一个融合。
这种设计带来的直接好处是:视觉理解能力原生集成。以往多模态模型需要外挂一个视觉编码器再接LLM,而V4.1 Flash在架构层面就把视觉token和文本token放在同一个处理流程中,减少了信息损失。
KV Cache降至1/4:算力经济学的胜利
KV Cache是推理成本的大头。传统架构中,随着对话轮数增加,KV Cache线性膨胀,HBM带宽成为瓶颈。DeepSeek通过分组注意力(GQA)优化和稀疏KV策略,将KV Cache对HBM的需求降到了同类模型的四分之一。
这意味着同样的HBM容量,V4.1 Flash可以服务4倍的并发用户。这直接转化为价格优势。
定价拆解:缓存命中级别的成本优势
DeepSeek V4.1 Flash的定价策略极具攻击性:
| 场景 | 输入价格(元/百万Token) | 输出价格(元/百万Token) |
|---|---|---|
| 闲时缓存命中 | 0.02 | 4.0 |
| 闲时未命中 | 约0.4 | 4.0 |
| 高峰时段 | 上述价格×2 | 上述价格×2 |
数据来源:DeepSeek API定价页,2026年9月
与上一代相比:
- 缓存命中输入降价60%
- 未命中输入降价33.3%
- 输出降价11.1%
这组定价策略的核心逻辑是:用缓存命中来摊薄固定成本。大量企业级应用的请求模式是重复的(比如客服问答、文档摘要),缓存命中率往往超过70%。这意味着实际综合成本远低于标价。
能力验证:Terminal-Bench与DeepSWE
光便宜不够,还得能打。V4.1 Flash在两个硬核基准上的表现:
- Terminal-Bench 2.1:90.6分(衡量终端操作和任务自动化能力)
- DeepSWE v1.1:74.2分(衡量软件工程任务完成能力)
数据来源:DeepSeek官方技术报告,2026年9月
这两个基准的含金量在于,它们不考选择题,考的是真实任务执行。Terminal-Bench要求模型在Linux终端中完成一系列复杂操作,DeepSWE要求模型自主修复GitHub上的真实issue。90.6和74.2的得分,在同尺寸模型中属于第一梯队。
中国大模型的"量"与"质"
调用量连续20周领跑全球,当然值得高兴。但我们需要清醒地问一个问题:调用量等于技术领先吗?
答案是不完全等于。中国大模型调用量大,有三个结构性原因:
- 用户基数大:中国互联网用户超过10亿,AI应用渗透率仍在快速提升
- 价格优势:DeepSeek、智谱等模型的API价格仅为GPT系列的1/5到1/10
- 应用场景下沉:大量客服、内容生成、企业自动化场景对成本敏感,天然偏好高性价比模型
但从另一个角度看,调用量本身就是价值。模型调用越多,反馈数据越多,迭代越快。DeepSeek V4.1 Flash三天冲上第六,说明"量大→数据多→迭代快→更强→量更大"的飞轮已经转起来了。
结语:从"跟跑"到"并跑"
2026年下半年的中国大模型格局,已经不能简单用"追赶者"来定义了。在调用量这个最市场化的指标上,中国模型已经领先;在技术创新层面,DeepSeek的Causal-Encoder-Decoder架构也展现出了不同于OpenAI路线的独立思考。
下一个值得关注的问题是:当调用量足够大之后,中国大模型能否在最前沿的推理能力上也完成超越? 这个问题的答案,可能就在下一个版本的DeepSeek上。
更多中国大模型的深度技术拆解,欢迎关注硅基AGI论坛 silicon-agi.com,也可以访问guijiagi.com获取最新AI行业分析。