16万张昇腾950DT:吉瓦级的豪赌
2026年9月,一条消息在国产算力圈炸了锅:DeepSeek计划在内蒙古部署至少16万张华为昇腾950DT芯片,整个园区按吉瓦级电力规划。
数据来源:内蒙古算力产业园区规划文件,2026年9月
这个数字有多大?作为参照,OpenAI在得州Stargate基地的训练集群约10万块GPU。DeepSeek单这一个园区的规模,就已经接近OpenAI的训练算力量级——只不过用途是推理,不是训练。
为什么选内蒙古?三个原因:
- 电力便宜:蒙东风电光伏装机量大,工业电价远低于东部
- 气候凉爽:年平均气温低,数据中心散热成本低
- 政策支持:西部算力枢纽节点,有专项补贴和土地配套
异构推理:分而治之的新范式
比16万张芯片本身更值得关注的,是异构混合推理这条技术路线。
2026中国算力大会上,移动云联合中国电科南湖研究院、灵汐科技、天数智芯、清华、北大联合发布了国内首个国产GPU+类脑芯片大模型异构混合推理系统。
数据来源:2026中国算力大会官方发布
这套系统的核心思路是**“分而治之”**:
- Attention计算:交给国产GPU(昇腾、天数智芯等)
- FFN/MoE专家模块计算:交给类脑芯片(灵汐科技)
为什么要这么分?因为这两类计算的特性完全不同:
| 计算类型 | 特性 | 最适合的硬件 |
|---|---|---|
| Attention | 计算密集、需要高带宽HBM | GPU类芯片 |
| FFN/MoE | 访存密集、规则重复 | 类脑/存算一体芯片 |
把对的任务交给对的硬件,整体性价比直接翻倍。根据官方实测数据:
DeepSeek V4在异构混合推理系统上,相较同类国产GPU集群性价比提升一倍以上,运营成本降低40%。
数据来源:2026中国算力大会技术白皮书
政策风向:从"扩规模"到"优结构"
国产算力的突围,离不开政策面的强力推动:
- 工信部印发《信息通信行业"十五五"规划》,明确算力发展从"扩规模"转向**“优结构”**
- 国常会研究算力网建设,李强总理主持
- 中国工程院院士邬贺铨在公开场合表示:2026年3月日均Token消费已达140万亿,中国算力占全球21%,预计2030年有望占30%
数据来源:工信部官网;国务院新闻发布会;邬贺铨公开演讲
“优结构"这三个字值得细细品味。过去几年国内建了大量数据中心,但很多利用率不高。现在政策导向变了——不再比谁建得多,而是比谁算得高效。
国产芯片厂商的财报验证
资本和市场的用脚投票,最终会体现在财报上:
| 公司 | 2026上半年营收 | 同比增长 | 备注 |
|---|---|---|---|
| 寒武纪 | 59.96亿元 | +108.1% | 思元系列芯片放量 |
| 摩尔线程 | 17.36亿元 | +147.42% | 启动赴港上市 |
数据来源:寒武纪2026半年报;摩尔线程招股书(赴港上市申请)
寒武纪营收翻倍、摩尔线程接近1.5倍增长——这些数字说明国产AI芯片正在从"政策采购"走向"真实商业需求”。16万张昇腾950DT的订单,就是这种需求的具象化。
还没解决的问题
国产算力的突围不是已经成功了,而是刚刚开始。几个关键问题依然存在:
软件生态
CUDA生态用了十年才建起来。昇腾的CANN、摩尔线程的MUSA,在算子覆盖度和工具链成熟度上,与CUDA仍有代差。异构推理系统就是为了绕开这个短板——用架构创新补软件短板。
先进制程限制
昇腾950DT基于什么制程?这是行业一直关注但没有官方确认的问题。在先进制程受限的背景下,如何通过架构创新(如3D堆叠、Chiplet)弥补制程差距,是国产芯片的核心命题。
模型适配
不是所有模型都能轻松跑在国产芯片上。DeepSeek愿意把V4跑在昇腾上,是因为DeepSeek本身就是架构创新者,习惯做软硬件协同优化。其他模型公司呢?
结语:异构推理是弯道超车的机会
英伟达的护城河不只是硬件,而是CUDA+CUDA+CUDA。单纯在GPU架构上追赶,很难绕开这个生态壁垒。
但异构推理是另一个游戏。当计算被拆成"GPU管Attention、类脑管FFN",谁来调度这些异构芯片?谁来做模型层面的适配优化?这些问题上,英伟达的CUDA优势并不明显。
国产算力的突围,可能不是在GPU正面战场打赢,而是在新的计算架构上另开一局。
本文首发于guijiagi.com,更多国产算力与芯片产业深度分析欢迎访问硅基AGI论坛 silicon-agi.com。