引子:从"断供阴影"到"16万颗订单"
2026年下半年,国产算力赛道最受关注的消息莫过于华为昇腾950的量产节奏。更具标志性的细节是:DeepSeek已经订购了16万颗950DT。一个国内头部大模型公司,把下一代训练与推理的算力主力押在昇腾上——这个订单本身,就是国产算力逆袭的最好注脚。
要理解这件事的分量,得回到三年前。那时国产AI芯片还在"能用"和"好用"之间苦苦挣扎,主流大模型的训练几乎绕不开NVIDIA。而今天,昇腾950已经走到了"被顶级模型厂商批量采购"的阶段。这条路,走得比所有人预想的都快。
产品矩阵:950PR与950DT的分工
昇腾950不是单一款芯片,而是一个清晰的产品矩阵。理解它,先要分清两个型号。
| 型号 | 定位 | 量产状态 | 关键规格 |
|---|---|---|---|
| 昇腾950PR | 推理/通用计算 | 已量产 | FP4算力2 PFLOPS,144GB HBM |
| 昇腾950DT | 训练/高密度 | 预计Q4量产 | 面向大规模训练集群 |
950PR已经量产落地,主打推理与通用计算场景;950DT则瞄准训练,预计2026年第四季度量产。DeepSeek那16万颗的大单,主要指向的就是950DT——它要扛的是下一代大模型训练这种最吃算力的活。
把关键规格拆开看:FP4算力2 PFLOPS、144GB HBM。FP4是2026年训练推理的主流低精度格式,2 PFLOPS的单卡算力已经达到主流训练卡的第一梯队;144GB HBM则保证了它能塞下大模型的权重与激活值,在单卡和多卡场景之间游刃有余。
数据来源:华为官方披露与产业链消息,2026年Q3
16万颗订单背后的信任投票
DeepSeek一口气订16万颗950DT,这不是一个小数字。它意味着三件事:
第一,国产芯片已经过了"能不能跑通"的阶段。 如果只是能点亮、能跑个demo,没有哪家模型公司敢下16万颗的重注。这说明昇腾950在大规模集群下的稳定性、软件栈适配、训练收敛性都已经达到可商用水平。
第二,自主可控从"口号"变成"采购决策"。 模型厂商把算力主力放在国产芯片上,既有供应链安全的考量,也有成本考量。当国产芯片的性价比开始接近甚至优于受限于出口管制的进口方案,迁移就是理性选择。
第三,DeepSeek与昇腾形成了闭环。 模型公司为国产芯片定制算子、优化框架,芯片厂商为模型公司调优硬件——这种双向绑定,是国产生态真正跑起来的标志。
软件栈:比硬件更难的一仗
做AI芯片,硬件只是入场券,真正的护城河是软件栈。这一点,过去几年NVIDIA靠CUDA建立了几乎不可撼动的优势。昇腾要逆袭,绕不开这道坎。
| 层面 | 挑战 | 昇腾的应对 |
|---|---|---|
| 编程框架 | 替代CUDA生态 | 自研CANN与迁移工具 |
| 算子适配 | 新模型算子移植 | 与头部模型公司联合优化 |
| 集群调度 | 千卡万卡稳定性 | 大规模并行训练实践 |
DeepSeek的16万颗订单之所以关键,正是因为它倒逼昇腾把最复杂的训练场景啃下来。当一套国产软件栈能稳定支撑顶级模型的训练,生态飞轮就转起来了——更多模型公司敢用,芯片厂商就更有动力优化。
与NVIDIA生态的差距与现实
冷静地看,昇腾950的逆袭是"追赶到可用",还不是"全面超越"。
在单卡峰值算力、HBM容量、互联带宽这些硬指标上,昇腾950与同期NVIDIA旗舰仍有差距;在软件生态的成熟度上,CUDA十几年积累的优势也不是一朝一夕能抹平的。昇腾的打法是务实的——不追求每一项都领先,而是在国产供应链约束下做到"够用、稳定、可大规模部署"。
这种"够用就好"的哲学,恰恰是现实的。当外部供应受限,能稳定拿到、能大规模部署、能跑通主流模型,本身就是巨大的竞争力。144GB HBM、2 PFLOPS FP4的规格,已经足以撑起绝大部分训练与推理需求。
行业影响:国产算力进入"规模化采购"阶段
昇腾950的量产与16万颗订单,标志着国产AI算力跨进了一个新阶段。
第一,供应链安全成为采购硬指标。 越来越多模型公司会把"能否用国产芯片跑通"纳入下一代算力规划,而不是等到断供那天才临时抱佛脚。
第二,国产生态从"试点"走向"主力"。 当DeepSeek这样的头部公司把16万颗950DT作为主力,昇腾就不再只是备选方案,而是正经的算力供给方。
第三,算力议价权开始转移。 有了国产替代,国内模型厂商在面对进口芯片时终于有了谈判筹码。这对整个行业的长期成本结构是利好。
结语:逆袭是一场长跑
华为昇腾950的故事,不是一夜翻盘的爽文,而是一条厚积薄发的长路。950PR量产、950DT Q4量产、DeepSeek 16万颗订单——这几个节点拼在一起,勾勒出国产算力从"能用"到"好用"再到"被主力采购"的完整轨迹。
当然,逆袭远未到终点。软件生态的成熟、互联带宽的追赶、先进制程的产能爬坡,每一项都是硬骨头。但方向已经板上钉钉:国产算力不再是备胎,它正在成为主力。
对行业观察者而言,接下来最值得盯的就是950DT在Q4量产后,DeepSeek那16万颗芯片到底训练出了什么样的模型——那才是这场逆袭最有说服力的成绩单。
更多关于国产算力产业链的深度追踪,请持续关注guijiagi.com。