编程榜单的王座换人了

2026年9月2日,阿里通义更新Qwen3.8-Max。这次更新最直接的信号是:在编程能力评测CodeArena上,Qwen3.8-Max评分提升22分,达到1691分,登顶全球第一,压过了Claude Opus5和Kimi K3。

CodeArena 1691分意味着什么

CodeArena是2026年大模型编程能力评测的重要基准之一,它考察的不是刷LeetCode题的纸面分数,而是模型在真实软件工程任务上的表现:读懂一个大型代码库、定位bug、跨文件修改、遵循项目规范。这种任务比单文件代码生成难得多,也是Cursor、Claude Code这类AI编程工具最核心的能力要求。

模型CodeArena评分相对位置
Qwen3.8-Max1691全球第一(+22分)
Claude Opus5紧随其后被反超
Kimi K3紧随其后被反超

Qwen3.8-Max这次是"提升22分"后登顶,说明它不是靠一次大版本跃迁,而是在持续的迭代中一点点把编程能力磨上去的。这种渐进式提升比一次性跑分爆发更有含金量,因为它反映的是真实训练流程的改进——比如代码语料的清洗、SFT数据质量的提升、强化学习在多文件任务上的优化。

每百万Tokens 5美元的成本

比登顶更重要的数字是成本:每百万Tokens综合平均仅5美元。这个价格在2026年的旗舰模型市场是什么水平?作为对比,OpenAI、Anthropic的旗舰模型API价格在每百万Tokens十几到几十美元区间,而Qwen3.8-Max把"全球第一编程能力"和"5美元成本"这两件事同时做到了。

这是一个非常聪明的商业定位:你想让用户为AI编程付费,光说"我比别人强"不够,还得说"我比别人便宜十倍"。5美元/百万Tokens的价格,让企业把Claude Code、Cursor这类工具的后端从海外模型切到Qwen的决策门槛变得极低。

千问办公3000万用户

与此同时,阿里披露千问办公用户突破3000万。这是一个比模型榜单更扎实的数字——它说明Qwen不是只在开发者圈子里有名,而是真的走进了办公室、写文档、做表格、处理邮件。3000万用户的使用数据反过来又成为模型训练的燃料,形成"用得越多→模型越好→用户越多"的飞轮。

行业影响

Qwen3.8-Max登顶CodeArena,加上5美元的成本,对海外编程模型厂商是直接的价格冲击。2026年编程模型市场的格局正在从"美国厂商定义标准"转向"中国厂商以性价比重构市场"。Claude Opus5和GPT系列依然在通用推理上领先,但在"写代码"这个最容易商业化的垂直场景,Qwen用"能力第一+成本1/3"的组合,正在抢占开发者心智。

对国内开发者来说,这意味着以后写代码的默认AI助手,很可能不再是Cursor背后的Claude,而是千问生态里某个集成了Qwen3.8-Max的国产工具。模型能力第一,成本足够低,再加上3000万办公用户的场景数据——这三者叠加,就是阿里在大模型应用层最深的护城河。

为什么是CodeArena而不是SWE-bench

值得留意的是,这次Qwen3.8-Max选择在CodeArena上公布登顶,而不是更常被引用的SWE-bench。两个评测的侧重不同:SWE-bench更偏"从GitHub真实issue复现修复",任务分布偏窄;CodeArena覆盖更广泛的真实软件工程任务,包括跨文件重构、遗留代码迁移、测试补全等。Qwen选择CodeArena,说明其训练团队在数据构建上刻意往"真实工程工作流"倾斜,而不是在单一基准上刷分。

每百万Tokens 5美元的综合平均成本,还隐含一个商业细节:这不是"输入价格"也不是"输出价格",而是综合平均。意味着阿里在定价上做了场景化拆分——短输入便宜、长输入略贵、输出按量计费,但把常见对话场景的加权平均值压到了5美元。这种定价方式对企业做成本测算非常友好,因为客户不需要自己去估输入输出比例,直接用综合成本做预算就行。

3000万千问办公用户则是这个定价策略的底气:当C端和办公场景的调用量足够大,阿里可以用规模摊薄推理成本,再把摊薄后的低价反哺开发者市场。这是一个"消费端养推理端、推理端抢开发者"的飞轮。

guijiagi.com 会持续跟踪CodeArena、SWE-bench等编程基准上的中美模型格局变化。