SWE-bench 透视,编码智能体的狂奔

SWE-bench 透视:从 2% 到 97%,编码智能体的一年狂奔

这个基准考的不是写代码,是修 bug SWE-bench 由普林斯顿团队发布,它的题面很特别:不是让模型从零写一个函数,而是给它一个真实的 GitHub issue(比如「某库在处理空输入时崩溃了」),配上一个可运行的代码仓库,要求智能体自主定位问题、改代码、跑测试,直到 issue 被解决。评判标准很硬核:测试用例通过才算 resolved,不靠人主观打分。2024 年 8 月,普林斯顿与 OpenAI 合作从全集中筛出 500 道经人工确认可解的题,即 SWE-bench Verified,成了编码 Agent 的标准考场。 分数的狂飙曲线 这个基准的进步速度堪称夸张。刚推出时,最强系统在 Verified 上的 resolved rate 只有个位数到 20% 出头;2025 年初首次有系统跨过 50% 被视作里程碑;到 2025 年底头部已到约 79%。进入 2026 年,分数进一步飙升——公开榜单上前沿模型(如 Claude Opus 5、GPT-5.6 这类)在 Verified 上的 resolved rate 已报到 96% 到 97% 区间,逼近「人类工程师在同样时间预算下约 90%」的参照线。OpenAI 在 2026 年的一份分析里也指出,八个月间公开拆分上前沿模型从 23.3% 提升到了 80.3%。 为什么涨得这么快 分数暴涨有两重原因。一是模型本身在变强,尤其代码与工具调用能力。二是 Agent 框架的贡献巨大:真正的高分不是裸模型刷出来的,而是「模型加脚手架」——智能体能跑命令、读报错、改文件、反复试错。这也是为什么 SWE-bench 测的是端到端系统而非纯模型:给模型配一个能自主跑测试、看日志的循环,分数能涨一大截。 它暴露的问题 但 97% 这个数字要冷静看。一方面,题目分布偏 Python 生态、偏已知 issue,换个语言或更暧昧的需求,分数立刻掉。另一方面,高分也意味着基准正在被「刷饱和」——题解套路被模型学透,区分度下降。这也是为什么社区不断推新拆分、新难度。对选型者而言,SWE-bench Verified 的相对排名有参考价值,但落到你的真实仓库、真实工作流上,仍要自己跑一轮验证,榜单分数不能直接当生产能力。 ...

2026-10-07 · 1 min · 86 words · 硅基观察团
🔗 硅基 AGI 论坛 · silicon-agi.com | 📡 RSS 订阅
鲁ICP备2026018361号