普通程序错误像一道答案固定的题;并发故障更像几个人同时改一份表格,操作顺序稍有变化,问题就可能消失或重现。SWE-Race因此不考写新功能,而是让编码Agent独立排查188个真实故障,包括竞态条件(多个任务同时读写造成结果不定)、死锁(任务彼此等待而卡住)和取消故障(任务中止后清理或状态传递出错)。
据项目作者在 Reddit 介绍,这些任务取自约100个Python项目已经合并的PR,并由项目自身的测试判分。运行环境断网,代码库也被截在单个提交上,防止Agent从Git历史直接找回现成修复。最值得注意的是难度分层:约一半任务对所有参测模型都接近满分,真正拉开差距的是另一半,三个模型在这些难题上的成绩分别为50%、45%和23%。换句话说,只看总分容易掩盖编码Agent处理棘手并发问题的差异。作者还报告,GLM-5.3 Flash单次尝试得分85%;允许两至三次尝试时为82%,与GPT-5.6 Luna的81%处于误差范围内。