代码改动一多,通用 AI 审查工具就可能像匆忙翻卷子的老师:只看部分文件,指出的问题还对不上具体行。阿里开源的 Open Code Review 想解决这种不稳定。它是一款 CLI(通过文字命令操作的工具),会读取 Git diff——也就是本次代码改了什么——再让 LLM Agent(能调用工具、分步骤办事的大语言模型程序)结合完整文件和代码库上下文,给出精确到行的审查意见。
它最值得留意的地方,是没有把流程全交给模型。文件筛选、相关文件分组、规则匹配和意见定位由确定性程序约束;需要理解上下文和判断缺陷的部分再交给 Agent。项目方称,该工具源自阿里内部助手,过去两年服务数万名开发者、发现数百万个代码缺陷;其公开基准覆盖 50 个开源仓库、200 个真实 Pull Request 和 10 种语言,并由 80 多名资深工程师交叉验证。项目方还称,相同模型下,它比通用 Agent 的 Precision(报告中真问题的比例)和 F1 更高,耗费约九分之一的 token,但 Recall(实际缺陷被找出的比例)较低。这是用少打扰换取少误报的明确取舍。单日新增 326 星,也说明开发团队正在关注这种“硬规则管流程、模型做判断”的组合。