让 AI 写一段演示代码不难,难的是把它真正交给用户。生产代码一旦出错,可能影响安全、数据和服务可用性。Anthropic 的 Boris Cherny 表示,Claude 写出的生产代码应达到比人类代码更高的门槛,因为缺少足够约束,项目日后可能变得混乱、难以维护。
据 Simon Willison 转引,Anthropic 为此设置了多层护栏:大量 Lint 规则——按预设规则拦截常见错误;大量测试;由 Claude 执行端到端测试,从用户入口一路检查后台结果;每天运行 Claude 驱动的 Fuzzing,即用大量异常或随机输入寻找崩溃和漏洞;此外还有自动代码审查、安全审查和重构。
值得注意的不是“AI 会写代码”,而是责任门槛正在改变:编码 Agent 越能自主修改项目,企业越不能把“能运行”当成“可上线”。这段引述没有披露各项措施的覆盖率或实际效果,但给出了一个现实参照:AI 生成得越快,进入生产环境前的验证反而要更严。