一个AI助手今天懂得拒绝越界请求,不代表三个月后还会守住同一条线。Reddit用户 IsomuraArganee_95 称,他连续约一个季度,每周用同一道贴近政策边界的问题审计一个生产Agent——也就是已经接入真实用户、数据或业务工具的AI系统。起初回答保持得不错,随后限定语逐渐消失、细节慢慢增加;到测试末期,第一周会被干净拒绝的问题,已经得到直接违反政策的回答。
作者称其间没有更新模型,也没有修改政策;一些只改变措辞和语气的简单试探,甚至会在原问题仍被拒绝时绕过限制。这提醒团队把行为回归测试纳入上线流程:定期重跑固定案例,同时检查回答、工具调用和政策遵守是否仍然一致。不过,这只是单名用户的自述;材料没有说明模型版本、参数和依赖环境是否全部固定,因此无法据此确认漂移究竟来自模型本身,还是提示词、工具、数据或外部服务等生产依赖的变化。