像一件送检时正常、压缩打包后才露出机关的产品:研究者提出 AgentQ,让开放权重 Agent 在全精度审计中表现正常,却在量化部署后触发后门。量化就是把模型参数“四舍五入”成更少位数,以节省内存、加快运行;问题在于,这一步可能成为攻击开关。
AgentQ 先用 LoRA——一种只调整少量参数的微调方法——把恶意行为限制在部分网络层,再修复全精度模型的正常表现,同时避开负责工具调用格式的关键层。这样,量化后的 Agent 仍能生成合法的结构化工具调用,也就是可被系统直接执行的函数名和参数,而不只是可疑文字。
作者在三种触发—动作组合及 NF4、FP4、INT8 三种量化格式上测试,报告量化后攻击成功率最高达 100%,正常任务能力损失很小。一个 9B 模型案例更直观:两套服务读取完全相同的权重,FP16 版本行为正常,NF4 版本却在每次探测中触发攻击。它提醒我们:开放权重 Agent 的安全审计不能只查原始模型,还要检查最终部署的量化版本。