把模型下载到自己电脑上,就像把一台机器连同控制面板一起交出去:使用者能自由改装,也能拆掉原有的安全限制。Baseten旗下研究部门Base Labs正与Hugging Face、Goodfire合作,为这类“开放权重模型”建设通用的安全评测与监控基础设施——前者在发布前寻找危险能力,后者在运行中观察异常行为。
这项合作值得关注,因为拆除护栏已不是纯理论风险。TechCrunch报道,Hugging Face目前列有超过6000个经过“abliteration”处理的模型;这种方法通过修改模型内部表示,削弱或移除拒答机制。三方分别覆盖模型运行、分发和内部行为观察,Base Labs还将公开训练与监控方法,并邀请开发者共同完善框架。不过,合作方尚未披露具体技术方案,因此它目前更像一套公开建设中的安全标准,而不是已经验证完毕的成品。