Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
REPO 171 STARS 约 1 分钟

Heretic尝试自动移除模型审查

自动压低模型拒答率,还尽量保留原有能力,Heretic因此单日新增257星。

IMAGE — GitHub Trending(Python·日榜)

你问模型一个敏感问题,它常常直接拒答。Heretic 想把这种“刹车”自动拆掉:不用再做成本较高的后训练,也不要求使用者理解模型内部结构。单日新增257星,说明这类修改工具正快速吸引关注,也让模型该由谁控制、边界放在哪里变得更难回避。

它采用 Directional ablation(方向消融)——找到模型内部与拒答相关的方向,再将其削弱;随后用 Optuna 自动寻找参数,同时压低拒答次数和 KL divergence(衡量修改前后输出分布差异的指标)。在项目给出的 Gemma 3 12B 测试中,原模型对100条“有害”提示拒答97次,Heretic 版本只拒答3次;其 KL 散度为0.16,低于两个人工消融版本的1.04和0.45。作者据此认为,它在减少拒答的同时较少损伤原模型能力。

不过,这些数字来自项目方测试,且作者注明结果可能随平台和硬件变化;自动指标也不能替代人工评估。更关键的是,减少拒答既意味着更强的使用者控制,也意味着原有安全边界被主动移除。


供稿材料 SOURCES — 1
01
p-e-w/heretic GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-10-05 · 开源板块