你告诉模型“某人的母亲是某位女士”,再问“这位女士的孩子是谁”,它可能突然答不上来。这不是关系太复杂,而是模型记住事实的方式可能带着方向。所谓“Reversal Curse(反转诅咒)”,说的正是模型会沿训练时的表述检索,却不会自然地反向检索。
据原始论文,研究者让 GPT-3 和 Llama-1 学习虚构的“人名—描述”事实。模型按训练方向回答得出来,反向提问时却接近随机猜测,正确名字获得的概率也没有高于随机名字。真实名人测试中,论文报告 GPT-4 在一个方向上答对 79%,反向只有 33%。
问题并非模型完全不会反转:如果事实直接写在当前提示里,它通常能据此推回去。困难主要出现在事实只存进训练权重后。作者提出一种尚未定论的解释:自回归语言模型——根据前文预测下一个词的模型——训练时只被奖励“看到 A 后预测 B”,不会同步学会“看到 B 后找回 A”。这提醒我们,训练数据不能只换几种说法,评测也要把同一关系的两个方向都问一遍。