招聘模型不看性别,不代表就公平:邮编、职业等变量仍可能暗含群体信息。Sulem 和 Jewson提出 Fair Lasso 与贝叶斯版 Fair ℓ₀-ball prior,在挑选变量时同时衡量两件事:它对结果的预测力有多强,以及它与敏感群体身份的依赖有多弱。依赖越强,入选时受到的惩罚越大。这样,公平约束不再是模型训练后的“补丁”,而是进入模型前就参与决定哪些信息可以使用。
这项工作的难点在于,群体公平——让不同群体的录取率等统计结果接近——与个体公平——让相似的人得到相似处理——通常不能同时做到。作者让用户设定“不可接受的不公平预算”,在预测准确度与两类公平之间取舍;选出的变量也可作为条件人口统计公平中的“正当变量”。贝叶斯版本还会给出变量入选或排除的不确定性,有助于警惕误选。论文称其在合成数据和两个真实基准数据集上取得较好的准确度—公平折中;但材料未披露具体数值,也未显示对假发现率——入选变量中实际无关者的平均占比——提供正式控制保证。