查一个黑箱 AI 是否偏向某些人群,像抽查一座仓库:预算有限时,不必每箱都开,也不能只盯着已经出过问题的角落。群体越多、交叉子群体越细,逐一取得人工标签就越贵。Ajarra 和 Basu 提出的 ALeBi,尝试主动挑选下一批最值得核验的案例,在追查已显露偏差的区域与探索样本不足的群体之间取舍。
它的关键工具是 bias probe(偏差探针)——专门比较受保护群体之间差异的简单函数。审计者只向黑箱模型提交精心选择的输入、观察输出,不必先复制整个模型;探针还能指出哪些数据区域偏差较高或较低。作者给出了样本复杂度保证——也就是达到一定审计可靠度大致需要多少查询——并分析了模型方刻意掩盖偏差的情形。论文还指出,保护模型机密与保证审计可靠之间存在根本取舍;所给材料未披露具体节省比例,实际成本优势仍需结合完整实验判断。