像老师说“全班九成及格”,并不代表每个小组都学得一样好。共形预测也有类似问题:它用校准数据为预测划出一个集合,并承诺真实答案长期约有九成落在其中。但把所有样本合起来达标,可能掩盖困难区域的欠覆盖。
SimplexUQ专门检查这种“苦乐不均”。它面向单纯形值预测——多个非负分量、总和为1的向量,例如分类概率或细胞类型比例。研究没有提出新算法,而是固定预测器、评分方式和分组规则,只替换不同的共形校准方案,在12项任务上比较总体覆盖率、最差分组覆盖率和组间差距。
最直观的结果来自CIFAR-10:统一阈值的总体覆盖率为0.900,最差熵分组却只有0.542;按分组分别校准的Mondrian方法把后者提高到0.886,并将最大差距从0.358降至0.022。不过作者也发现,没有一种方案在所有任务和评估方式下都占优。这些是经验比较,不是新的覆盖保证;真正值得记住的是,总体数字漂亮,不等于每个区域都可靠。