给城市画空气污染地图时,相邻监测站往往一起偏高或偏低。普通 split conformal prediction(先留出一批数据,再用其预测误差决定区间宽度)却把这些误差当成可以公平比较的一组样本。遇到空间依赖和非随机的站点布局,这种对称性——可交换性——可能消失,原本的覆盖保证也会失效。
Sen 与 Saha 的论文提出序贯白化:利用估计的协方差,依次让每个校准残差参考此前残差,剥离可预测的空间关联,再拿处理后的误差校准区间。关键之处是,它不仅利用训练阶段的残差,还利用校准残差本身携带的空间信息;最近邻近似则让方法能扩展到大型空间网络。作者证明,当工作协方差正确、残差服从椭圆分布时,无论采样点怎样布局,都能获得精确的有限样本覆盖;协方差设错时,保证会打折,因此论文也给出覆盖损失界和欠覆盖风险诊断。作者报告,在模拟和全美 PM2.5 应用中,该方法得到更窄、更稳定的区间,并标出可能覆盖不足的区域。