做问卷时,高收入者可能更不愿填写收入。若把这些空白当成随机丢失,算出的平均值和误差范围都可能过于乐观。Ma 等人研究的是:当一部分数据符合 MCAR(缺失与数值无关),另一部分可能是 MNAR(缺失仍与缺失值本身有关)时,怎样为总体均值给出可靠的置信区间——也就是反复抽样时,能按约定比例覆盖真实均值的范围。
论文把两种缺失机制放进同一个“污染”模型,并让区间自行适应可能未知的污染比例等参数。一个具体结果是:在 Gaussian 基础分布下,当污染参数已知时,标准差未知与已知所能达到的最优区间长度处于同一数量级。作者还为 Gaussian 分布及满足特定尾部或对称条件的非参数分布,给出了明确、有限样本有效的区间构造,并称其达到相应的 minimax 速率——即按最不利数据情形衡量也接近最短。价值不在于替分析者猜出缺失者的答案,而在于不再悄悄把“完全随机缺失”当作默认事实。