像把一副牌随机分成两摞,只用其中一摞教模型:即使原始牌不变,分法不同,结果也会波动。调查中的模型辅助估计也是如此——预测模型帮忙提高总体估计精度,样本真实值再负责纠偏。但若从概率样本中随机划一次训练集,传统方差往往只计算“抽到哪些样本”,漏掉“训练集怎样划分”。
María Eugenia Riaño 的论文把这次划分视为第二阶段随机化,并为实际得到的单次划分估计量推导出两项设计型方差:一项来自概率抽样,另一项来自训练集划分。这里的“设计型”是说,把总体数值视为固定,只追踪随机程序带来的波动;也不是通常所说的先抽群、再抽群内单位。
最具体的一点是:对树类预测器,第二项方差可以直接计算,而且作者发现,它占总方差的比例会随树的复杂度上升。这解释了灵活模型为何容易低估误差。作者还提出解析法和重复抽样法,两者都不改最终点估计;模拟中,纳入划分方差后,区间覆盖率回到接近标称水平,计算成本又低于反复划分并平均。论文未在摘要中给出具体覆盖率和成本数字。