同样没用的两个特征,一个是年龄,一个是血型,树模型却可能觉得年龄更重要。原因很机械:连续变量可尝试的切分点更多,更容易偶然切出一条“漂亮”分界线。Li 与 Melikechi 研究的正是这种偏心。论文证明,在所有特征都与结果无关的设定下,随着样本增多,CART——一种反复切分数据的决策树算法——会以趋近于 1 的概率优先选择连续变量;在限定深度等条件下,分类变量得到的 MDI 重要性甚至趋近于零。MDI 指特征通过切分让数据变得更整齐的程度,但它只是模型内部指标,不代表因果关系。
作者给出的修正很简单:把分类值编码成整数,再加入少量均匀随机噪声,让每条记录略有差异。噪声幅度小于 0.5 时,原有类别不会互相重叠,却能让分类变量获得与连续变量相近的候选切分数量。按作者实验,这种“抖动”无需改写树算法,计算开销低,对噪声大小也不敏感;每棵树重新加噪的排名略好于只加一次,但差距不大。论文还将它接入稳定选择——反复扰动并保留经常入选的变量——以控制误选。具体效果仍主要来自作者的模拟与真实数据实验。