给顾客定价或为患者选剂量时,算法面对的不是几个固定按钮,而是一整段连续数值。它还会根据此前结果调整下一次选择:表现好的区域被试得更多,其他区域越来越少。这样收来的数据并不像固定随机试验那样整齐,直接计算平均效果和标准误,可能低估不确定性。
这篇论文把统计推断推进到连续动作的 contextual bandit——会结合当前情境,一边尝试、一边偏向较优选择的算法。核心做法是核平滑:因为完全相同的价格或剂量很少反复出现,研究者让邻近数值按距离共享信息;再配合双重稳健估计,同时利用“算法为何选择该动作”和“动作之后结果如何”两个模型。论文一个值得注意的设计是平滑基于结果预测的直接估计项,而非只在目标动作处取值,以适应持续更新、探索概率逐渐下降的数据。
作者给出了均方误差、渐近正态性和估计下界,并把推断精度写成带宽、最低探索强度与 regret(因探索而少拿到的回报)之间的权衡。说白了,算法若太快锁定眼前最优值,短期表现可能更好,却会让附近样本不足、结论难以置信;这项工作的价值,是为“赚得更多”和“说得更准”提供同一套分析框架。