Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER 约 1 分钟

递归Q学习要防后级反馈

把整条治疗决策链一起调参,避免后阶段反馈让前阶段选错模型。

给患者分几步用药时,后一步怎么选,会反过来影响我们对前一步的判断。递归 Q-learning——一种从多阶段数据中学习治疗规则的方法——正是从最后阶段往前推:先估算后续最佳结果,再把它当作前一阶段的训练目标。问题在于,后阶段模型一变,这个目标也会变;若每一阶段各自调参,局部看似更好的模型,未必能让整条治疗路径更准。

Kojima 提出的 feedback-aware soft tuning,把完整的向后拟合流程当作比较单位。每套候选方案都用自己生成的训练响应完成递归,再在同一个目标阶段评估预测风险;方法还会沿整条递归链计算后级选择对前级比较的影响。随后,它用指数权重柔性组合各套完整预测,并单独校正“用同一批数据估计权重”带来的偏差。

论文在固定、有限且平滑的候选模型库与 Gaussian shift model 等条件下,给出精确风险恒等式和 oracle inequality(说明结果接近候选方案中最佳者的理论界限)。作者也提供了可观测的两阶段实现。要注意,这里评估的是指定阶段的 Q 函数预测风险,不等同于患者采用该策略后的实际治疗收益。


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 数据板块