Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.076 — 2026-09-18
PAPER H 16 约 1 分钟

多源数据的预测区间不必一锅端

按待预测对象挑选最匹配的数据源,让分布变化时的预测区间仍有覆盖保障。

假设几家医院都在预测患者的治疗反应:有的更熟悉年轻患者,有的积累了更多慢病病例。把数据混成一锅,差异会被抹平;各算各的,又浪费了互补信息。这篇论文提出 MS-RLCP,让系统面对新患者时,优先采用在其附近样本更充足的数据源,再给出预测区间——未来结果可能落入的范围。

具体来说,每个数据源先独立运行局部化共形预测:依据与当前对象相似的历史样本及其预测误差来校准区间。测试时,方法再自适应选择局部代表性更强的来源,无需共享训练数据或合并模型。作者证明,只要各来源与测试人群在特征相同的情况下遵循相同的结果规律,MS-RLCP 就有有限样本覆盖率界;测试人群也不必恰好是各来源人群的混合,只需落在它们合计覆盖的特征范围内。换句话说,它不是无条件抵抗任意分布变化,但为“新来的人群不像任何一家、局部却有据可查”的场景给出了可解释保障。


供稿材料 SOURCES — 1

← 返回 2026-09-18 · 数据板块