体检模型拿到很高的 ROC-AUC,不代表它适合用来决定谁该进一步检查。ROC-AUC 衡量的是排序能力:随机抽一名患者和一名健康人,模型有多大概率把患者排得更高。R-bloggers 的这篇演示从零计算 ROC 曲线,在各有 15 个阳性和阴性的模拟数据上得到 0.933 的 AUC。但这个漂亮数字没有回答一个更实际的问题:按模型提示采取行动,究竟值不值。
问题在于,真正患病的人很少时,即使假阳性率不高,大量健康人仍可能制造许多假警报,阳性结果未必可信。模型还可能校准不佳——比如口头报出“20% 风险”,实际发生率却并非约 20%。这些情况都能与高 AUC 同时存在。文章因此把检查推进到决策曲线分析(DCA):它把漏诊和不必要干预的代价折算成净收益,并在不同风险阈值下,将模型与“全部干预”“全部不干预”比较。说白了,AUC 问谁排在前面,DCA 才进一步问:照这个排名办事,是否真的划算。