样本不多时,逻辑回归的“体检报告”可能不太可信:明明模型没错,传统拟合优度检验——判断数据与模型是否相容的工具——也可能误报。DeepGOF-1 想把发现问题和控制误报拆开处理:神经网络负责找异常,Bootstrap 负责校准结论。
它先按两个最重要特征的排序,把数据铺成 6×6 网格;每格记录标准化残差,也就是预测与实际观察的偏离。遗漏的非线性、交互作用等结构,会在图上留下条纹或局部凸起。一个预先训练、交付后不再改动的卷积网络读取这张“残差图”并打分。分析者无需训练模型,而是在拟合模型成立的前提下反复模拟、重新拟合和打分,再看真实得分在这些结果中的排名,由此得到 p 值。
作者报告,在预先设定的 60 种实验条件中,DeepGOF-1 有 58 种的误报率落在目标区间;公开基准中,它的误报水平在 13 种方法里最稳定,检验力胜过所有分组型检验,但综合只排第七。边界也很明确:若异常在每个网格内互相抵消,这张图就看不见;而参数由数据估计时,严格的有限样本保证仍依赖“枢轴性”条件,否则只能得到渐近保证。