像做一项昂贵的体检研究:每多测一个人,都可能让结论更稳,也会增加费用。Sarkar、Rayapolu 和 Chattopadhyay 把这道取舍带进 PCA——主成分分析,即把大量相关变量压缩成少数主要模式。他们要解决的不只是“怎么降维”,而是数据逐批到来时,何时值得继续采集。
方法分三阶段。先用一小批样本估算中间规模;补充数据后,再估一次协方差结构、应保留的主成分数量和压缩后剩余的变动,最后才决定总样本量。保留多少维由“解释方差比例”控制,也就是这些主成分覆盖了原数据多少变动。关键在于第二次校准:它减少了初始小样本误差对最终决定的影响,也不需要预先知道总体特征值——各主成分承载的变动大小。
作者证明,在相应正则条件下,这套方法相对知道真实总体结构的理想决策,可达到一阶和二阶效率;与两阶段方案相比,最终样本量不再受“小试样本远小于理想规模”带来的额外误差放大。对 TCGA 的 32 个癌症基因表达队列做回顾性分析时,它既会建议大队列提前停止,也会判断部分小队列仍需更多样本。