Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.080 — 2026-09-22
NEWS 约 1 分钟

Bootstrap何时胜过正态近似

偏态数据里,样本上万也未必够;Bootstrap虽更稳,却不是万能保险。

IMAGE — R-bloggers(R 社区聚合)

算平均收入时,少数极高收入会把数据拖出一条长尾。即使样本看起来不少,常见的“均值近似钟形分布”也可能尚未成立,按正态近似算出的95%置信区间——反复抽样时应有约95%的区间罩住真值——便可能过于乐观。

作者用多种严重偏态分布做模拟,对比传统正态区间与 BCa Bootstrap。Bootstrap 是从现有样本中反复“有放回重抽”,借重抽结果估计均值会怎样波动;BCa 版本还会校正偏差和偏斜。作者报告,Bootstrap 的覆盖率明显更好,优势在小样本时尤其突出,但两种方法都低于目标的95%。

更值得记住的是边界:问题不只出在样本量10、30或200;作者称,在某些偏态分布下,即使达到1,000、10,000乃至50,000,统计推断仍可能受限。原文未给出可引用的具体覆盖率数字,也尚未进一步分析置信区间不对称带来的问题。


供稿材料 SOURCES — 1

← 返回 2026-09-22 · 数据板块