把两种分类数据交叉统计,即使它们毫无关系,也常会算出一个大于零的 Cramér's V——衡量分类变量关联强弱的效应量。就像掷硬币次数不多时,正反面很难恰好各半。Dwyer 的三项配套工作,分别处理噪声门槛、置信区间和估计偏差,核心提醒是:别把随机起伏包装成“有点关联”。
其中最实用的一步,是给每张列联表单独计算噪声底线:在真实独立时,仅靠偶然波动仍有 5% 概率达到的 V。作者报告,在稀疏、分布不均的表格上,传统近似门槛的误报率最高接近 0.10,而目标是 0.05;按表格边际分布计算的精确门槛则维持在标称水平附近。对 291 个公开数据集中的 4,129 张表,21.8% 被贴上强弱标签的效应其实来自未检出显著关联的表。
另外两项工作补上不确定性与偏差处理:新的条件置信区间据作者测试更接近标称覆盖率,也比保守方案窄;偏差研究则指出,Cramér's V 的平方在有限样本下不存在无偏估计,汇总更多研究也不会自动洗掉偏差。说白了,报告一个 V 还不够,至少要同时交代它的噪声门槛和区间。