Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.079 — 2026-09-21
PAPER H 15 约 8 分钟

DiD失灵时,偏差从哪里来

把DiD偏差拆成“选择、趋势、对齐”三股力量,让稳健性判断不再只靠平行趋势检验。

你想比较提高最低工资的州和没有提高的州,看看政策是否影响青少年就业。可实行政策的地方往往本来就不一样:人口、贫困率、教育程度,甚至一些没有被记录的因素,都可能同时影响政策选择和就业走势。这样一来,双重差分算出的“政策效果”,可能混进了这些差异。

一篇新的 arXiv 论文试图回答一个比“平行趋势是否成立”更具体的问题:如果平行趋势确实被未观测因素破坏,偏差究竟从哪里来,又要多强的混杂才能推翻结论?论文把偏差拆成几股可以分别讨论的力量,并据此设计敏感性统计量。以下结论均来自作者 Juejue Wang、Pedro H. C. Sant’Anna、Victor Chernozhukov 和 Carlos Cinelli 的论文,尚无独立研究交叉验证。

DiD到底在比较什么

双重差分(Difference-in-Differences,DiD)先看处理组在事件前后变化多少,再减去控制组同期的变化。例如,某些地区提高最低工资后,青少年就业下降了;但未提高最低工资的地区也可能因为经济环境而下降。两边变化之差,才被用来估计政策影响。

这套方法依赖平行趋势假设:如果没有政策,两组的结果原本会沿着相同趋势变化。问题在于,政策已经发生后,我们不可能观察处理组“没有接受政策时”的就业结果。这个反事实只能借控制组推测,因此平行趋势本质上无法直接检验。

研究者通常会看政策实施前的走势是否接近,也会检查两组在可观测特征上是否平衡。但政策前走势相似,不保证政策后仍然相似;已记录变量平衡,也排除不了未记录因素。若漏掉的因素既影响谁接受处理,又影响没有处理时的结果变化,就会产生遗漏变量偏差(omitted variable bias,OVB)。DiD估计的处理效果会吸收其中一部分影响。

论文关注的是 ATT,即“对实际接受处理者的平均处理效应”。它没有宣称所有 DiD 都会失灵,而是研究:当未观测混杂破坏平行趋势时,ATT会怎样偏离真实值。

偏差不是一团黑箱

论文的关键工作,是给 ATT 的遗漏变量偏差提出一种新刻画。作者证明,偏差可以分解为一个能从数据中估计的尺度因子,以及三个无法直接观察、但可以解释和约束的偏差因子:选择、趋势和对齐。

“选择”指未观测因素在多大程度上影响处理分配。比如,一个没有进入数据的地方政治因素,是否明显提高某地上调最低工资的可能性。

“趋势”指这个因素在多大程度上解释控制组中未经政策影响的结果变化。还是以上面的例子说,它是否也能解释青少年就业原本会怎样变化。

“对齐”则问两个方向是否碰巧一致:这个因素对政策选择的推动,与它对就业趋势的推动,是否系统性地朝着会制造偏差的方向排列。

三者必须同时起作用。一个因素即使强烈影响政策选择,若与就业趋势无关,也不会通过这条路径制造 ATT 偏差。反过来,它即使能解释就业变化,若不影响哪些地区接受政策,同样不构成这里讨论的混杂。即便两边都影响,方向缺乏稳定对齐,最终偏差也会减弱。

这套分解的实用之处,在于它把“可能有混杂”改写成几个更具体的问题。论文指出,趋势和对齐两个因子的绝对值都有 1 这个自然上界;选择因子却可能任意大。因此,要给偏差设定有效边界,最不能回避的是处理分配中的混杂强度。

“选择很强”可以有三种说法

不同领域习惯用不同尺度谈混杂。论文因此给出多种等价表述,让研究者不必被迫使用一种陌生指标。

第一种看处理 odds 的变化。Odds——可理解为“接受处理的概率”与“不接受处理的概率”之比——衡量某个对象落入处理组的相对可能性。研究者可以问:加入未观测因素后,实际处理者的平均处理 odds 会增加多少?论文举例说,如果该因素至多让平均 odds 翻倍,就能把这种判断转换为对选择强度的限制。

第二种看处理组与控制组之间新增了多少混杂不平衡。这里作者强调,直接关系到 ATT 偏差的不是常见的标准化均值差,而是衡量两组完整分布差异的卡方散度。后者不只比较平均值,也考虑分布层面的分离程度。

第三种看未处理者内部,未观测因素解释了多少处理 odds 的变异。三种表述描述的是同一类选择力量,但为不同研究场景提供了不同入口。

从“结论稳不稳”变成一个可报告的数

在分解偏差之后,论文进一步提出 robustness value 一类敏感性统计量:它描述至少需要多强的未观测混杂,才能推翻某项 DiD 结论。作者主张把它与点估计和标准误一起常规报告。

这种统计量回答的不是“平行趋势已经成立吗”,而是“若它不成立,破坏程度要达到什么水平,结论才会改变”。两者差别很重要。敏感性分析不能替研究者消灭未知因素,却能把争论从笼统怀疑推进到强度判断。

强度边界仍需现实依据。论文提供两种校准办法。一种拿未观测因素与已经观测到的协变量比较:假设未知因素对处理选择或结果趋势的解释力,不超过某个已知变量,再据此约束 ATT 偏差。另一种利用政策实施前的趋势,把处理后的潜在混杂与处理前已经显露的偏差比较。

这些比较只是校准或设界,并不能验证平行趋势。它们的价值在于让假设说得更清楚:研究者必须交代,自己愿意容许一个比已观测地区差异强多少的未知因素。

最低工资案例说明了什么

论文重新分析了最低工资与青少年就业的案例。2001至2007年,联邦最低工资保持在5.15美元,一些州则先后提高了州最低工资。作者聚焦2007年首次提高最低工资的一组州,处理组包括这些州的584个县;控制组是截至2007年底仍未提高州最低工资的州中的1,377个县。

未经协变量调整的 DiD 估计显示,最低工资提高对应青少年就业下降2.77%。但2006年的处理前趋势估计为负3.9%,不仅统计上显著,量级也与政策效果接近。这说明两组在政策发生前已经出现分化。

处理组县与控制组县在多项特征上也不平衡。处理组人口更多、白人占比和教育水平更高、贫困率更低,而且更多集中于中西部和西部。作者用随机森林和去偏机器学习调整这些已观测协变量后,政策效果估计变为负3.66%,方向没有改变;2006年的处理前偏差仍约为负3.8%。

论文的分解解释了为什么“变量很不平衡”,调整后结果却变化不大:不平衡只是选择渠道。已观测变量对控制组就业趋势变异的解释有限,而且选择误差与趋势误差之间的对齐相关仅为0.194,两道力量共同削弱了它们对估计值的影响。

按一种常见的处理前趋势外推办法,如果假定负3.8%的偏差延续到2007年,它已经足以推翻负3.66%的条件 DiD 结论。新框架没有否定这种做法,而是进一步追问:要产生这份偏差,未观测因素必须怎样影响政策选择、就业趋势及两者的对齐?

为什么值得关注

本刊此前介绍过,即使平行趋势看似过关,DiD结果仍可能依赖如何填补反事实。本篇论文把问题再向前推进一步:不只描述反事实可能偏离多少,也尝试解释偏离为何发生。

它尤其适合只有处理前、处理后两个时期的经典 DiD。此时没有更早的 pre-trends——政策实施前的相对走势——可供外推,但研究者仍可围绕处理 odds、组间不平衡和已观测协变量做敏感性判断。作者还给出 ATT 边界的统计推断方法,可结合去偏机器学习(用额外校正降低灵活预测模型带来的估计偏差)进行估计,也可使用标准参数回归。机器学习在这里负责灵活估计,并不能消除未观测混杂。

局限与未知

  • 目前材料来自这一篇论文。作者将其推断方法称为“灵活且高效”,但没有独立证据支持这一评价。
  • 论文中的最低工资示例展示了估计值、处理前偏差和分解思路,但现有材料没有提供足够的模拟对比或完整置信区间,不能据此断言它在数值表现上优于既有方法。
  • 敏感性分析把隐藏假设变得可见,却不会自动证明某个强度上限合理。最终边界仍依赖研究者对具体场景作出并公开说明判断。

供稿材料 SOURCES — 1

← 返回 2026-09-21 · 数据板块