你和伴侣商量着一起退休。几年后,两人的抑郁症状都发生变化。此时很难回答:变化来自自己退休,来自伴侣退休,还是来自两人同时退休?更麻烦的是,共同的健康、收入和照护压力,既会影响退休决定,也会影响之后的情绪。
这正是双人纵向研究的难题。Subir Hait 的这篇论文没有把回归中的“自己效应”和“伴侣效应”直接当成因果,而是先设计一场理想试验:如果能分别安排两个人是否退休,我们究竟要比较哪两种安排?再讨论观察数据能不能模拟这场试验,以及哪里容易出错。以下结果均来自这一篇论文,尚无独立信源交叉验证。
先别急着把系数叫作效应
研究伴侣、亲子或治疗师—患者时,常用 Actor–Partner Interdependence Model,简称 APIM。它把两类关系分开:一个人的特征与本人结局之间的关系,叫 actor path;与对方结局之间的关系,叫 partner path。
APIM 很适合描述两个人如何共同变化。但普通 APIM 首先给出的是关联。它能告诉我们“伴侣退休与我的抑郁症状有关”,却不能自动回答“如果只改变伴侣的退休状态,我会怎样”。后一个问题才是因果意义上的溢出效应——一个人的处理改变另一个人的结局。
论文把伴侣双方是否接受处理写成四种联合状态:都没有接受处理 、只有成员 1 接受 、只有成员 2 接受 ,以及两人都接受 。以成员 1 为例:
- 自身效应比较 与 ;
- 溢出效应比较 与 ;
- 联合效应比较 与 ;
- 交互效应考察两人同时接受处理时,结果是否超出两个单独作用的简单相加。
这样一来,“伴侣效应”不再只是回归表里的一列数字,而是两种明确干预状态之间的比较。
先设计试验,再分析数据
论文引入了目标试验(target trial)框架。它要求研究者先写清一场理想随机试验:招募谁、何时分配处理、比较哪些策略、跟踪多久、测量什么结局。然后才讨论如何用观察数据模拟它。
对伴侣数据,这一步尤其重要。处理不是两个互不相干的开关,而是一个四状态的联合安排。双方还要处在同一个时间起点和风险集合中。如果一个人的资格依据来自另一人接受处理之后,所谓“基线”就已经错位。
论文指出,APIM 的 actor、partner、interaction 和 joint 系数并非永远不能作因果解释,但条件很严格。需要联合可交换性——控制已知差异后,四种处理组合近似随机;需要正值性——各类伴侣都有实际进入相关组合的可能;还需要处理相关的条件均值部分形式正确,而且效应不随协变量变化。只要效应因年龄、健康或既往结局而异,一个固定回归系数通常就不再等于总体平均因果效应,此时要先预测各联合状态下的结局,再对目标人群做标准化平均。
两个正确概率,相乘也可能错
实际分析中,一个常见捷径是分别估计两个人接受处理的概率,再把它们相乘,作为联合概率。问题在于,这等于假设:给定已测量信息后,两人的处理决定彼此独立。
伴侣可能共同规划退休,也可能同时遭遇家庭或健康冲击。即使两个人各自的边际概率都估计得完全正确,它们的乘积仍可能不是四种联合状态的真实概率。
论文把这个误差压缩为一个量:
其中 是两人的既往信息。对二元处理,四个联合单元的概率误差依次为
总变差距离为 。直观地说,只要两人的处理在控制历史后仍有剩余联动,乘法就会系统性地高估两类联合状态、低估另外两类。论文还给出了这种误差如何进入逆概率加权(IPW)估计偏差的闭式表达。
增强逆概率加权(AIPW)同时使用处理概率模型和结局模型,通常被称为“双重稳健”:其中一个模型正确,仍可能得到一致估计。但它也不是万能修补工具。论文的推导显示,联合概率误差会与结局模型误差相乘。结局模型正确时,概率分解错误本身不会使 AIPW 偏离目标;两边同时有误,保护就会失效。
模拟揭示了什么
论文用 36 个情景检验处理依赖、模型非线性和支持不足等问题。在存在剩余处理依赖时,分别估计再相乘的方法出现较大偏差,主要来源是联合概率被错误分解,而不只是边际模型没有拟合好。
在最强依赖的特定模拟条件下,即便直接使用真实边际概率再相乘,溢出效应的估计方向仍被反转,交互效应被放大到真实值的近 5 倍。这不是普遍规律,而是一个压力测试:它说明“两个个体模型都很准”不能保证双人因果比较可靠。
灵活的 AIPW 能减轻非线性模型设错带来的偏差,却消除不了弱支持。所谓弱支持,就是某种联合状态在特定人群中极少出现。此时概率接近零,少量样本会获得很大的权重,估计随之不稳定。机器学习可以改善预测,却不能凭空制造缺失的处理组合。
退休案例把问题落到了现实里
论文把框架用于 Health and Retirement Study 中的 2,400 对伴侣。两人基线时均为 50—69 岁,并在全职或兼职工作;研究把下一次双年调查时是否完全退休作为处理,把再下一次调查的 CES-D 抑郁症状作为结局。
分析比较了联合多项式 IPW、参数化 AIPW、五折交叉拟合的随机森林 AIPW,以及分别估计倾向概率和 APIM 式结局回归等方法。这里的交叉拟合,是把部分伴侣留作预测对象,只用其余样本训练模型,以减少灵活模型对原数据的过度贴合。
困难很快显现:只有 40 对伴侣同时退休。论文报告,两人的退休决定在控制已测变量后仍有明显依赖;估计也对联合支持和 propensity flooring 敏感。后者是给极小概率设一个数值下限,避免权重爆炸,但不同下限会改变结果。这说明真正的瓶颈不只是选哪种估计器,而是数据中有没有足够多可比较的伴侣。
为什么值得关注
这项工作的价值不在于发明一套全新的干扰理论或 AIPW 方法,作者也明确限制了这一点。它做的是翻译和诊断:把研究者熟悉的 actor、partner 语言,转换为可审计的联合干预、因果对比和数据支持问题。
这套思路提醒我们,处理伴侣数据至少要同时问三件事:想比较的究竟是哪两种联合状态;两人的处理概率能否真的拆开计算;数据是否覆盖了这些状态。只处理成对观测的相关性,并不能回答其中任何一个问题。
局限与未知
- 全部效果论断来自同一篇论文;36 情景模拟中的方向反转和“近 5 倍”只适用于特定设定,不能外推为一般规律。
- HRS 分析是观察性目标试验模拟。退休发生在两次调查之间,期间的健康或就业冲击仍可能同时影响退休与之后的抑郁症状;死亡和失访也没有通过权重处理。
- “完全退休”包含不同原因和路径,而同时退休样本仅 40 对。联合效应和交互效应因此尤其依赖建模与稳定化选择。