想判断一种治疗是否有效,却发现用现有数据怎么算都不可靠。常见反应是继续收集年龄、收入等变量,但“多测一些”不等于“测对东西”。这项工作问得更具体:因果识别——仅凭数据和因果假设能否唯一算出效应——卡住后,究竟该调查哪段机制?
作者从因果图入手。因果图用箭头表示假定的因果方向;其中,一条箭头可能压缩了中间过程,双向边则表示未观测的共同原因。方法每次只细化一条边:要么测量因果链上的中介变量,要么找出造成混杂的共同原因,再判断目标效应能否因此被识别。一个关键结论是,若某条双向边截住了处理变量通往其子节点的所有双向路径,把这条边背后的共同原因测出来,就足以实现识别。反过来,若两条互不重叠的路径分别构成障碍,只细化其中一条边仍不够。
价值正在这里:它把漫无目的的“还缺什么数据”,改写成可检查的“哪段机制值得追问”。作者还给出寻找全部候选边的算法,并报告在160个节点的稠密图上,相比逐边尝试快逾千倍;这些效果目前来自论文作者的实验。