公开人口样本往往只标到较大的 PUMA 区域,但交通、住房等分析更想知道 tract 甚至 block 里住着怎样的人。David Dorer 的 R 包试图补上这层细节:它把 PUMA 的个人记录重新分配到更小区域,并让结果符合当地已经公布的普查汇总数。
核心方法是迭代比例拟合(IPF)——从一张初始交叉表出发,轮流调整行列,直到年龄、收入等边际合计都尽量对上。边际表只给出各类人数,未提供“年龄×收入”的完整组合;IPF借这些局部合计估算联合分布。Andrew Gelman 表示,这是他目前通常会推荐的基础方法,代码若已接好真实普查数据,会很实用。
不过,这不是在恢复真实住户。Ben Goodrich 提醒,PUMS 的个人权重通常只依赖种族、性别和年龄,因此对其他变量能还原多好并不确定。换句话说,合成数据可以对齐已知总数,却不保证变量之间的关系也正确。