Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.067 — 2026-09-09
NEWS 约 1 分钟

用边际表反推更细的人口数据

一个 R 包用普查边际合计,把大区域样本下推到街区尺度,但结果仍是合成人口。

公开人口样本往往只标到较大的 PUMA 区域,但交通、住房等分析更想知道 tract 甚至 block 里住着怎样的人。David Dorer 的 R 包试图补上这层细节:它把 PUMA 的个人记录重新分配到更小区域,并让结果符合当地已经公布的普查汇总数。

核心方法是迭代比例拟合(IPF)——从一张初始交叉表出发,轮流调整行列,直到年龄、收入等边际合计都尽量对上。边际表只给出各类人数,未提供“年龄×收入”的完整组合;IPF借这些局部合计估算联合分布。Andrew Gelman 表示,这是他目前通常会推荐的基础方法,代码若已接好真实普查数据,会很实用。

不过,这不是在恢复真实住户。Ben Goodrich 提醒,PUMS 的个人权重通常只依赖种族、性别和年龄,因此对其他变量能还原多好并不确定。换句话说,合成数据可以对齐已知总数,却不保证变量之间的关系也正确。


供稿材料 SOURCES — 1

← 返回 2026-09-09 · 数据板块