你收到一张礼品卡,拿它订了一间房。平台看到的是一笔订单,却不知道:没有这张卡,你是否照样会订。礼品卡支付的金额不等于它创造的收入,真正该算的是两种世界之间的差额——现实中的收入,减去“从未收到礼品卡”时本会产生的收入。后一种情况无法同时观察,这就是反事实。
这篇论文研究的正是这道题。作者把 Airbnb 的大规模历史交易与一项较小的随机实验拼在一起,试图估计礼品卡的增量收入,并比较第一方、零售线上、零售门店和企业客户(B2B)渠道。结果没有给出一个适用于整个项目的总金额,但显示渠道差异很大:Retail Online 与 B2B 的增量指标点估计约为 0.20—0.22;疑似自己买卡自己用的“self-gifters”,增量收入占比估计达到 0.35—0.50。
本文的数字与结论均来自这篇论文,尚无第二个独立信源交叉验证。
最大的麻烦,是没消费的人
增量收入不是礼品卡订单的流水。它可能来自两处:有人因为收到卡才下单,这是“广延边际”;有人本来就会下单,但收到卡后花得更多,这是“集约边际”。反过来,如果顾客只是用礼品卡支付一笔原本就会发生的消费,那就是蚕食,而非新增收入。
直接看历史数据会碰到一个少见但棘手的缺口。Airbnb 通常只有在顾客预订并使用礼品卡时,才知道对方持有卡。没有预订的人可能没卡,也可能有卡但没用。换句话说,是否持卡这个“处理状态”被系统性删失了,而且缺失恰好与结果——是否预订——绑在一起。
因此,比较持卡者和其他顾客并不可靠。已知的持卡者天然都是已经发生预订的人,很容易把他们原有的消费倾向误算成礼品卡效果。常见的倾向得分方法也难以直接使用,因为研究者连各类顾客中究竟有多少持卡者都不知道。
大规模随机对照试验(RCT——随机决定谁收卡、谁不收卡,再比较两组结果)原则上能回答问题。但给大量顾客免费发卡成本很高,而且实验人群未必代表第三方渠道的真实持卡人。
两块不完整的数据,怎样拼成答案
论文采用“因果数据融合”:让不同数据源各自回答它擅长的问题,再把答案组合起来。
第一块是 2024 年的观察数据。每个月约包含 3 万名用礼品卡预订的顾客、350 万名不用礼品卡预订的顾客,以及约 300 万名没有预订的顾客。它能细致描述目标人群的消费行为,但无法完整识别谁持有礼品卡。
第二块是 Airbnb 在 2022 年开展的小型实验,共有 26,980 名现有顾客。研究随机给其中一半发卡:一部分收到 100 美元数字礼品卡,另一部分收到 200 美元礼品卡;对照组不收卡。随后一年按月观察其预订和消费。实验中的持卡状态完整可见,但样本小,而且参与者经过筛选,更像可能兑换礼品卡的人,并不天然代表 2024 年各渠道的顾客。
关键拼接点是“可迁移性假设”。论文假定:在顾客特征相同的条件下,收到礼品卡让预订概率发生的相对变化,在实验人群与观察人群之间保持不变。两边的顾客构成、发卡方式和实际消费金额可以不同,但这个相对效果必须能够搬过去。
直观地说,小实验提供“礼品卡会怎样改变预订决定”,海量交易提供“目标人群一旦预订,通常花多少钱”。论文再控制超过 150 项顾客特征,包括历史消费、过去与礼品卡的互动、价格敏感度和站内搜索行为,把两部分合成增量估计。
作者主要报告两个无量纲指标。增量系数 IC 表示每兑换 1 美元礼品卡价值,对应多少新增收入;增量比率 IR 表示礼品卡使用者的收入中,有多大比例可归因于礼品卡项目。论文还用 cross-fitting(把样本分组,轮流在一组训练、另一组估计)和 Neyman orthogonal 构造,降低机器学习模型估计中间变量时的误差对最终答案的一阶影响。作者证明该估计量具有渐近正态性,也就是样本足够大时,其误差分布趋近正态,从而可以构造置信区间。
“多少增量”,答案取决于渠道
在 Airbnb 的四个北美渠道中,Retail Online 与 B2B 的 IC 和 IR 点估计为正,约在 0.20—0.22;但只有 B2B 的正值达到统计显著,也就是其置信区间排除了零。Retail In-Store 整体接近中性,First-Party 的点估计则略为负值。论文没有在所给文本中披露这个负值的具体数字。
除 First-Party 外,各渠道的集约边际都略为正,约为 0.06—0.09。这表示在已经预订的条件下,持卡顾客比不持卡顾客稍微多花一些。渠道间更大的差别来自广延边际,也就是礼品卡是否促成了原本不会发生的预订。不过,各渠道广延边际的置信区间都包含零,证据并不确定。
一个反直觉结果来自 self-gifters——疑似自行购买礼品卡的顾客。论文用买卡与兑卡之间的天数作为代理指标识别这群人。他们的 IR 估计因渠道而异,落在 0.35—0.50,95% 置信区间均排除零;增量主要来自预订概率提高。即使在整体表现较弱的 First-Party 渠道,疑似 self-gifters 的 IR 也达到 0.37,但他们只占该渠道礼品卡使用者约 11.6%。
作者认为,B2B 和 Retail Online 恰好也提供了更强的“有效折扣”,例如用积分兑换礼品卡、完成大额购买后获赠卡,或其他价值转移。不过,这是对结果的机制解释,不能仅凭现有估计认定折扣就是增量更高的原因。
真正值得借鉴的是测量范式
这项工作的价值不只在礼品卡。很多商业项目都有类似盲区:企业只有在优惠券被兑换、合作方积分被使用或推荐奖励被触发时,才知道顾客接受过某种激励。单看交易会产生选择偏差,全面随机化又可能太贵。
这篇论文给出的路径是:保留一个规模可控、处理状态完整的小实验,用它确定关键的因果变化;再借助大规模历史数据,恢复目标人群的真实消费结构。它允许实验样本的增长速度慢于观察样本,贴近“几百万条交易配几千名实验顾客”的现实条件。论文还报告,若不校正顾客特征,或忽略买卡到兑卡的时间,朴素算法会大幅高估增量性。
这也提醒企业,渠道归因不能按兑换额排座次。一个渠道承接的礼品卡流水很大,可能只是替换了顾客原本会使用的现金;另一个渠道流水较小,却可能真正促成新订单。先估计反事实,再结合渠道费用,才可能讨论商业效率。
局限与未知
- 整个识别依赖跨人群的可迁移性假设。2022 年实验参与者经过预筛选,还混合了北美与 EMEA 顾客;2024 年观察数据则面向北美渠道。论文提供敏感性分析框架,但现有材料不足以判断假设偏离到何种程度会推翻各项结论。
- 这些数字衡量收入增量,不等于利润增量。论文列举了制作、支付处理、折扣和第三方渠道费用等成本,但未给出各渠道成本,因而不能判断第三方渠道扣除费用后是否更划算。
- self-gifters 是依据买卡与兑卡间隔推测的群体,不是直接确认的身份。0.35—0.50 是特定样本和定义下的相对收入占比估计,不能理解为所有自购礼品卡的顾客都会创造正增量。