Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.092 — 2026-10-04
PAPER H 9 约 6 分钟

实验永不停:AI时代怎样持续试错

新方案随时上线、旧方案随时下线,统计检验怎样跟上这场永不停机的实验。

你让 AI 一口气生成 100 个广告标题,今天上线十个,明天再加二十个,表现差的随时撤掉。麻烦在于:如果团队不断查看数据,看到一次“有效”就停手,总会有一些方案只是运气好。方案生产得越快,这类误报越容易混进决策。

Ricardo J. Sandoval、David Arbour、Avi Feller 和 Michael I. Jordan 在论文《Always-On Experimentation》中,把这个问题定义为“Always-On”实验:实验持续运行,处理方案可以动态产生、加入和退出;平台则要持续判断每个方案是否有效,同时守住统计上的错误边界。这里的“处理方案”可以是药物、营销活动,也可以是待测试的模型能力。

这不是一套已经得到真实平台验证的工程系统。本文的理论与效果数字均来自这篇论文;实证部分使用半合成数据,没有提供实际部署案例。

A/B 测试为什么不能一直看

普通 A/B 测试把对象随机分到不同方案,再比较结果。随机分配的作用,是尽量把结果差异归因于方案,而不是两组人原本就不同。

传统做法往往先定好方案和样本量,到点再看结果。Always-On 实验却没有清晰的“到点”:方案会陆续进入,研究者也可能每天查看数据。若仍沿用一次性检验,反复查看相当于不停买彩票,偶然撞上“显著结果”的概率会逐渐升高。

论文因此采用序贯检验——数据持续到来时可以反复查看和决策,但检验规则会校正反复查看造成的误报膨胀。作者声称,在任意停止时间下,这套方法都能对每个方案保持时间一致的第一类错误控制。第一类错误,就是把实际无效的方案误判为有效。

不过,“任意停止”不等于可以偷看未来。论文要求处理调度是“可预测的”:是否加入或移除方案,只能依据已经看到的数据,不能依赖未来信息。每个阶段开始时,分配用户到各方案的概率也要固定;下一阶段可以依据此前数据调整。

把证据当成一笔赌本

论文的关键工具叫 testing-by-betting,可以直译为“用下注做检验”。它不是拿实验经费赌博,而是把证据积累写成一个虚拟账户。

如果某个方案没有超过预设效果门槛,账户即使偶尔上涨,也很难持续膨胀;如果方案确实有效,合理下注会让账户更快增长。当账户越过相应界线,研究者便可以拒绝“方案无效”这一原假设。

作者为每个方案构造了 test supermartingale——一种在原假设成立时,未来期望不会无故增长的非负统计过程。它把该方案活跃期间的处理组与对照组数据汇总起来。论文使用经过调整的 Horvitz–Thompson 估计量,也就是按照用户被分到某方案的概率给观测结果加权,从而估计平均处理效应。平均处理效应指同一人接受方案与接受对照时,结果平均会差多少;现实中不能同时观察同一个人的两种结果,所以要借助随机分配来识别。

这套“赌法”还要决定每一步押多少。论文为每个方案分别运行 Universal Portfolio 算法,并在新的子实验开始时重启相应策略。作者证明,在固定处理日程、各子实验样本量都不断增加等条件下,其 test supermartingale 在几乎必然意义上具有对数增长率最优性。说白了,在论文规定的比较范围内,它长期积累有效证据的速度不会落后于其他同类策略,甚至可与知道理想下注方式的“先知”策略比较。这是渐近理论保证,不等于每次实验都会最快得出结论。

方案越多,误报还要再管一层

只控制每个方案的第一类错误仍然不够。假设同时测试大量无效方案,总会有少数因偶然波动胜出。这叫多重检验问题。

论文进一步控制在线假发现率(FDR)——在所有被宣布有效的方案中,错误发现所占比例的长期平均。作者把 asynchronous e-LOND 算法调整到 Always-On 场景,为后来加入的每个方案分配相应的检验门槛,并允许多个方案同时积累证据。

这与前面的时间一致第一类错误控制是两层不同的保证:前者约束单个方案在持续查看时的误报,FDR 则约束一批发现中的错误比例,不能混为一谈。论文证明,在其随机分配、样本和调度假设成立时,两者可以组合使用。

半合成实验给出了什么信号

作者使用 Upworthy Research Archive 构造半合成实验。该档案来自 2013 至 2015 年运行的随机标题实验;方案是展示给用户的标题与图片组合,结果指标是点击率。作者保留至少有 1000 次展示的方案,按原始时间戳模拟方案陆续加入。数据覆盖 18 个月,平均每月有 634 个方案。

论文报告,其方法在不同流量水平下把 FDR 控制在预设水平以下;不做 FDR 校正和直接反复偷看数据的版本,FDR 大约差一个数量级。完整方法每次重复实验发现约 1900 个真实效果,比去掉“发现奖励”项的消融版本多 12%,与知道真实处理效应的 oracle 相差不到 30%。另一种分组序贯基线的 FDR 更低,但发现方案也明显更保守。

这些结果说明,持续实验不一定要在“随时决策”和“统计可信”之间二选一。更重要的变化是,实验不再是一张做完即归档的成绩单,而是一套长期运行的分流、学习与决策基础设施。新方案的生产速度越快,决定哪些证据值得相信,越可能成为真正的瓶颈。

局限与未知

  • 实证来自 Upworthy 数据构造的半合成环境,并非药物研发、科技公司平台或 LLM 能力测试中的真实部署。
  • 理论依赖明确条件,包括样本假设、随机分配、正概率分配,以及只根据过去信息调整方案;现实系统偏离这些条件时,保证是否仍成立,论文材料没有回答。
  • “增长率最优”带有固定处理日程、样本量趋增、限定比较类和几乎必然意义等条件,不能直接理解为有限样本下总能更快或更准。

供稿材料 SOURCES — 1
01
Always-On Experimentation arXiv stat.ME+stat.AP · PAPER
原文 ↗

← 返回 2026-10-04 · 数据板块