Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
PAPER H 41 约 8 分钟

AlphaPADI:因子挖掘开始顾全组合

AlphaPADI不再逐个淘金,而是在整个因子池里寻找真正互补的新信号。

你在组一支球队时,不会只挑“单打得分最高”的人。五名球员都擅长同一件事,未必比能力互补的阵容更强。量化投资里的因子挖掘也有类似问题:系统可能不断找到单独看起来有效、实际却高度相似的公式。

AlphaPADI要解决的正是这个错位。它不再把单个公式当作唯一生成对象,而是从发现阶段就观察整个因子池:新公式能否补上现有成员缺少的信息?论文由Yanzheng Jin、Pengyang Shao等人完成。下文的结果均来自作者论文,目前没有第二个独立信源交叉验证。

不只问“准不准”

因子(factor)是用可计算特征给股票排序或预测收益的规则,比如估值、趋势或质量。Alpha通常指无法由常见市场风险解释的超额收益或预测能力;这里更具体,是因子公式希望捕捉的选股信号。

过去的自动挖掘方法,包括遗传编程、强化学习和生成模型,通常一次生成一个公式。因子池有时会参与最终评分,但没有真正进入生成过程。于是,模型知道某个公式得分不错,却不一定知道池中已经有几个相近信号。

AlphaPADI把问题改写成“联合搜索一个公式池”。池不只是考官,也进入生成状态,直接影响哪些公式结构应该保留、替换或重写。说白了,它寻找的不是又一个好公式,而是一个放进现有阵容后仍有新增价值的公式。

像修改整套方案,而不是逐句重写

AlphaPADI全称是Formulaic Alpha Discovery via Pool-Aware Hierarchical Discrete Diffusion。它由三个环节组成。

第一步是grammar-constrained buffer initialization,即受语法约束的候选池初始化。系统从61种特征、运算符、时间窗口和常数标记中组合公式,并用语法规则限制生成过程。这样可以避免大量结构上就无法执行的表达式。候选池会进入一个“精英缓冲区”,保存已经评分、较有希望的组合。

第二步是pool-aware hierarchical diffusion,即感知因子池的层次化离散扩散。扩散模型可以理解为先遮住对象的一部分,再学习如何恢复;“离散”表示它处理的是公式符号等有限选项。AlphaPADI操作的还是抽象语法树——一种把公式拆成树状结构的表示。

它会在三个尺度上修改公式:叶子节点、子树和完整公式。叶子可能只是一个输入变量;子树对应一段完整运算;最高层则是整个Alpha。每次恢复被遮住的部分时,模型都会参考池中其他公式,也会参考本轮较早完成的修改。好处是它既能做局部微调,也能进行整段替换,不必每次都从头生成。

第三步是reward-guided pool refinement,即奖励引导的因子池改进。系统给整个池评分,同时考虑联合预测表现和内部多样性。论文用岭回归——一种会限制组合权重、防止权重过度膨胀的线性方法——把池内信号合并起来,并在训练期拟合一次,之后在验证期和测试期固定。

多样性奖励则惩罚过于相似的成员。因为两个公式即使写法不同,也可能给出几乎相同的排序;它们同时占据池中位置,并没有增加多少信息。

难点是:评分不能直接教会生成器

池级评分来自执行公式、联合拟合和回测。这类过程不能像普通神经网络那样直接把梯度传回生成器。AlphaPADI因此用了两条训练信号。

一条是重构学习:让模型继续学会恢复精英池中被遮住的公式结构。另一条是偏好学习:从缓冲区取出两个池,告诉模型哪一个整体奖励更高,并推动它更偏向高奖励池。这样,难以直接求导的金融评分被转换成“两个方案更喜欢哪一个”的学习任务。

这形成一个闭环:生成完整候选池,按预测力和多样性评分,更新精英缓冲区,再用其中的优劣关系训练下一轮生成器。

三个市场上的结果怎么样?

论文使用Qlib日频数据,覆盖CSI300、CSI500和S&P500,预测未来20个交易日收益。三个股票池使用相同的时间切分:2016年至2020年训练,2021年至2022年验证,2023年至2025年测试。作者报告五次运行的平均结果,并与九个基线比较,包括Alpha158、XGBoost、AlphaGen、AlphaForge、AlphaAgent和AlphaSAGE等。

预测指标中,IC和RIC衡量信号与后续收益之间的相关程度;RIC使用排序后的相关性。ICIR和RICIR进一步观察这种相关表现是否稳定。组合指标包括年化收益AR、夏普比率SR和最大回撤MDD。夏普比率用于衡量承担波动后获得的回报,最大回撤则看测试期间从高点到低点最深跌了多少。

按作者结果,AlphaPADI在三个股票池的全部七项指标上都排第一。它在CSI300、CSI500和S&P500上的RIC分别为0.0659、0.0763和0.0452;各市场最强基线分别为0.0544、0.0601和0.0220。其年化收益分别为10.58%、14.35%和20.61%,夏普比率分别为2.8619、3.5124和5.8423。

风险指标也朝同一方向变化。作者报告,AlphaPADI相对各市场最强基线,将最大回撤分别降低22.8%、20.0%和9.7%。在CSI300上,它的最大回撤为14.12%,而表中最好的基线为18.29%。论文还称,在2024年下跌及其后的修复阶段,AlphaPADI经历了较浅的低谷,并在恢复后领先其他基线。

这些数字说明的不是“某个公式特别神奇”,而是联合搜索出来的阵容在论文设定中更有效。

真正关键的是哪一块?

CSI300上的逐步消融实验提供了更直接的线索。基础模型不看池上下文,只恢复被遮住的子树,其IC为0.0215,RIC为0.0334。加入池上下文后,两项指标升至0.0276和0.0386。继续加入池级预测奖励、多样性奖励和偏好学习,最终达到0.0439和0.0659。

其中,偏好学习带来了最大的单步RIC提升:从0.0531升至0.0659,RICIR从0.3130升至0.4147。这意味着,仅用奖励筛选候选池还不够;让生成器直接学习“哪个完整池更好”,提供了额外信号。

多样性奖励的作用主要体现在风险上。加入它之后,最大回撤从23.33%降至19.15%,夏普比率从2.3414升至2.6810;与此同时,ICIR从0.2684小幅降至0.2510。也就是说,减少重复信息未必让每一种预测统计量都同步改善,但可能换来更稳的组合表现。

为什么值得关注

AlphaPADI最有意思的地方,不是把扩散模型搬进量化,而是改变了优化对象。实盘最终使用的是多个信号的组合,那么发现阶段也应围绕组合来工作。一个单独很强、却和现有成员高度重复的公式,可能不如一个预测力稍弱但能补足盲区的公式。

这也解释了论文关于池大小的观察:更大的池并不稳定地带来更好结果。一些方法增加成员后,IC和RIC上升,年化收益和夏普比率反而下降;AlphaPADI自身也出现部分指标改善、部分指标回落。池容量不是越大越好,关键仍是组合后的信息质量。

局限与未知

  • 所有效果均来自同一篇论文。尽管作者报告五次运行均值,并称对最强基线进行了显著性检验,现有材料没有给出逐项显著性结果,尚不能独立复核。
  • 回测基于历史数据和固定协议。论文明确指出,结果依赖所研究的市场、时期与回测假设;实验不包含真实交易,也不应视为投资建议或未来收益保证。
  • 论文给出了公式评估预算、数据切分和组合方式,但真实部署仍需进一步评估执行成本与金融风险。随机初始化、扩散采样和训练也可能让重复运行选出不同的因子池。

供稿材料 SOURCES — 1

← 返回 2026-10-09 · 量化板块