你拿几个月的收益记录,让风险系统从几千只股票里找出共同涨跌的方向。直觉上,股票越多,答案应该越可靠。问题是,增加股票并没有增加历史:横截面越来越宽,时间轴仍然很短。此时,样本里的噪声不会自动退场,主成分甚至会稳定地偏离真正的共同风险方向。
9月14日发布的论文《Principal component error in high-dimensional factor models》研究的正是这种“股票多、历史短”的场景。Alex Bernstein、Lisa R. Goldberg 等七位作者把主成分的方向误差拆成两个部分:一部分跑出了真实因子空间,另一部分仍在空间里,却转错了方向。更关键的是,前者能从观测数据估计,后者不能。以下结论均来自这篇论文,尚无独立信源交叉验证。
PCA到底在猜什么?
因子模型用少数共同驱动力解释大量资产为何一起波动,解释不了的部分归为个体噪声。每只股票对共同驱动力的敏感程度叫作因子暴露。所有暴露合在一起,会张成一个“因子子空间”,也就是共同风险可能出现的范围。
主成分分析(PCA)则从样本协方差矩阵——记录各资产如何共同波动的表格——中寻找解释波动最多的正交方向。这些样本主成分常被拿来估计未知的真实主方向,并进一步用于风险预测、收益归因和组合对冲。
方向一旦估错,后续环节会一起偏。风险模型可能低估某种共同波动;组合也可能对冲了样本里看起来重要、现实中却并不对应真实风险的方向。
论文考察的是 HL(high dimension, low sample size)情形:变量数量持续增加,样本量保持有限。金融市场很容易落入这个设定。可交易股票很多,但制度变化或市场换挡后,真正相关的历史往往不长。作者也把基因组学、机器学习和信号处理列为类似场景。
一个偏差,其实是两件事
把真实因子子空间想成一张平面。样本主成分的误差可以先问两个问题。
第一,它有没有偏离这张平面?论文称之为 out-of-subspace error,即子空间外误差。它衡量估计方向到总体因子暴露所张成空间的距离。若这部分很大,PCA找到的方向掺入了较多并非共同因子的成分。
第二,即使估计方向仍落在平面内,它是否对准了正确的轴?这叫 in-subspace error,也可理解为子空间内旋转误差。比如真实空间由三个共同因子张成,PCA可能大致找对了这三维空间,却把第一、第二主方向旋转或混合了。风险覆盖范围看似正确,具体暴露和归因仍会错位。
这种拆分比只报告一个总夹角更有用。子空间外偏差回答“共同风险的范围有没有找对”;内部旋转回答“范围内的具体方向有没有排对”。论文给出一个精确的几何分解:总方向误差由子空间外部分,以及投影回真实子空间后仍然存在的旋转部分组成。
为什么变量越多,误差仍不消失?
作者固定观测期数,让变量数量不断增加。在论文给定的条件下,两类误差都存在 almost sure asymptotic limit——几乎必然的渐近极限。直白地说,随着资产越来越多,误差并不必然趋近于零,反而会沿几乎每条允许的数据路径稳定到某个水平。
这并不等于“数据越多越没用”。这里增加的是资产数量,不是时间样本。大量横截面数据能让独立噪声在某些统计量上趋于规则,却不能补回没有观察到的因子历史。
论文使用 Gram reduction 处理这个问题。样本协方差矩阵会随资产数量扩张,直接分析越来越困难。作者转而研究一个大小由观测期数决定的 dual Gram matrix——它记录各期观测之间的内积,并与原矩阵共享非零特征值。于是,一个不断变大的矩阵问题被压缩成固定尺寸的问题。
这个视角也揭示了两类误差的来源。子空间外误差与特定噪声进入样本方向有关;内部旋转则来自有限历史下,实际出现的因子收益协方差偏离其总体对应物。前者会随横截面扩张呈现可观察的规律,后者保留着有限时间样本带来的偶然性。
能看见的下限,与看不见的余量
论文的 Theorem 2 表明,子空间外误差可以用样本协方差矩阵的特征值估计。做法的核心是比较尾部特征值的平均值与相应的领先特征值。尾部代表没有被主要因子解释的“bulk”,即谱中的主体噪声部分。由此得到的估计量与子空间外误差具有相同的渐近极限。
因此,研究者至少可以从数据中算出总主成分误差的一个下限。若这个下限已经超过风险系统能够容忍的程度,就无需假装主成分方向足够准确。
但这个下限不是总误差。Theorem 3 给出更冷静的结论:当模型有多个因子时,子空间内旋转不能只靠观测数据一致估计。原因是,研究者只看得到资产收益,看不到潜在因子本身;有限样本里究竟发生了怎样的因子路径,无法由资产数据单独还原。
若额外知道因子数量以及因子收益路径的分布,论文称可以估计内部旋转的分布。若进一步知道实际因子路径和因子协方差,才可利用分解估计完整误差。换句话说,数据本身能告诉你“至少错了多少”,却未必能告诉你“总共错了多少”。
为什么值得量化团队留意?
这项工作的价值不在于再说一遍“高维 PCA 有误差”,而在于把误差按可估计性切开。对风险建模者而言,这改变了诊断问题的顺序:先检查可观测的子空间外误差下限,再判断业务是否拥有识别内部旋转所需的额外假设或信息。
论文还用美国公开股票市场的 three-factor simulation(三因子模拟)展示误差及其两部分如何随维度和样本量变化。在这项特定模拟中,子空间外误差占主导。这意味着可观测的下限在那里覆盖了主要偏差,但作者没有把它宣称为一般规律。
这个区分也提醒对冲设计者:找对因子空间与找对每根因子轴,不是同一件事。前者关系到共同风险有没有漏到空间外;后者关系到具体暴露、归因和对冲对象是否对齐。只检查其中一项,可能给出过度乐观的稳定感。
局限与未知
- 渐近结论依赖论文列出的条件,包括固定因子数、因子普遍存在、总体与样本谱的分离,以及对特定收益的独立性和矩条件;不能外推到任意增长速度、噪声结构或因子强度。
- “子空间外误差占主导”只出现在作者的三因子模拟中。材料未给出占比、显著性及完整模拟参数,不能视为市场中的普遍结论。
- 可由数据估计的是子空间外误差以及总误差的下限。内部旋转无法仅凭观测数据识别,因此这套方法并未给出一个无条件可计算的完整误差答案。