Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.087 — 2026-09-29
PAPER 约 4 分钟

夏普率也要扣除“试出来”的运气

高夏普可能只是海量回测里的幸运冠军;DSR给“试出来”的业绩打折。

你同时试了100套交易规则,最后挑出回测最漂亮的一套。它很可能真有本事,也可能只是抽了100次签后留下的幸运赢家。问题在于,我们常把这个赢家当成一开始就选定的策略,用普通标准评价它。Marcos López de Prado与Emilio Porcu的这项研究,试图给这种“搜索红利”扣分:高夏普率不仅要好看,还要经得住整个筛选过程的检验。

夏普比率(Sharpe ratio)是超额平均回报与回报波动之比,表示每承担一单位波动,换来多少额外收益。它常被用来概括策略表现。但当研究者反复比较因子、模型设定、机器学习设计、参数、交易规则或管理人时,即便所有候选都没有真实优势,也可能偶然出现一个高分者。这就是多重检验与选择偏差:只看最后的冠军,会把证据说得太满。

据SSRN页面,这篇60页论文于2026年7月31日上线、8月30日修订;作者研究主页将其列为 Journal of Portfolio Management 即将发表的2026年论文。下文关于方法和结论均来自论文摘要及作者页面,尚无第二个独立信源交叉验证。

不是重算收益,而是抬高及格线

Deflated Sharpe Ratio(DSR,直译为“折减后的夏普率”)换了一个参照物。它不只问“这个夏普率是否高于零”,而是问:在没有真实技巧的情况下,这一整套研究搜索本身,可能制造出多漂亮的冠军?报告业绩只有超过这个更严格的基准,统计证据才更有说服力。

这和比赛选拔很像。一个人只跑一次并拿到好成绩,与100个人各跑一次、再挑最快者,不能使用同一条惊喜标准。DSR要校正的,正是后者天然拥有的选拔优势。它并不能证明策略一定存在真实技能,只是降低把偶然拟合误认成alpha——也就是超出基准的收益能力——的概率。

三把尺子,各有用途

论文统一梳理了三类主要实现。

DSR-L使用简约的“位置基准”。位置可以理解为:没有技巧时,搜索冠军大致会落在哪个成绩水平。它可用于判断经过搜索调整后的显著性,也可分析至少需要多长的业绩记录,证据才可能站得住。

DSR-LS不仅调整冠军通常出现的位置,也纳入冠军成绩的离散程度,即这个最大值可能上下波动多大。这样得到的是“位置加尺度”的形式,既保留较容易处理的结构,也能分析统计功效等运行特征——例如一套检验识别真实优势的能力。

DSR-EO则在能够精确推断尾部时,直接使用完整的搜索结果分布。所谓“尾部”,就是极端高分出现的区域;而研究者最终挑中的赢家,恰恰通常位于这里。

三者并非简单的升级替代关系。DSR-L胜在简约;DSR-LS进一步描述赢家的不确定性;DSR-EO在完整搜索分布可得时使用更多信息。论文摘要没有披露三者的具体计算差异,也没有给出实际回测中的改善幅度。

真正难的是尾部

论文进一步把“分布近似错了多少”与误报、p值偏差联系起来。误报是把没有真实优势的策略判成有效;p值则用于衡量观察结果在某个统计假设下有多罕见。作者用Gaussian与Student-t两类基准说明,尾部形状不仅会改变近似误差的大小,还可能改变误差方向。换句话说,错误的分布假设不一定只是让门槛统一偏松,也可能在不同情形下偏松或偏严。

论文还给出一项带前提的渐近结论:当DSR-LS采用的参考形状与极值极限相匹配时,样本或搜索规模增大后,它具有渐近校准性质;若进一步满足文中所述的“相对尺度一致性”条件,这一结果可扩展到用估计值代入的情形。这里的匹配与一致性条件不能省略,它们决定结论何时成立。

为什么值得关注

这套框架抓住了量化研究里一个很朴素、也很容易被忽略的事实:研究过程本身会生产赢家。策略、因子和参数试得越多,最后最好看的数字越不能按“一次命中”理解。DSR的价值不是替某个策略盖章,而是把提问方式改对:先把搜索可能带来的运气算进去,再讨论剩下的证据有多强。

局限与未知

  • 现有材料只有论文摘要和作者页面,没有实验样本、实际回测结果或误报率改善幅度,无法判断三种实现的现实差距。
  • 校正结果仍依赖候选试验数量、搜索分布和尾部分布等设定;输入或假设不合适,结论也会受影响。
  • DSR-LS的渐近校准带有参考形状匹配及一致性条件,不能泛化成“任何搜索场景都已被准确校正”。

供稿材料 SOURCES — 1

← 返回 2026-09-29 · 量化板块