导语:会调仓,不等于该调仓
想象你开车走一段颠簸路。每次方向盘稍有偏移就立刻修正,看起来很勤奋,却可能让车身更晃,还不断消耗轮胎。期权对冲也有类似问题:如果策略看到一点价格变化就交易,手续费会一点点吃掉收益。
这篇论文追问的正是这件事:当每次调仓都有成本,而且市场会在平静与剧烈波动之间切换时,用神经网络学习交易的“深度对冲”(deep hedging),还能胜过经典方法吗?
作者 Sheryan Kumar 使用 Deribit 的历史 BTC 期权数据,把三种经典策略和三种深度对冲配置放到同一条件下测试。结果很直接:在这组数据、测试窗口和成本假设下,三个神经网络策略没有在任何受测指标上超过经典基准。表现最亮眼的反而是一个核心规则很朴素的老办法:价格变化不够大时,先别交易。
本文数字与结论均来自该论文这一项独立信源,因此更适合视为一次有边界的实证结果,而不是对深度对冲的最终判决。
公平比赛,先把手续费摆上桌
Delta 对冲是期权交易里的基础做法。Delta 近似表示:标的价格小幅变化时,期权价格会跟着变多少。卖出期权的人据此买卖 BTC,抵消价格方向带来的风险。问题在于,经典的 Black-Scholes(BS)delta 对冲通常建立在可以连续、低成本调仓的理想条件上。
深度对冲换了一个思路。它让神经网络直接从市场状态中学习每一步该持有多少 BTC,并用风险目标训练整个策略。论文采用 CVaR——关注最差一小部分结果平均损失的尾部风险指标——作为主要训练目标,也尝试加入换手惩罚,让模型少交易。
但真正公平的对手不能只有未经成本修正的 BS delta。研究还加入两种为交易成本设计的经典方法。Leland 策略通过调整波动率来改变目标 Delta;Whalley-Wilmott(WW)则设置“无交易区间”:仓位只要没有越过边界,就保持不动;越界后也只调回边缘,而不是追到精确目标。
六种策略统一承担 5 个基点的往返交易成本,即 0.05%。这里的“现实摩擦”主要就是这项固定成本。论文没有建立随流动性和市场状态变化的成本模型,也不能据此推断它完整模拟了滑点、盘口深度或市场冲击。
它怎样测试“忍住不动”
原始数据来自 2020—2024 年的 Deribit BTC 期权。由于免费数据只覆盖每月第一天,作者得到的是 61 个彼此分开的 24 小时窗口,而非连续五年的每日记录。每份期权合约在一个采样日内构成一个 episode——可以理解为一次最多包含 24 次小时级决策的小型对冲实验。
清洗前数据有 892,912 行、22,866 个合约;剔除缺少双边报价、过深实值或虚值,以及买卖价差异常大的记录后,留下 490,229 行。训练集截至 2022 年底;2023 年前八个月作为较平静的验证期;2023 年 9 月至 2024 年 12 月作为测试期。
最终测试包含 11,546 个 episode,但它们只来自 16 个采样日。同一天的不同期权共享同一条 BTC 价格路径,并非真正独立。作者因此按“天”整体重采样,进行了 5,000 次区块自助法检验,避免把统计把握夸大。
神经网络一边是能保留序列记忆的 LSTM,另一边是只看最近四步的前馈网络。它们每小时观察价内外程度、剩余期限、隐含波动率、BS delta,以及看涨或看跌标记。三个配置分别改变网络形式和换手惩罚,其中最高惩罚权重横跨二十倍范围。
赢的不是预测,而是少动
测试期内,WW 平均每个 episode 交易 2.47 次;其余策略大约交易 20.4 次。换句话说,WW 的交易频率低约八倍,或少约 88%。相对普通 BS delta,它每个 episode 平均节省 1.79 美元交易成本,95% 置信区间为节省 1.39 至 2.21 美元,。这是论文最扎实的结果。
WW 的平均 P&L 和 95% CVaR 方向上也优于普通 BS delta,但差异没有达到统计显著。不能把它写成已被证实的收益或尾部风险胜利。测试期包含 2024 年 BTC 持续上涨,所有策略又都在对冲空头期权,所以平均 P&L 均为负;这里该比较的是谁亏得更少,而不是谁录得正收益。
更值得注意的是三个深度对冲策略的行为。它们几乎每小时都交易,平均交易次数与连续调仓的 BS delta 在统计上无法区分。加入换手惩罚后,LSTM 的平均换手量从 0.685 降到 0.647,说明单笔调整变小了;但交易次数没有明显减少,P&L 也没有随之改善。把惩罚提高到二十倍、再换成前馈网络,仍未学出类似 WW 的“交易或等待”规则。
说白了,模型知道交易有成本,却没有学会真正停手。WW 的优势不是更复杂地预测下一步,而是把“不交易”直接写进策略结构。
为什么这个负结果值得看
深度对冲的卖点,是能把交易成本、市场状态和风险偏好共同放进学习目标。论文提醒我们:目标函数里写进成本,不代表模型自然会发现最有效的执行规则。连续输出仓位的网络,可能更容易学成一个动作稍缓的 Delta 跟随器,而不是形成明确的无交易区间。
市场状态也改变结论。在较平静的验证期,WW 的 P&L 优势缩小或消失,甚至略处下风;但成本优势仍在。这说明“少交易能省钱”比“少交易能改善最终损益”证据更稳。后者可能依赖测试期的高波动与趋势行情,尚未经过多个独立市场阶段验证。
这项工作因而没有证明深度对冲普遍无效。它证明的是一个更窄、也更实用的判断:在这批 BTC 期权数据、固定 5 个基点成本、有限训练规模和所测试的网络结构下,灵活的模型没有自动胜过一个带明确停止机制的经典规则。
局限与未知
- 数据只覆盖每月一个交易日。测试虽有 11,546 个 episode,真正独立的采样日只有 16 个,限制了 P&L 与尾部风险检验的把握。
- 交易成本被固定为 5 个基点,没有随流动性、期限或波动状态变化;WW 的区间宽度也由作者观察后选定,尚缺正式的参数敏感性分析。
- 作者推测,深度对冲失利可能与训练集只有 8,922 个短 episode,以及网络缺少显式门控或阈值机制有关。这是合理解释,但实验没有确认因果;更大数据或带“交易/等待”开关的架构仍可能得到不同结果。