Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.096 — 2026-10-08
PAPER 约 7 分钟

小模型抢跑订单簿:延迟比参数更值钱

两款不到1.5万参数的小模型,用逐笔订单历史换来预测质量与亚毫秒推理。

小模型抢跑订单簿:延迟比参数更值钱

你在超市排队时,想判断哪一列走得更快。只看每列现在有多少人,是一张静态照片;如果还能看到谁刚加入、谁临时离开、哪位顾客已经结账,你会更容易判断队伍接下来怎么动。订单簿预测也有类似区别:与其一味把模型做大,不如把订单变化的过程看得更细。

论文《Event History Over Scale》研究的正是这笔账。作者提出两款小型模型,让它们读取逐笔订单事件,并同时衡量预测质量、单样本延迟和模型文件大小。结果显示,在论文测试的三个市场和四个预测时域中,它们在12组设置里有11组取得最高的平均 macro-F1;在 Apple M2 CPU 单线程上,中位推理延迟都低于1毫秒。不过,这些结果均来自论文作者的实验,尚无独立复现,也不等于已经证明实盘盈利。

与其看照片,不如看过程

限价订单簿(limit order book)按价格排列尚未成交的买卖委托,告诉市场参与者:什么价格上,有多少买卖意愿。短线模型会观察它的变化,预测中间价接下来上涨、持平还是下跌。

常见的 Level 2 数据把同一价格档的订单数量汇总起来,像每隔一段时间拍一张队伍照片。Level 3 数据则保留每笔订单的提交、撤销和成交轨迹。它能还原 Level 2,但反过来不行:几张汇总快照无法恢复两次拍照之间究竟发生了什么、事件以什么顺序出现。

作者的核心判断是,模型大小未必是主要瓶颈。更细的输入可能让小模型少做猜测。为此,MBOFormer读取最近128个 Level 3 事件。每个事件由七类信息表示,包括事件类型、买卖方向、相对最优报价的价格深度、订单量、距前一事件的时间、即时中间价变化,以及是否位于最优报价。

MBOFormer是一款只有7,203个参数的因果 Transformer。Transformer是一类擅长从序列中寻找前后关系的神经网络;“因果”表示模型在处理某个事件时只能看它及此前的事件,不能偷看未来。模型用两个 Transformer 模块整理事件历史,再结合最新事件和全部有效事件的平均表示,输出上涨、持平或下跌三类预测。

MBOFusion在此基础上增加一条“慢速”分支。它汇总近期的价格漂移、波动、平均价差、挂单深度、事件与成交速率,以及提交和撤销的相对比例等背景,再与逐笔事件合并判断。它有14,371个参数。这个设计像是同时观察收银台眼前发生的动作,以及过去一段时间整家店的拥挤程度。

小,不等于单纯追求最快

实验覆盖三个连续交易市场:NASDAQ 的 AAPL、NYSE 的 BAC,以及欧洲 EPEX 日内电力市场。股票与电力市场的更新速度差异很大。按论文的采样方式,预测跨度平均约为AAPL的半秒、BAC的5秒和EPEX的2分钟。作者按时间先后划分训练、验证和测试日,让测试数据全部晚于训练数据。

评价指标使用 macro-F1——分别计算上涨、持平和下跌三类预测的F1,再给予三类相同权重。这样,模型不能仅靠反复猜占比最高的“持平”获得好成绩。每组模型、市场和预测时域组合训练三个随机初始化版本,论文报告其测试结果。

在12个“市场×预测时域”设置中,MBOFormer或MBOFusion有11个取得最高平均 macro-F1。容量相近的比较也支持同一方向:7,203参数的MBOFormer在11组设置中超过约7,206参数的TLOB。后者读取的是较短的 Level 2 快照序列,并带有触发事件和人工整理的订单流特征。

短预测时域下,MBOFormer在EPEX、AAPL和BAC上的macro-F1分别为0.651、0.665和0.735;拥有120万参数的TLOB分别为0.617、0.653和0.731,约314万参数的MLPLOB则为0.612、0.657和0.732。扩大TLOB也没有带来稳定提升。至少在这些实验里,保留逐笔事件比单纯增加参数更有效。

慢速分支并非总有帮助。MBOFusion改善了AAPL的四个预测时域、EPEX的较短时域和BAC的较长时域;其余设置中,MBOFormer更好。这说明主要收益来自 Level 3 事件历史,额外背景只在部分市场和时域提供补充。

真正的取舍在预测之后

短线模型即使更准,如果预测出来时市场已经变化,也很难发挥作用。单样本延迟就是模型收到一次最新输入后,产出一次预测所需的时间。作者因此用batch size为1,在Apple M2的单个CPU线程上测试模型前向计算。

MBOFormer的中位延迟为0.479毫秒,p99延迟为0.791毫秒;MBOFusion分别为0.531和0.862毫秒。两者序列化参数文件分别为39 kB和69 kB。相比之下,120万参数TLOB的中位延迟为2.459毫秒,约314万参数MLPLOB为3.903毫秒。MBOFormer分别快5.1倍和8.1倍,计算量少113倍和260倍,同时保持相当或更好的论文内预测表现。

但它们不是绝对最快。约7,200参数的TLOB中位延迟为0.301毫秒,BiNCTABL为0.187毫秒,只是预测质量通常较低。因此,更准确的说法不是“参数越少越好”,也不是“延迟一定比参数更重要”,而是:输入表示、预测质量和实际运行速度必须放在一起比较。MBOFormer提供的是较好的综合取舍。

这也解释了论文为何值得关注。近年来,订单事件模型可以做到很大;这项工作却反过来问:如果把有限容量用在更完整的事件历史上,能否省下模型规模?至少在两个股票标的和一个电力市场中,答案偏向肯定。提升在EPEX最明显:短时域下,最佳Level 3模型比最佳Level 2基线高0.038 macro-F1;AAPL高0.009,BAC仅高0.002。作者没有据此断言原因,因为三个数据集还同时存在品种、交易场所、价差、活跃度和实际时间跨度等差异。

局限与未知

  • 延迟测试只包含预先算好输入后的模型前向计算,不含数据预处理、传输、订单簿重建和下单执行;Apple M2单线程也不能代表交易所共址系统的端到端延迟。
  • 实验只有三个市场、三个随机种子,未证明跨测试时期的统计显著性。标签阈值还使用了完整测试序列的价格变化分布;作者明确指出,线上系统必须改用历史数据固定阈值,因此绝对分数不能直接视为可在线取得。
  • macro-F1衡量分类预测,不衡量交易收益。论文没有计入交易成本,也没有证明模型能抢先成交或提高实盘利润;低于70 kB的参数文件同样不代表完整部署包、运行内存或基础设施成本只有这么大。

供稿材料 SOURCES — 1

← 返回 2026-10-08 · 量化板块