- Published on
TimeSeriesBenchmarkMeasures
- Authors

- Name
- CoresightQuant
NOTE
本文为公开交易策略的技战术复盘,聚焦方法逻辑、交易场景与风险边界。
策略解读
在量化交易与统计建模领域,我们经常需要对一个预测模型或交易策略的表现进行客观评判。传统的做法往往只盯住“收益率”或“胜率”,然而这些单一维度并不能全面反映策略在不同市场环境下的真实水平。公开交易社区中,作者 RicardoSantos 发布了一个名为“TimeSeriesBenchmarkMeasures”的工具集,其目标正是为了补足这一短板。
该工具集并非一个可直接产生买卖信号的交易系统,而是一个“度量工具箱”。它把时间序列分析中常用的误差评估、自相关检验和风险度量整合在一起,让使用者能够像做体检一样,从多个维度审视自己的模型或策略。如果把交易策略比作一辆汽车,那么收益指标只是速度表,而该工具集则提供了引擎温度、轮胎磨损、油耗曲线等一整套诊断仪表。
在具体构成上,它大致分为三类:
第一类是“精度指标”,包括平均绝对误差(MAE)、均方误差(MSE)、均方根误差(RMSE)、归一化均方根误差(NRMSE)、平均绝对百分比误差(MAPE)和对称平均绝对百分比误差(SMAPE)。这些指标用于衡量预测值与真实值之间的偏差大小,是评估时间序列预测模型最基础的工具。
第二类是“自相关分析”,包括自相关函数(ACF)和增广迪基-富勒检验(ADF)。它们用来分析时间序列数据内部的相关性结构以及平稳性,对于识别趋势、周期性和随机游走特征至关重要。
第三类是“风险度量”,包括泰尔不等式系数(Theil's Inequality)、锐度(Sharpness)、分辨率(Resolution)和覆盖率(Coverage)等。这些指标更多地从概率预测或区间预测的角度出发,考察预测结果的不确定性是否被合理刻画。
简单来说,这个工具集给量化研究者提供了一套“标准答案模板”。无论你构建的是均线回归模型、机器学习预测器,还是网格交易策略,都可以借助这些指标来回答三个核心问题:准不准?稳不稳?险不险?
名词解释
-
MAE(平均绝对误差)
平均绝对误差是预测误差绝对值之和的平均数。它把所有偏差都视为同等的“代价”,不受正负方向影响。MAE 越小,说明模型预测的总体偏差越小。它的优点是直观、容易解释,缺点是没有突出大误差的影响。 -
MSE 与 RMSE(均方误差与均方根误差)
MSE 是预测误差平方的平均值,RMSE 是它的平方根。由于误差先取平方再平均,所以大误差会被放大,使得 RMSE 对异常值非常敏感。RMSE 与原始数据同量纲,便于直接比较。如果 RMSE 明显大于 MAE,说明预测误差中存在一些较大的“糟糕预测”。 -
MAPE 与 SMAPE(平均绝对百分比误差与对称平均绝对百分比误差)
MAPE 是误差绝对值占真实值百分比的平均数,常用在业务预测场景,因为人们习惯用百分数理解误差。但 MAPE 有一个致命缺陷:当真实值接近零时,百分比会爆炸甚至无穷大。SMAPE 对公式进行了对称化处理,分母同时包含真实值和预测值的绝对值,缓解了部分“除零”问题,也减少了正负误差的不对称权重。 -
ACF(自相关函数)
自相关函数衡量时间序列在不同滞后阶数上与自身历史值的相关系数。若某阶滞后 ACF 显著不为零,说明序列存在自相关,比如趋势或周期性。这提示我们:历史数据对当前值有预测信息,简单的随机游走假设可能不成立。 -
ADF(增广迪基-富勒检验)
ADF 是一种统计检验,用于判断时间序列是否平稳,或者是否具有单位根。平稳意味着均值、方差不随时间变化,是许多建模方法的前提。如果 ADF 检验的 p 值小于显著性水平(如 0.05),则拒绝“存在单位根”的原假设,认为序列是平稳的。 -
泰尔不等式系数(Theil's Inequality)
这是一个介于 0 和 1 之间的指标,用于比较预测序列与真实序列的整体差异。0 表示完美拟合,1 表示预测完全反向或差异极大。与 RMSE 不同,泰尔系数提供了某种“相对”比较,可以用于评价模型是否比简单的“天真预测”更好。 -
锐度(Sharpness)与覆盖率(Coverage)
这两个概念来自概率预测和区间预测。锐度指的是预测分布或预测区间的集中程度——区间越窄,锐度越高,但过度追求锐度可能牺牲可靠性。覆盖率则是指真实值落在预测区间内的频率,理想情况下应等于预设置信水平。两者是一对矛盾,需要平衡。
策略思路讲解
虽然这个工具集本身不是交易信号发生器,但它的设计思想对网格策略、区间策略以及任何依赖时间序列预测的量化系统都有重要的指导意义。
首先,用误差指标校准模型。 假设我们试图预测某个品种未来 20 个周期的价格区间,从而决定网格的上下边界。我们可以先用历史数据做回测,计算出 MAE、RMSE 和 MAPE。如果 MAPE 过大,说明预测的百分比偏差偏高,在低价格阶段尤其危险;如果 RMSE 远大于 MAE,说明存在少数极端误差,这时应该考虑对模型做稳健性处理,比如使用基于中位数的损失函数,或者给网格边界留出更宽的缓冲带。
其次,用自相关分析判断市场状态。 网格交易本质上假设价格会在一定区间内震荡。如果 ACF 显示序列在一阶滞后上具有强正相关,意味着价格有动量趋势,网格很容易被单边行情击穿;反之,如果 ACF 快速衰减且接近零,说明价格接近随机游走,震荡假设可能成立。ADF 检验则帮助我们确定序列是否平稳。在不平稳的品种上强行做区间策略,无异于逆水行舟。
第三,用风险度量优化区间宽度。 覆盖率指标可以直接检验预测区间的有效性。例如,我们设定 80% 的预测区间,如果实际覆盖率只有 60%,说明我们过于自信,区间设窄了;如果覆盖率达到 95%,说明区间太宽,资金利用率下降。锐度则提醒我们不要一味追求窄区间,而是要在锐度与覆盖率之间寻找帕累托最优。泰尔不等式系数可以用来整体评价一个区间预测模型相比“上一期价格不变”这种朴素模型是否有实质改进。
第四,将这些指标组合成策略过滤器。 我们可以对一组候选参数或模型分别计算上述指标,然后设定阈值:只有同时满足低 MAE、低泰尔系数、ADF 平稳、覆盖率接近设定水平的策略才被允许上线。这样就把统计度量转化成了可执行的决策流程。
第五,用指数评估动态调整网格。 在市场波动率变化时,固定的网格间距会导致频繁穿网或成交稀少。利用时间序列预测模型滚动输出误差指标,我们可以动态调整网格间距:当 RMSE 上升时加宽网格,当 SMAPE 下降时收紧网格。这种“基于预测不确定性”的调节方式,比单纯观察价格波动率更为精细。
本质上,该工具集引导我们从一个更高的视角看待策略:不要问“赚不赚钱”,而要问“预测对不对、判断稳不稳、风险是否被量化”。当一个策略的预测误差可监控、自相关结构可识别、风险敞口可覆盖时,它的赚钱能力也就有了扎实的统计基础。
优点
-
指标体系全面
该工具集将误差类、平稳性与自相关类、风险类指标整合在一起,覆盖了从点预测到区间预测的多个维度。使用者不需要自己东拼西凑多个库,就能获得一套标准化的评估流程。 -
易于横向比较
有了统一的度量标准,不同策略或模型之间可以从多个角度进行比较。比如策略 A 的 RMSE 小但覆盖率低,策略 B 的 RMSE 稍大但覆盖率高,这比单纯比较收益曲线更能反映真实差异。 -
强调稳健性与风险
传统评估只关心收益,而该工具集特别引入了风险度量,如泰尔系数、锐度和覆盖率。它提醒使用者:即使某个策略在样本内表现完美,如果预测区间不靠谱,实盘也可能遭遇巨大回撤。 -
适用于多种金融场景
无论是用于价格预测、波动率建模还是网格交易,这些度量都有明确的解释意义。它们不依赖特定品种,可用于外汇、期货、加密货币等时间序列数据。 -
促进统计思维
该工具集促使交易者从“看图说话”转向“量化验证”。通过 ADF 检验和 ACF 图,能够更理性地识别趋势与震荡环境,减少主观判断的盲目性。
缺点
-
存在过拟合风险
这些指标是从历史数据中计算出来的,如果反复使用同一组数据来调参并选择“最漂亮”的指标组合,很容易陷入过拟合。样本内的低 MAE 或高覆盖率,不代表样本外同样有效。 -
对异常值敏感
MSE 和 RMSE 对大误差赋予很高权重,如果数据中存在极端价格变动(如闪崩),这些指标会严重失真。即使使用 MAE,也无法完全消除离群值的影响。 -
指标解读需要一定统计学功底
普通交易者可能不熟悉 ADF 检验的原理,也不清楚锐度与覆盖率之间的取舍。直接使用这些指标而不理解其假设,可能导致错误结论。例如,在小样本上 ADF 检验的功效很低,容易误判平稳性。 -
静态度量难以适应市场切换
大多数指标是对历史区间的整体平均,无法及时反映市场结构的突然变化。当行情从震荡切换到趋势时,基于全样本计算的 ACF 或泰尔系数可能已经“过期”。 -
不提供优化方向
这些指标只能告诉你“策略表现如何”,却不能告诉你“应该怎么改”。RMSE 大可能是滞后阶数不够,也可能是数据清洗有问题,甚至可能是预测目标本身不可预测。需要结合数据诊断和业务经验才能对症下药。
起源年份考证
关于这个具体工具的创作时间,我们无法准确考证(公开交易社区并未提供明确的发布年份)。但就其涉及的统计方法而言,我们可以勾勒出一条学界公认的时间线:
- 19 世纪初至 20 世纪初:最小二乘法、均方误差等概念由高斯、拉普拉斯等数学家奠定基础。MAE 和 MSE 作为误差度量在统计学中逐渐成为标准工具。
- 1938 年:自相关函数的概念由统计学家尤尔(G. U. Yule)等人在时间序列分析中提出并应用,后经博克斯(Box)和詹金斯(Jenkins)在 1970 年系统化,成为时间序列建模的基石。
- 1961 年:经济学家 H. Theil 在其著作中提出了泰尔不等式系数,用于度量预测精度,后来成为经济预测领域的常用指标。
- 1979 年:迪基(Dickey)和富勒(Fuller)提出单位根检验方法,即 ADF 检验的前身。1981 年又加入增广项以处理高阶自相关,形成广为使用的 ADF 检验。
- 20 世纪 60 年代至 80 年代:MAPE 作为商业预测中的直观误差指标逐渐流行;SMAPE 则是在 20 世纪 80 年代,随着国际预测竞赛(如 Makridakis 主办的 M 竞赛)的开展而被更多人关注和使用。
- 20 世纪中叶:网格交易作为一种简单的区间交易策略开始出现在民间交易者中,但其确切起源无法考证,很多资料指向 20 世纪 40 年代的外汇市场。
- 21 世纪 10 年代以后:概率预测中的锐度、分辨率、覆盖率等概念在气象学和金融风险管理领域得到更多应用,并逐步进入量化交易社区的工具箱。
综合来看,“时间序列基准度量”这类方法并不是某一个人灵光乍现的产物,而是将近一个世纪统计学发展成果的浓缩。该库的独特价值在于把不同时代、不同学科的工具汇聚在同一个接口下,方便交易者直接使用。
改进建议
-
引入滚动窗口与样本外测试
与其在固定历史区间上计算全部指标,不如采用滚动窗口或 Walk-Forward 分析方法。每次只使用过去 N 根周期计算指标,然后记录未来 K 根周期的实际结果。这样可以动态监控指标变化,及时发现市场状态转变,并降低过拟合风险。 -
增加稳健性指标
现有指标对异常值敏感,可以补充中位数绝对误差(MedAE)、胡伯损失或分位数损失。或者对数据先做 Winsorize 缩尾处理,再计算 RMSE 和 MAPE。这样能减小极端价格跳变对评估结果的冲击。 -
构建复合评分并验证其有效性
可以给不同指标赋予合理权重,例如综合误差(RMSE)、平稳性(ADF p 值)和(1 - 泰尔系数),形成 0 到 100 的评分。但权重的确定不宜拍脑袋,建议使用主成分分析或网格搜索,并用样本外数据验证该评分是否与未来收益或回撤相关。 -
增加预测区间校准机制
对于区间预测,可以引入“削球评分”或“区间评分”函数,比如 Winkler 分数或区间覆盖率损失。在每次重新训练模型后,检查覆盖率是否偏离预设置信水平,若偏差过大则自动调整区间半径。这比静态的 80% 区间更贴近市场真实不确定性。 -
结合统计显著性检验
如果只是比较两个策略的 RMSE 或覆盖率差异,难免受到随机扰动影响。建议加入 Diebold-Mariano(DM)检验或其他模型比较检验,判断差异是否统计显著。只有当置信度足够高时,才认为新策略确实优于旧策略。 -
与波动率模型联动
时间序列误差指标可以嵌入 GARCH 或随机波动率模型,形成动态的预测区间。例如,用 GARCH 模型预测波动率,再结合 RMSE 调整网格上下界。这样既保留了统计度量的客观性,又利用了波动率聚集效应。 -
可视化与定期回测报告
建议定期输出包含 ACF 图、预测区间覆盖图、泰尔系数趋势图的回测报告。视觉化的趋势比单个数值更容易暴露问题。例如,如果 ACF 在某一阶滞后突然升高,可能意味着模型遗漏了一个新出现的周期成分。
总结
TimeSeriesBenchmarkMeasures 是一个极具实用价值的时间序列分析工具集。它并不是一个“圣杯式”的交易策略,而是一套严谨的“体检系统”。通过精度指标,我们能知道预测偏差有多大;通过自相关分析,我们能辨别市场的趋势性与随机性;通过风险度量,我们能检验预测区间是否可靠,以及在风险与收益之间是否取得了合理平衡。
对于网格交易、区间策略乃至任何依赖预测模型的量化系统来说,这样的工具集能够帮助我们减少主观臆断,建立以数据为驱动的优化循环。当然,它也有自身的局限——统计指标不能替代市场理解,历史数据也不能完全预示未来。我们应当把它视为一面镜子,而不是一本预言书。真正的进步,来自于在使用这些指标的同时,持续追问:这些数字背后的假设是否成立?它们能否经受住下一轮市场变动的检验?
量化交易是一场概率游戏,而时间序列基准度量正是我们提高概率认识精度的阶梯。理解并善用它们,你的策略将不再只是“看起来不错”,而是“测量过、验证过、有边界”的决策系统。