- Published on
Spearman Rank Correlation Coefficient
- Authors

- Name
- CoresightQuant
NOTE
本文为公开交易策略的技战术复盘,聚焦方法逻辑、交易场景与风险边界。
策略解读
在量化交易的世界里,我们常常需要衡量两个变量之间的关联程度。传统的皮尔逊相关系数基于变量自身的数值计算,但它要求数据服从正态分布,且对异常值十分敏感。而斯皮尔曼秩相关系数则完全不同——它不关心变量的绝对数值,只关注变量在各自排序中的相对位置。这种“以排序代替数值”的思想,使得它天然具备稳健、非参数的优势。
该公开交易社区中的策略脚本,正是利用斯皮尔曼秩相关系数构建了一个均值回归模型。作者试图回答这样一个问题:如果我们将一段时期内的价格水平进行排序,并考察排序与时间之间的相关性,会呈现出怎样的规律?当价格持续走强时,近期价格在观察窗口中的排名往往较高,甚至排名与时间呈现出接近+1的正相关;反之,当价格持续下跌时,排名与时间则表现出接近-1的负相关。一旦这种相关性达到极端值,市场情绪往往已经过度透支,随之而来的很可能就是反转。于是,基于斯皮尔曼秩相关系数的均值回归策略便应运而生。
这种思路将复杂的市场行为简化为了一个介于-1与+1之间的秩相关值。它摆脱了价格绝对值的影响,更加关注“趋势的均匀程度”和“相对位置的极端程度”。相比简单的超买超卖指标,它从统计学的角度提供了另一种理解“过热”和“过冷”的视角。在本文中,我们将深入剖析该指标背后的数学原理、交易逻辑以及实战中的优劣,帮助读者更好地理解这一非参数化工具。
名词解释
-
斯皮尔曼秩相关系数:由心理学家查尔斯·斯皮尔曼于1904年提出,是一种基于变量秩次(排序位置)来计算相关性的非参数统计量。它通过比较两个变量的排序是否有一致趋势来度量相关性强弱,取值在-1到+1之间。若一个变量的秩随另一个变量的秩同向增加,则系数为正;反向则系数为负。
-
皮尔逊相关系数:最常用的线性相关系数,度量两个连续变量之间的线性相关程度。它要求数据近似服从正态分布,且对离群点非常敏感。若两个变量存在非线性但单调的关系,皮尔逊相关系数可能被低估,而斯皮尔曼秩相关系数则能更好地捕捉。
-
非参数统计:不假设样本数据服从特定概率分布(如正态分布)的统计方法。它更关注数据的秩、中位数等稳健特征,因此对异常值和偏态分布具有更强的抵抗力。斯皮尔曼秩相关系数正是非参数统计的经典代表。
-
均值回归:金融学中的一种经典假设,认为价格在偏离其长期均值或均衡水平后,最终会重新回归到平均值附近。均值回归策略通常做多超跌资产、做空超涨资产,博取价格向均值收敛的收益。本文所讨论的策略即属于该类。
-
秩(Rank):将一组数据从小到大或从大到小进行排列后,每个数据所获得的位置编号。例如,在一组5个价格中,最小的价格秩为1,最大的秩为5。秩反映了变量在总体中的相对位置,而非具体大小。
-
单调关系:指两个变量之间始终保持同向变化(要么同增,要么同减),但不要求变化速率恒定。斯皮尔曼秩相关系数专门衡量单调关系强度,而皮尔逊相关系数仅衡量线性关系。
-
统计显著性:在统计推断中,判断观察到的相关关系是否由偶然因素导致的概率指标。通常用p值表示,p值越小,说明观察到的相关性越可能真实存在,而非随机噪音。
策略思路讲解
该策略的核心逻辑是使用斯皮尔曼秩相关系数构建一个“趋势热度指标”,并以此判断市场的过度延伸状态。具体来说,我们可以设想这样一个计算过程:
在一个固定的回望窗口内(例如20根K线),记录每一天的价格,然后将这些价格在该窗口内进行排序,得到每一天的秩次。例如,如果某一天的价格是过去20天中的最高价,那么该天的秩就是20;若是最低价,则秩为1。接下来,我们计算这组秩与对应时间顺序(从第1天到第20天)之间的斯皮尔曼秩相关系数。这样,我们便得到了一个动态的、介于-1与+1之间的数值。
当这个相关系数持续接近+1时,意味着价格随着时间推移在窗口内的排名几乎总是上升的,也就是呈现出非常规律的持续上涨形态。这种走势往往出现在强势单边行情中,市场情绪极度乐观,但也是超买风险不断累积的时刻。反之,当相关系数接近-1时,价格在时间维度上排名持续下降,呈现几乎完美的下跌趋势,超卖情绪浓厚,随时可能出现反弹性修复。
交易策略则基于极值反转的思路:当该相关系数超过某个较高的阈值(比如0.8)时,视为超买信号,准备做空;当相关系数低于某个较低的阈值(比如-0.8)时,视为超卖信号,准备做多。当然,并非每次极端值都会立即反转,因此策略通常会附加一些确认条件,比如等待相关系数从极值区域回落之后才入场,或者结合其他指标来过滤假信号。
值得注意的是,斯皮尔曼秩相关系数本身并不包含价格的绝对变动幅度。也就是说,即使两个窗口内价格波动的百分比不同,只要排名变化模式相同,得到的相关系数也可能相同。这既是它的特点,也是它的局限——它更关注相对走势,而忽略实际波动的大小。因此,在实际应用中,我们常常需要额外引入波动率或价格差值,以更全面地评估交易机会。
该策略的本质是一种统计套利与情绪极值的结合。它试图捕捉市场在极端状态下的非理性延续,并在情绪回归理性之前反向入场。由于它基于排序,而非绝对价格,所以在市场震荡剧烈、存在大量异常长上影线或极端波动时,依然能够保持相对稳定的信号输出。
优点
1. 非参数、无需正态假设
斯皮尔曼秩相关系数不要求价格数据服从正态分布,也不依赖均值和方差等参数。这使得它在处理金融时间序列这种典型的尖峰厚尾分布时,依然具有统计意义,不会因分布假设被违反而产生严重偏差。
2. 对异常值不敏感
即使出现极端的单日暴涨暴跌,由于秩只取决于排序位置,异常的绝对值不会过度影响整体的相关性。这比皮尔逊相关系数稳健得多,尤其适合股票报价、跳空缺口等经常产生离群点的行情。
3. 能捕捉单调非线性关系
价格走势并不是始终线性的。某些时候,价格上涨的速率会忽快忽慢,但方向始终向上。斯皮尔曼秩相关系数能够识别这种单调关系,即使在价格与时间之间并非严格线性关系时,也能给出接近+1或-1的强相关信号,因而更贴近真实市场行为。
4. 对排序数据天然友好
策略本身就基于价格排名操作,无需额外转化。将价格排序后再计算秩相关,不仅逻辑清晰,而且计算过程与最终使用方式高度契合,减少了因数据预处理不当而造成的误差。
5. 实现简单,可解释性强
该指标的计算过程易于理解,不需要复杂的机器学习或深度模型。从技术分析师到量化研究员,都能很快掌握其背后的逻辑,并且可以较为容易地解释每一次交易信号的来源,有利于策略的迭代和风控。
缺点
1. 对样本量要求较高
当回望窗口过短时(例如5根K线),秩次数量不足以稳定估计相关系数,结果会频繁在极端值之间跳变,产生大量噪音信号。一般需要至少20个样本才能获得一定的统计意义,但这又会增加策略的滞后性。
2. 忽略价格变化的幅度
秩只提供相对位置,不包含具体数值。例如,两次上涨中,一次每根K线只涨0.1%,另一次每根K线涨1%,只要排名模式相同,斯皮尔曼相关系数完全相同。这导致策略无法区分温和趋势与剧烈趋势,可能错过或放大交易机会。
3. 存在滞后性
由于该指标是基于过去一段时间内的排名计算,它会天然地跟随价格趋势。当趋势逆转时,指标的极值状态可能需要一些时间才能被打破,导致信号滞后。尤其是在市场由单边趋势突然转为横盘时,指标无法立即反应。
4. 在无明显趋势时容易产生假信号
当市场处于窄幅震荡区间时,价格排名可能随机变动,导致斯皮尔曼秩相关系数在零附近来回穿越。如果策略仅依赖绝对阈值,很容易反复触发交易,造成不必要的亏损和交易成本。
5. 无法区分上涨乏力和正常回撤
一个极端高相关可能出现在上涨初期,也可能出现在上涨末期。如果缺乏其他确认手段,该指标单方面无法判断当前极端状态是否可持续,容易在趋势尚未结束时就过早反向交易。
起源年份考证
关于斯皮尔曼秩相关系数的起源,可以追溯到20世纪初:
- 1904年:查尔斯·斯皮尔曼在心理学研究中首次提出秩相关系数的计算方法,用以衡量被试在不同测验中的排名一致性。这一原始论文奠定了非参数相关分析的基础。
- 1940年代:随着非参数统计的发展,Mann-Whitney U检验、Wilcoxon符号秩检验等方法相继提出,斯皮尔曼秩相关系数逐渐被纳入统计教科书的常规内容,成为统计学中经典的非参数工具。
- 1950-1960年代:金融经济学家开始将统计方法应用于资产价格研究。早期主要使用线性回归与相关系数,但人们逐渐发现金融数据不满足正态分布,非参数方法开始进入金融领域。
- 1970年代:均值回归交易策略在商品期货和股票市场中被广泛讨论,例如针对相对强弱指数和乖离率的超买超卖策略。基于秩相关性的非参数指标也在此时期被尝试用于量化择时。
- 2000年以后:随着计算机算力提升,计算历史窗口内的秩相关系数变得轻松。技术分析社区中开始出现基于斯皮尔曼秩相关系数开发的自定义指标,用于判断趋势的强弱和反转的临界点。该作者的脚本正是这一趋势下的产物之一。
需要说明的是,上述时间线是基于“同类方法”的文献考证,并非针对该特定脚本。具体该脚本何时公开,无法考证,但可以推断其出现在脚本语言4.0版本发布之后的若干年内。无论如何,斯皮尔曼秩相关系數本身诞生于1904年,距今已有一个多世纪,其在交易领域的应用则是随着计算机技术的成熟而逐步普及。
改进建议
1. 引入动态窗口与自适应周期
固定窗口无法适应不同市场环境。可以通过分析价格波动率或市场周期,动态调整回望窗口长度。例如,当波动率上升时缩短窗口以更灵敏地捕捉反转,波动率降低时延长窗口以过滤噪音。
2. 增加趋势过滤条件
结合长期均线或ADX(平均趋向指数)判断市场当前是否处于强趋势状态。如果长期均线方向明确向上,且斯皮尔曼指标出现极端高值时,应谨慎做空,因为趋势可能仍将持续。仅当趋势指标转弱或横盘时,才触发反转信号。
3. 使用多时间周期共振
在短周期(如15分钟)和长周期(如日线)上同时计算斯皮尔曼秩相关系数,当两个周期同时进入极端区域时再入场。这样既能提高信号可靠性,又能避免短周期内的微小波动带来的频繁交易。
4. 设置非对称阈值和延迟确认
不要简单使用±0.8的对称阈值。针对不同标的的统计特性,可以使用分位数法确定阈值,使入场次数和胜率达到均衡。同时,等待指标从极端值回落一定百分比后再执行交易,避免在指标最极端时直接入场,减少逆势风险。
5. 结合价格幅度或波动率进行加权
既然秩相关系数忽略了幅度,我们可以额外引入一个“强度因子”,例如计算窗口内价格涨跌幅的标准差。只有当秩相关系数极端且波动率也达到一定水平时,才认为信号有效。这样能够区分温和趋势和暴涨暴跌,提升策略的针对性。
6. 引入止损与仓位管理
纯粹依赖反转信号容易遭遇“接飞刀”式亏损。建议设定一个较宽的止损,例如在过去的最高价/最低价上方或下方一定比例处。同时,根据指标极端程度动态调整仓位,信号越极端仓位越小,以防范极端行情中的连续单边走势。
7. 使用重采样或滚动历史分布校准信号
该方法假设统计指标的历史分布稳定,但实际上不同市场阶段的分布可能变化。可以通过滚动历史数据计算当前指标值在历史分布中的百分位,而不是固定阈值,从而更灵活地适应结构性变化。
8. 与其他均值回归指标融合
将斯皮尔曼秩相关系数与布林带、RSI、CCI等传统指标结合,形成一个综合打分系统。只有多个指标同时指向超买或超卖时,才发起交易。这能显著提高信号的质量,减少单一指标的盲点。
总结
斯皮尔曼秩相关系数是一种强大的非参数统计工具,它通过分析排序关系来刻画变量的同步趋势,完美契合了均值回归策略对“过度延伸”和“极端情绪”的捕捉需求。在公开交易社区中,该作者以“新数组函数”为契机将该指标引入到量化脚本中,体现了技术开发者对统计工具在交易中应用的持续探索。
从策略逻辑上看,该指标将价格走势转化为一种类似于“排序动量”的数值,当数值达到极端时,市场往往已经过度偏离正常状态,因而具备反转的潜力。其优点在于稳健、普适、对异常值不敏感,能够识别非线性单调关系;但其缺点也同样明显,包括对样本量敏感、忽略幅度信息、存在滞后性以及容易产生假信号。
针对这些不足,我们可以通过动态窗口、趋势过滤、多周期共振、非对称阈值、叠加波动率、严格止损等手段加以改进。交易者在实际应用时,更应结合自身风险偏好和标的特点,对参数进行反复优化,并且时刻牢记:没有任何单一指标可以稳定盈利,斯皮尔曼秩相关系数只是工具箱中的一件精良工具,真正的胜负手仍在于资金管理和交易纪律。
在统计与交易相结合的历史长河中,从1904年秩相关概念的诞生,到现代量化系统中娴熟运用,这一工具经历了上百年的沉淀。它提醒我们,好的数学方法并不会因时间而褪色,相反,在交易这个充满噪音的领域,非参数化的稳健思维永远有着不可替代的价值。希望本文能帮助你更深刻地理解这一指标,并在实践中找到属于你自己的成功之路。