量化选股中,因子之间的相关性主要通过因子筛选和因子正交化两种方法来处理,目的是消除冗余信息、降低模型过拟合风险,提升选股策略的稳定性和解释力。
因子相关性的来源与问题
因子相关性在量化选股中非常常见,主要来源于同类型指标的天然关联。例如,市盈率(PE)和市净率(PB)都属于估值因子,往往同时高或同时低;再如,营收增长率和净利润增长率都属于成长因子,走势高度同步。当多个高度相关的因子同时进入模型时,会产生多重共线性问题,表现为:
- 因子冗余:多个因子实际上反映的是同一类信息,模型效率下降。
- 过拟合风险:模型在历史数据中过度拟合噪声,对未来预测能力减弱。
- 因子权重不稳定:相关性高的因子间权重分配敏感,微调数据可能导致权重大幅变化。
处理方法一:因子筛选
最直接的方法是从强相关的因子组中保留最具代表性的一到两个因子,剔除其余。具体步骤:
- 计算因子间相关系数矩阵,通常以 |r| > 0.7 作为强相关阈值。
- 对强相关因子进行分组(如估值组、成长组、动量组)。
- 每组内保留:与未来收益相关性最高、或解释力最强(如IC值最高)的因子。
- 剔除冗余因子后,模型更简洁,解释性强,过拟合风险降低。
但因子筛选可能丢失部分有效信息,适合因子数量较多、且同组内因子区分度不高的情况。
处理方法二:因子正交化
因子正交化通过数学变换,将原始因子转换为互不相关的新因子,同时保留原始因子的大部分信息。常用方法包括:
- 主成分分析(PCA):提取主成分作为正交因子,按方差贡献率排序,保留前几个主成分。优点是自动去相关、降维;缺点是主成分可能失去原始因子的经济含义。
- 施密特正交化(Gram-Schmidt):按指定顺序,依次从后续因子中剔除与前面因子相关的部分。优点是新因子保持原始顺序和部分含义;缺点是对顺序敏感。
- 回归正交化:将目标因子对已选因子做回归,取残差作为正交因子。常用于构建纯因子组合。
正交化后的因子相关性接近零,模型稳定性显著提升。但需注意,正交化过程可能引入噪声,建议在样本外数据验证效果。
处理前后的效果对比:通常,处理前模型在训练集上表现优异但验证集上衰减严重(过拟合);处理后,训练集与验证集的收益预测能力趋于一致,夏普比率和信息比率更稳定。历史回测中,常见因子相关性降低后,多因子组合的最大回撤缩小10%-20%。
总结
处理因子相关性的核心是减少冗余、提升稳健性。因子筛选适合追求简洁和可解释性的场景;因子正交化适合追求信息完整性和模型稳定性的场景。实际应用中,常将两者结合:先用筛选去除强相关因子,再对剩余因子做正交化处理。
常见问题
因子相关性达到多少需要处理?
通常,相关系数绝对值超过0.7时建议处理。0.5-0.7之间属于中度相关,可根据模型复杂度决定:如果因子数量少,可暂不处理;如果因子数量多(如超过20个),建议对中度相关也进行筛选或正交化。
因子正交化后,因子权重如何设置?
正交化后的因子权重通常按照等权或IC加权分配。由于正交因子之间已无相关性,等权即可避免权重集中风险;若使用IC加权,需确保IC值在样本外稳定,否则可能引入新的噪声。
因子筛选和正交化哪个效果更好?
没有绝对优劣,取决于目标。因子筛选更适合解释性要求高的场景(如向客户解释模型逻辑),正交化更适合追求纯收益预测能力的量化策略。实践中,多数量化团队会先筛选再正交化,以平衡简洁性和信息完整性。