选股公式避免过度拟合的核心,是把它当作筛选工具而非预测机器:先用明确的经济逻辑定义筛选条件,再通过样本外验证、参数敏感性测试和幸存者偏差修正来检验稳健性,最后用主观判断处理公式无法量化的部分。没有哪套参数组合能保证未来有效,能做的只是降低公式只在历史上"好看"的概率。
构建公式时的常见误区
过度拟合通常不是一步造成的,而是反复"调参直到回测好看"的结果。几个高发环节:
- 条件堆叠:为拟合历史走势不断加入新条件,样本内表现提升,但每条规则都可能是噪声。
- 参数过密:把阈值、周期设成非整数或极窄区间,等于给历史数据"量身定做"。
- 样本期选择偏差:只选单边上涨或单边下跌区间测试,结论无法外推。
- 幸存者偏差:回测股票池只含当前仍在交易的标的,已退市或长期停牌的被自动剔除,收益会被系统性高估。核对股票池构成时,应以交易所和行情数据商的退市、停牌记录为准。
检验公式是否稳健的方法
判断公式是否过度拟合,重点看它在"没见过的数据"上表现如何:
| 检验维度 | 做法 | 关注点 |
|---|---|---|
| 样本外验证 | 留出一段未参与调参的时期 | 表现是否明显劣化 |
| 参数敏感性 | 微调阈值、周期看结果变化 | 是否剧烈波动 |
| 分市场环境 | 拆分上涨、下跌、震荡阶段 | 是否只在单一环境有效 |
| 换股票池 | 换一批标的或不同市值区间 | 结论是否可复制 |
如果微调参数后结果大幅变化,或换一段时期就失效,说明公式更可能拟合了噪声。稳健的公式通常对参数不敏感,且在多种市场环境下方向一致。
公式与主观判断如何配合
公式擅长的是批量、无情绪地执行筛选条件,不擅长处理政策变化、行业景气拐点、公司治理等难以量化的信息。合理的分工是:
- 用公式缩小关注范围,而不是直接产生买卖结论;
- 对筛出的标的做基本面与公告核查;
- 明确哪些条件由公式决定、哪些由人工否决,避免事后随意放宽标准。
把公式当作决策依据,容易在它失效时缺乏应对;当作筛选起点,则保留了纠错空间。
总结
避免过度拟合的关键在于:逻辑先行、样本外验证、参数不敏感、修正幸存者偏差,并保留人工判断环节。公式的价值是提高筛选效率,而非替代对风险和基本面的判断。
常见问题
选股公式回测收益很高,能直接用于实盘吗?
不能直接等同。回测收益高可能来自过度拟合、幸存者偏差或样本期选择,需要先做样本外验证和参数敏感性测试。回测只是检验逻辑的工具,不是收益承诺。
参数调到最优是不是就更好?
通常不是。参数越精细,越可能贴合历史噪声,未来复现的概率反而下降。更稳妥的做法是选择一段合理区间内表现稳定的参数,而非单点最优。
用了公式还需要自己判断吗?
需要。公式难以覆盖政策、行业变化和公司治理等信息,这些往往决定实际结果。公式负责筛选,判断负责取舍,两者缺一不可。