← 返回《进阶量化交易实战:迭代式的量化策略研发》
📑 查看全课大纲(第 17 / 59 节)
  1. 1.量化投资必备基础知识
  2. 2.趋势型策略及模型原理
  3. 3.均值回复型策略及模型原理
  4. 4.配对交易策略及模型原理
  5. 5.量化策略研发流程与基本技能
  6. 6.常用的量化平台概述及如何选择
  7. 7.如何量化一个主观策略思路
  8. 8.常用技术指标及指标计算过程
  9. 9.如何编写指标代码
  10. 10.指标的物理意义
  11. 11.技术指标的应用技巧
  12. 12.更多的交易决策
  13. 13.编写程序去量化一个趋势型技术指标
  14. 14.编写趋势型技术指标的性能评价
  15. 15.策略对交易成本和持仓周期的影响
  16. 16.股票池策略的原理及基本框架
  17. 17.基于多因子分析的股票池设计与实现
  18. 18.股票池的性能评估
  19. 19.使用定制化财务因子构建股票池
  20. 20.趋势型策略原理及股票池机制的设计
  21. 21.趋势型择时信号的设计方法与编程实现
  22. 22.趋势型策略的回测与性能评估
  23. 23.优化趋势型策略的思路及方法
  24. 24.量化体系中的风险控制思想
  25. 25.风险的度量-波动率
  26. 26.常用的风险控制方法
  27. 27.实现止盈止损模块以提高策略性能
  28. 28.策略性能的评估与优化
  29. 29.探讨波动率与风险的关系
  30. 30.量化策略中的经典资金管理模型
  31. 31.用python编程实现资金管理模块
  32. 32.构建一个完善的量化交易策略
  33. 33.趋势型量化策略必备的期货知识
  34. 34.期货量化工具介绍
  35. 35.商品期货趋势型策略原理
  36. 36.用TB编写商品期货趋势型策略(上)
  37. 37.用TB编写商品期货趋势型策略(下)
  38. 38.分析优化商品期货趋势型策略的方法思路
  39. 39.期货交易策略的注意事项
  40. 40.均值回复型策略的原理
  41. 41.A股市场有没有稳定的均值回复效应?
  42. 42.编写一个均值回复型股票量化策略
  43. 43.编写多空组合策略进行策略改进
  44. 44.在策略中实现头寸管理进行策略优化
  45. 45.套利策略原理及常见套利类型
  46. 46.用MC开发一个跨品种套利交易策略(上)
  47. 47.用MC开发一个跨品种套利交易策略(下)
  48. 48.统计套利之股票配对交易策略
  49. 49.实盘中的细节问题:加减仓
  50. 50.关于高频交易
  51. 51.如何评价实盘量化策略的性能
  52. 52.量化系统的工作过程及研发流程
  53. 53.运气or实力
  54. 54.量化实盘交易需要满足什么条件
  55. 55.未来函数的坑
  56. 56.实盘数据接口异常的自动报警
  57. 57.交易系统的压力测试
  58. 58.自动运行的交易策略,什么时候需要人工干预
  59. 59.预案准备和实盘心理建设

基于多因子分析的股票池设计与实现

约 26 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

基于多因子分析的股票池设计与实现

小象实战讲义 · 进阶量化交易实战:迭代式的量化策略研发 本讲义仅用于编程与量化方法教学,不构成任何投资建议。

多因子量化选股是现代资产管理的核心支柱。本节深入剖析价值(Value)、成长(Growth)、动量(Momentum)与质量(Quality)因子的标准化(Z-Score)、去极值(Winsorization)与因子正交化(Gram-Schmidt / 对称正交)数学工艺。

💡 核心导读

  • 多因子数据预处理四大标准工序
    • 去极值(Winsorization):采用 3 倍中位数绝对偏差(MAD)平滑极端异常值;
    • 截面标准化(Z-Score):将不同量纲的财务与价量因子转换至均值为 0、标准差为 1 的标准正态空间;
    • 行业与市值中性化(Neutralization):利用 OLS 回归剥离行业分类与对数流通市值的线性影响;
    • 因子对称正交化(Symmetric Orthogonalization):消除因子间多重共线性,保留原始因子最大信息量。
┌─────────────────────────────────────────────────────────────┐
│                    多因子特征工程清洗与正交流水线              │
└──────────────────────────────┬──────────────────────────────┘

 ┌─────────────────────────────┼─────────────────────────────┐
 ▼                             ▼                             ▼
┌─────────────────────────┐   ┌─────────────────────────┐   ┌─────────────────────────┐
│ 原始因子收集 (Raw Data) │   │ MAD 去极值 & Z-Score    │   │ 对称正交化 (Orthogonal) │
├─────────────────────────┤   ├─────────────────────────┤   ├─────────────────────────┤
│ • PE / PB (估值)        │   │ • 3-MAD 边界截断        │   │ • 消除因子相关性        │
│ • ROE / 净利增速 (质量) │   │ • (x - mean) / std      │   │ • 矩阵分解: S = C^(-1/2)│
└─────────────────────────┘   └─────────────────────────┘   └─────────────────────────┘

一、因子预处理:3-MAD 去极值与截面 Z-Score 标准化

对于全市场截面因子序列 xx,中位数绝对偏差(MAD)计算公式为:

MAD=Median(xMedian(x))MAD = \text{Median}(|x - \text{Median}(x)|)

将处于 [Median(x)3×1.4826×MAD,Median(x)+3×1.4826×MAD][\text{Median}(x) - 3 \times 1.4826 \times MAD, \text{Median}(x) + 3 \times 1.4826 \times MAD] 之外的值截断,随后进行 Z-Score 标准化:

zi=xiμσz_i = \frac{x_i - \mu}{\sigma}

import pandas as pd
import numpy as np

def clean_factor_mad_zscore(series: pd.Series) -> pd.Series:
    """
    3-MAD 去极值与截面标准化
    """
    med = series.median()
    mad = (series - med).abs().median()
    up = med + 3.0 * 1.4826 * mad
    down = med - 3.0 * 1.4826 * mad
    clipped = series.clip(lower=down, upper=up)
    std = clipped.std()
    return (clipped - clipped.mean()) / (std if std != 0 else 1.0)

二、对称正交化消除因子共线性

设标准化后的因子矩阵为 FN×KF_{N \times K},其协方差矩阵为 C=1NFTFC = \frac{1}{N} F^T F。对称正交化构造正交变换矩阵 S=C1/2S = C^{-1/2},得到正交因子矩阵:

F=FC1/2=FUΛ1/2UT\tilde{F} = F C^{-1/2} = F U \Lambda^{-1/2} U^T

正交后的因子间相关系数严格为 0,且与原始因子的相似度最高。

def symmetric_orthogonalize(df_factors: pd.DataFrame) -> pd.DataFrame:
    """
    多因子对称正交化算法
    """
    F = df_factors.values
    C = np.cov(F, rowvar=False)
    eig_val, eig_vec = np.linalg.eigh(C)
    eig_val = np.maximum(eig_val, 1e-8)
    
    # 构造 C^(-1/2)
    inv_sqrt_D = np.diag(1.0 / np.sqrt(eig_val))
    S = eig_vec @ inv_sqrt_D @ eig_vec.T
    
    F_ortho = F @ S
    return pd.DataFrame(F_ortho, index=df_factors.index, columns=df_factors.columns)

📝 动手练一练

编写 Python 脚本模拟三因子(估值、动量、质量)的去极值、标准化与对称正交化全流程:

import pandas as pd
import numpy as np

def run_factor_pipeline_test():
    np.random.seed(42)
    n_stocks = 80
    
    # 模拟高度相关的两个因子
    f_val = np.random.normal(0, 1, n_stocks)
    f_mom = 0.7 * f_val + 0.3 * np.random.normal(0, 1, n_stocks)
    f_qual = np.random.normal(0, 1, n_stocks)
    
    raw_df = pd.DataFrame({'Value': f_val, 'Momentum': f_mom, 'Quality': f_qual})
    
    # 1. 清洗与标准化
    cleaned_df = raw_df.apply(clean_factor_mad_zscore)
    
    # 2. 对称正交化
    ortho_df = symmetric_orthogonalize(cleaned_df)
    corr_matrix = ortho_df.corr()
    
    print("================ 多因子正交化处理验证 ================")
    print("正交前 Value 与 Momentum 相关系数:", f"{raw_df['Value'].corr(raw_df['Momentum']):.4f}")
    print("正交后 Value 与 Momentum 相关系数:", f"{corr_matrix.loc['Value', 'Momentum']:.4e}")
    assert abs(corr_matrix.loc['Value', 'Momentum']) < 1e-5, "因子正交化失败!"
    print("✅ 多因子设计与正交化测试 PASS")
    print("====================================================")

if __name__ == '__main__':
    run_factor_pipeline_test()

运行结果输出:

================ 多因子正交化处理验证 ================
正交前 Value 与 Momentum 相关系数: 0.9244
正交后 Value 与 Momentum 相关系数: -2.8107e-18
✅ 多因子设计与正交化测试 PASS
====================================================

本章小结

  1. 标准化预处理是先决条件:通过 3-MAD 去极值和 Z-Score 标准化,消灭不同量纲和极端离群值的干扰。
  2. 正交化消除多重共线性:运用对称正交矩阵分解,彻底解耦高度共线因子,保证组合权重的稳定性。
  3. 因子暴露中性化控制:在打分前剥离市值与行业 Beta,确保策略捕获纯粹的 Alpha 溢价。

📋 行动清单 (Action Checklist)

  • 运行正交化代码,观察正交前后因子在股票池上的打分排序差异;
  • 实现基于 OLS 回归的市值中性化函数(残差提取);
  • 预习下一节,掌握股票池在分层回测下的 IC/IR 性能评估体系。

— 小象教研组

配套学习资源与课件
  • 第3章课件:基于多因子分析的股票池开发(PDF · 1.6MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问