典型的“多因子合成”问题,但其挑战在于:各因子量纲不同、频率不同、噪声水平不同、与情绪的真实关系(可能是非线性)也不同。
他没有选择现成的、复杂的机器学习黑箱模型(如深度神经网络)。虽然那些模型可能在数据拟合上更“精确”,但可解释性差,且对训练数据的质量和数量要求极高,在缺乏足够长、且包含完整牛熊周期的历史数据标签(什么是“极度贪婪”?什么是“极度恐慌”?本身就需要定义)的情况下,容易过拟合或产生不可预知的偏差。
他选择了更为稳健、透明,且便于迭代和调整的“多因子加权合成 + 状态机判别”的混合建模思路。整个过程,充满了试错、验证、再调整。
------
第一步:因子预处理与标准化
来自不同源头的数据首先需要进行清洗和预处理,消除极端值、处理缺失值。然后,是关键的标准化。他需要将不同量纲、不同取值范围的因子,映射到统一的、可比较的尺度上。
陆孤影没有使用简单的Min-Max归一化(缩放到0-1之间),因为某些指标(如涨跌停家数)的分布可能高度偏斜,且极值会随着时间推移而变化。他选择了基于滚动时间窗口的标准化。对于每个因子,计算其过去N个交易日(例如,N=60,代表一个季度)的滚动均值和滚动标准差,然后将当前值转换为“偏离其近期均值的标准差倍数”,即Z-Score。
例如:
当前上涨家数比例 = (当前值 - 过去60日该比例均值) / 过去60日该比例的标准差
这意味着,因子值表达的是“相对于近期正常水平,当前是异常的高还是低”。一个Z-Score为+2的因子,意味着其当前值比近期的平均水平高出2个标准差,处于统计学意义上的显著高位。这对于衡量情绪的“热度”或“冷度”非常直观。
他将所有连续型因子(如上涨家数比例、波动率、新闻情感得分、
本章未完,请点击"下一页"继续阅读! 第2页 / 共7页