跳转至

另类数据与事件驱动

另类数据与事件驱动

高频盘口数据

三类微观数据。日 K 线(candlestick):即蜡烛图,包含开盘价、收盘价、最高价、最低价四个维度,表结构含 pre_close、open、high、low、close、volume、turnover、match_items。成交明细/报单明细(tick data):字段含 seq、price、volume、bs_flag、trade_type、ask_order_seq、bid_order_seq 等;原始报单数据有助于加深对市场数据结构的理解,高频交易必须直接研究报单数据。盘口(order book):包含所有待交易者的期望订单集合,交易所按价格归类形成盘口,以中间价为轴向买卖各五档(后面还有)延伸,快照字段含十档买卖价量、wavg_ask、wavg_bid、mid_price。

撮合机制:订单有三种类型(新增、execute、cancel),两个去处——进入匹配成交,或进入盘口挂单。连续竞价遵循价格优先、时间优先。一笔 order 的成交部分与盘口剩余部分相加等于原 order 总量。模拟交易所的标准小项目(海外对冲基金给实习生的入门项目):根据 order 流生成盘口,再由 order 与盘口生成 K 线。

价量因子

基本面因子:底层数据是公司季度三大报表、分析师预期、传统日 K、另类数据(新闻、股吧、网上销售数据、专利数据)。预测周期较长、逻辑性强。

价量因子:来源于 K 线或高频数据,思路多来源于行为金融学范畴或大量数据挖掘。典型实例:

价量背离\(\mathrm{Alpha} = -\operatorname{corr}(vwap, volume)\),表达价格与成交量走势背离。量幅背离:某日最高价等于最低价时(如涨停一字板)当日价格无分歧、幅度为 0;涨停开板按「开板必卖」原则处理。开盘缺口\(\mathrm{Alpha} = open_t / close_{t-1}\);跳空高开说明隔夜信息(个股大利好、或政策行情后资金涌入)未被及时反映,短期是正向因子;长期「跳空必回补」、回归均值。

因子挖掘方法:上述因子都可用表达式标准化,算子包括 rank、correlation、delay、除法/乘法、moving average,变量包括 close、high、low、open、volume、match_items。变量有限时用随机暴力搜索枚举所有范式;数据量与范式组合爆炸后改用遗传规划(genetic programming)智能搜索表达式。

因子有效性度量

因子收益率(factor return):每日截面回归的系数即当日因子收益率。考察每日回归估计量的 t 值,取绝对值大于 2 的比例,长期大部分时间显著则因子有效。

IC(信息系数):因子值与未来收益的相关系数,每天算一个、逐日累加看趋势——持续向上或向下为有效因子,随机震荡为无效因子。rank IC 把因子值先做 rank 再算相关系数,避免极端值影响。经验阈值:IC > 0.03 是非常不错的因子,0.02 为合格因子。

分组收益:按因子打分每天分 10 组(或 20 组),每组 500 只等权持有到次日,关注组间单调性与 Top-Bottom(第 1 组减第 10/20 组)。

long-short(多空):把因子值 0-3(截断 ±3)直接当作仓位倍数,打分高做多、打分低做空,权重求和为 0,自融资。A 股不能普遍做空,但有海外背景的私募仍用 long-short 收益作为因子收益能力的代理。

5 天反转案例:A 股短期反转显著——过去 5 天涨幅越大的股票未来跌幅越大。随机追涨过去 5 天涨幅最高 5% 的股票,年化跑输中证 500 约 67%。

冷门股效应

课题动机:海外研究发现在没有新闻覆盖的股票、没有分析师覆盖的股票上获得更高收益(no-news premium 与 low-coverage premium)。A 股需要一个「关注度」代理变量。

数据选择:东方财富股吧。每只股票一个独立贴吧,天然按股票分类,免去新闻到股票的代码映射难题;A 股散户占比高,覆盖度远高于新闻数据。因子构造:guba_sum_20(过去 20 个交易日发帖数量)与 guba_std_20(过去 20 个交易日发帖数量波动)。

核心发现

冷门股(低关注度)持续获得超额收益,最热门组累计下跌——热门股买入后持续下跌,符合「开板必卖」经验。

Double-sorting 检验 1(换手率 × guba_std_20):冷门股效应在每一换手率组别内都存在;控制换手率后效应仍然存在,流动性不能完全解释该效应。

Double-sorting 检验 2(过去 20 日收益 × guba_std_20):涨得多且热门年化跑输中证 500 约 48%,跌得多且冷门年化跑赢约 28%,涨得多且冷门年化跑赢约 33%;以冷门度切分后反转效应几乎消失——热门股无论过去涨跌都跌,冷门股无论过去涨跌都跑赢。

结论:购买过去涨幅高且关注度低(股吧发帖少)的股票可以获得超额收益。

事件驱动框架

事件驱动框架:探究在不同时间发生的特定事件对股票收益率的冲击。将事件发生日作为基准日(0day),把不同时间发生的同一事件均校准至基准日,记该日累计收益为 0,向前后各追溯一段时间,观察事件发生前后股票收益率(等权平均)的变动趋势。

框架流程:定义事件 → 事件回测统计分析(历年收益、发生频次、显著性)→ 事前进入(预测事件)或事后进入(逻辑构建可预测特征)→ 组合构建。

回测结果(2016-2021):业绩预增事件后 60 日累计收益 4.63%、信息比率 0.97,显著高于事件前(前 60 日 0.73%、信息比率 0.09);业绩预减事件后 60 日累计收益 −0.64%;分析师公告体现扭亏为盈前 60 日累计收益 6.4%、后 60 日 2.3%;利润高于预期事件后 60 日累计收益 4.74%。

专利等另类数据

研发能力度量三方面:产出(专利数据)、投入(研发相关支出)、人力(公司员工结构)。较高的科技水平推动生产效率提高、驱动盈利增长,进而获得超额收益。

专利数据:专利是企业无形资产之一,保护企业一定领域一定期限的垄断权,是衡量研发产出能力的重要证据。专利类型主要为发明授权、实用新型、外观设计(30:58:12)。IPC 分类号由部(8 个:A 人类生活必需、B 作业运输、C 化学冶金、D 纺织造纸、E 固定建筑物、F 机械工程、G 物理、H 电学)加两位数字大类加大写字母小类构成。A 股专利覆盖率从 2016 年中约 0.2 升至 2021 年中约 0.9。

专利类因子:过去一年授权专利数量的累计净值曲线总体上行。

科技关联(technological link):通过专利 IPC 分类号构造股票间的科技邻近度:

\[TECH_{ijt} = \frac{T_{it} T_{jt}'}{(T_{it} T_{it}')^{1/2} (T_{jt} T_{jt}')^{1/2}}\]

\(T_{it}\) 为公司 i 在滚动过去 5 年、427 个技术类别上的专利份额向量。科技关联收益:

\[TECHRET_{it} = \frac{\sum_{j \neq i} TECH_{ijt} \cdot RET_{jt}}{\sum_{j \neq i} TECH_{ijt}}\]

即按科技邻近度加权的同侪公司收益。基于科技关联公司的收益率对焦点公司有强预测力,多空策略月均 α 为 117 个基点。投资者存在有限关注效应,通过非结构化数据构造的股票间 linkage 信息不容易被市场及时发现和消化,存在长期超额收益能力。