检验年报文本能否在样本外排序公司未来 20 日实现波动率。
SEC 年报获取、section 审核、前瞻标签、滚动切分、训练期文本特征、模型、诊断和审计报告。
固定 50 家公司面板中存在正向的样本外波动率排序信息。
预注册组合 Sharpe 为 -0.8539;组合结果仅作为诊断。
样本是固定活跃公司面板,市场数据采用混合公开来源;这些限制被主动披露,而不是隐藏。
如何阅读证据
先看预注册主结论,再看模型探索
规格注册表将两项预注册检验与稳健性检查、探索性比较明确分开。
预注册
1 个主预测 + 1 个主组合检验主预测 Rank IC 0.2395;主组合 Sharpe -0.8539。
诊断与探索
26 个检验族中的 594 个规格消融、基准、行业中性化、收益率目标和模型比较均与主结论分开报告。
审计边界
0 个关键失败 · 2 个范围警告警告披露公开数据与样本范围限制,不会把探索性证据包装成正式结论。
当前版本:50_company_public_fmp_alpha_2016_2025_v4 · 阅读审计边界
结果快照
波动率排序证据
最强观察结果属于探索性比较;预注册 Ridge 主结果仍为正。
0.36680.32960.29240.2395原始 p 值 0.00067. 支持探索性波动率排序证据。
原始 p 值 0.1147. 尚未建立可交易 alpha。
我的贡献
我设计和实现了什么
我从 SEC 年报抓取到样本外证据审计,搭建了完整研究流程。
滚动训练 / 验证 / 测试切分、前瞻标签、预注册规格和 embargo 防泄漏控制。
年报 section 解析、Loughran-McDonald 词典特征、训练期内 TF-IDF/SVD 和模型清单。
Rank IC、特征消融、行业中性诊断、cluster bootstrap、覆盖率检查和自动报告。
Python · scikit-learn · XGBoost · SEC EDGAR · pytest · Ruff · GitHub Actions
为什么重要
不只是情绪分数或文档检索
把年报文本连接到未来波动率和异常收益目标。
按时间区分训练、验证和测试窗口。
每个 split 的 TF-IDF/SVD 词表只在训练窗口拟合。
把预注册主结论和探索性模型比较分开报告。
披露 parser 问题、bootstrap 不确定性、覆盖率和多重检验。
流程
从 SEC 年报到可审计证据
查看证据
沿着公开审计链检查
精简、合规的公开文件把每个核心数字连接到可复核证据。
使用边界
这是应用级探索性运行,不是 CRSP/WRDS 等价的正式资产定价证据,不是无幸存者偏差复现,不是生产交易系统,也不是投资建议。