金融中的人工智能:资产管理公司如何使用模型进行阿尔法生成和风险
- Aisha Washington

- 6月5日
- 讀畢需時 3 分鐘
定量对冲基金运行机器学习模型已有十余年。自然语言系统如今增添了新的一层。这些系统读取财报电话会议、监管文件以及替代数据流,一旦它们发布。
这一转变改变了多家大型机构的日常工作流程。投资组合团队不再等待人类分析师总结文本。模型每天早晨就能从数千份文件中提取模式。
Two Sigma、Renaissance Technologies 和 D.E. Shaw 对这一层的处理方式各不相同。他们的方法同时影响回报预测和风险控制。
实时文本馈送取代每日摘要
资产管理人曾经在文件发布二十四小时后才收到分析师笔记。当前系统可在几分钟内摄取相同文件。它们标记情绪变化、监管风险短语以及前瞻性陈述。
当多家公司在同一天发布报告时,速度优势尤为重要。模型可以在开盘前比较竞争对手的用语。交易员随后根据比以往早数小时到达的数据调整仓位。
这一变化最直接适用于大盘股投资组合。固定收益部门也在测试相同馈送以捕捉契约语言变化。
Two Sigma 构建内部语言管道
Two Sigma 设有专门团队,根据过去财报电话会议记录微调模型。该公司将这些输出与传统因子信号结合。投资组合经理收到的是排序后的警报,而非原始分数。
内部循环保持封闭。外部供应商无法看到训练数据。这种设置限制了数据泄露,但提高了模型维护成本。
Renaissance 保持信号来源狭窄
Renaissance Technologies 继续将文本输入限制在定义明确的数据集内。该公司仅在严格清洗规则后才添加财报电话会议记录。分析师在任何新来源进入生产模型前仍会逐一审核。
这种方法避免了低质量文件带来的噪声。它也使反应速度慢于接受原始馈送的同行。由于回撤控制仍是首要优先事项,这一权衡在公司内部被视为可接受。
D.E. Shaw 测试外部替代数据层
D.E. Shaw 运行试点项目,将语言模型与卫星图像和航运记录关联。合并后的信号用于短周期股票策略。风险团队审查每个新数据源与现有因子的相关性。
这些试点与核心模型并行运行,而非嵌入其中。这种分离让公司能够在不干扰实盘组合的情况下衡量增量价值。
语言信号遭遇更快的 alpha 衰减
一旦多家基金采用同一馈送,简单的情绪分数会在数周内失去优势。衰减首先出现在高频股票部分。更长周期的宏观组合在六个月后仍能体现价值。
因此,管理人将语言输出与移动更慢的基本面数据结合。这种混合延长了可用期,但降低了原有的速度优势。
风险模型现在必须跟踪文本特征
传统风险系统跟踪价格波动率和板块敞口。新版本还监控投资组合中模型衍生情绪的变化。文件语言的突然变化可能触发自动仓位规模缩减。
这一新增功能带来了新的模型风险。如果语言处理器误读文件,风险系统可能在错误时刻削减敞口。验证团队现在将文本特征与价格数据一同回测。
顶级工具分为三类
向多家客户推送清洗后文件和电话会议记录的供应商仪表盘。
在专有历史数据上微调开源模型的定制内部技术栈。
在严格隐私控制下将供应商数据与公司特定微调相结合的混合服务。
每类工具服务于不同的规模和合规需求。中型管理人倾向于供应商。大型多策略平台则偏好内部技术栈。
公司必须在速度与稳定性之间做出选择
更快的文本模型在财报季提升预测准确性。同一模型会增加换手率和交易成本。投资组合构建团队通过仅将仓位变动限制在高确信度信号上来平衡这些影响。
这一选择也影响薪酬结构。以短期 alpha 衡量的团队偏好速度。以回撤控制衡量的风险委员会偏好稳定性。
下一代基准聚焦信号半衰期
管理人将在未来几个季度发布语言特征的更新衰减率。投资者现在在尽职调查电话会议中询问这些指标。无法展示半衰期数据的基金将失去配置,转而流向披露更充分的同行。
下一个明确里程碑是第三季度文件的发布。该期结果将显示当前模型调整是否已在实盘组合中减缓衰减。


