Two Sigma特征平台负责人:LLM如何重塑量化特征工程
Two Sigma 特征平台负责人访谈录
量化交易进入大语言模型时代,特征的创造、生命周期与组织方式正在被彻底重写。
近期,主持人 Corey Hoffstein 与 Two Sigma 特征平台总监 Ben Wellington 进行了一场深度对话。
Ben 的职业生涯几乎完美映射了量化文本分析的进化史:从自然语言处理(NLP)博士,到数据工程师,再到掌舵整个特征团队。他的一系列观点,尤其是 LLM 如何改变特征工程的底层逻辑,值得每一个从业者学习。
特征的定义
在 Ben 看来,给“特征”下定义不如给例子来得直接。特征是关于交易标的的、有经济意义的事实。 股票价格本身是原始数据,而“上周价格变动”、“分析师是否上调了评级”、“公司的新闻报道量相对历史的变化”——这些才是特征。更进一步的,源自人类对世界运行方式的理解:“新闻稿是在周五下班后发的吗?”这种基于先验假设提炼出来的变量,正是把人类直觉注入机器学习流水线的关键一步。
Ben 强调,直接让算法去啃原始数据不是不行,但通过特征这一层人为过滤,我们实际上是在对计算机说:“别什么都看,这些角度更可能有故事。” 这也是为什么 Two Sigma 将特征团队作为独立的核心部门。
多团队 vs. 共享平台
与常见的多团队独立竞争(Pod Shop)模式不同,Two Sigma 采用共享平台模型。所有团队的预测结果最终汇聚到中央组合层面进行全局优化。这意味着特征团队之间不存在零和博弈——一个团队发现的精巧特征,可以上传至共享平台,供其他团队使用;同样,一个团队研发的先进算法也会被打包成工具,赋能整个组织。
这种架构下的特征创新逻辑是 “全局最优” 而非“局部最优”。特征不再是某个小团队的秘密武器,而是不断迭代、反哺平台的公共资产。这种飞轮效应,使得平台本身的智能随参与者增多而指数级提升。
Alpha 的三层蛋糕
Corey 将量化投资的 alpha 来源分为三个“层”:
- 1. 数据获取:拿到别人没有的另类数据;
- 2. 特征生成:从同样的数据中提炼出别人没想到的观察角度;
- 3. 预测建模:在相同数据与特征上,用更牛的方法提取预测信息。
Ben 坦承,过去十五年,数据获取的独占性已被大大商品化。早期他们联系信息商要求“覆盖所有公司”时,对方甚至觉得不可思议。如今这样的数据壁垒正在消失。虽然 Two Sigma 也有历史积累和自营等专有数据,但“第一层”的相对权重已明显下降。
目前,权重最大的恰恰是第二层——特征生成。 Ben 很有信心地说:“我看到我们那些成功的预测模型,驱动力往往是那个创造性的‘啊哈,这个角度真妙’的时刻。”
他以分析师为例:除了常见的评级和目标价,还可以追踪分析师所在地、任职时长、是否与公司 CEO 同校……任何一个单点预测力微乎其微(R² 可能只有 0.001),但当成百上千个这样的精巧视角聚合在一起,就形成了强大且鲁棒的 alpha 来源。
第三层——前沿建模技术——同样重要,但真正爆发的点在于“特征专家”和“算法专家”的交集地带。
特征工厂的创意流水线
如何系统性地产生这些看似刁钻的特征?Ben 给出的路线图包含三个引擎:
- • 跨学科思维的碰撞:物理学家、数学家、计算机科学家面对同一组数据时,天然会提出不同的问题。
- • 现实事件的泛化:某地发生火车脱轨,相关股票下跌。你能不能把这个孤例抽象成一个可回溯检验的通用特征?
- • 学术文献的灵感:有一篇论文甚至通过分析分析师在社交平台上的帖子,推断他们是否有孩子,并以此作为预测能力的指标。(Ben 幽默地拒绝透露方向:“因为我也有孩子。”)
但仅有想法不够,流程必须是强假设驱动的科学方法。一个特征被提出时,必须带有明确的先验(比如“火车脱轨对公司价值是负面影响”)。如果回测结果与先验符号相反,不可以做事后合理化。这种“先验检验”充当了过滤噪音和幻觉的守门人。
特征的正交性
在一个持续产生海量特征的系统里,高相关性是死敌。Ben 形容,alpha 研究员每天早上醒来,任务就是寻找与现有信号库正交的新预测。新手最容易掉入的陷阱是:自认为发现了一个基于新闻情绪的新模型,结果剥开一看,它只不过是在追赶财报发布后的价格漂移——本质上是个被污染了的动量信号。
因此,Two Sigma 对新特征的准入设有严格的正交性阈值。与其把一堆高度相关的特征扔进组合,不如从一开始就追求每一个新变量都能带来增量信息。这种对低相关性的极致追求,是组合层面分散风险、提升稳健性的基石。
时间的维度
构建特征时必须内置对预测周期的假设。通过卫星图像监测零售店停车场流量,这个信号绝不可能在几秒内被市场吸收;它需要等待数周甚至数月,直到同店销售数据发布。特征的“慢”与“快”,决定了它应该在多长的时间尺度上被用来做预测。
更有趣的是特征的生命周期。当一个另类数据源刚开始被市场关注时,其预测周期可能很长;随着越来越多的量化基金开始使用同一数据,信号会加速衰减,周期缩短,直到完全失效。Ben 形容这个过程就是特征的生老病死。模型构建者要做的,是让特征“生”得足够独特,延缓它被市场“咀嚼”的速度;而组合管理团队则持续监测 alpha 衰减,动态调整权重。
任何东西都可以是语言
这场对话最核心的转折点在于 Ben 的一个深刻洞察:“NLP 曾是把语言变成数字;而 LLM 让我可以把数字变成语言。现在,任何东西都可以是语言。”
对 Two Sigma 这种深耕文本数据十五年的机构来说,可收集的人类文本终究有限。LLM 的革命性在于它能够生成文本数据。你上传一张 Excel 表格,它给你一段分析;你输入一段财报电话会议录音,它输出对管理层语气的描述。每一种输出,都是一个全新的、可供下游模型消费的文本数据集。这相当于一家炼油厂在石油枯竭前,突然发现了一种将万物转化为石油的技术。
一个鲜活的例子是“CEO 眨眼频率”的假设。几年前,要验证管理层的非语言行为是否预测股价,你需要组建计算机视觉团队,下载海量视频,耗时数月。极高的工程成本扼杀了探索的可能。而今天,借助多模态 LLM 的强大能力,同样的研究可以在几天内完成原型验证。探索成本断崖式下跌,直接解放了研究人员的想象力。
当AI降低特征的“熵”
自动化会带来一个隐秘的风险——输出熵值的降低。如果你给所有人一个“一键生成模型”的按钮,大家指向同一数据源,最终得到的将是趋同的预测。而投资组合的生命线恰恰在于多样性,在于不同观点之间的低相关性。
Ben 将 Two Sigma 的 AI 战略定义为 “人类独创性的放大器” ,而非替代品。工具必须具备足够的上下文感知能力,让物理学家和计算机科学家使用同一套 AI 工具分析同一份数据时,能得出各自不同但同样有效的结论。如果最终所有人殊途同归,那才是 AI 在量化投资中最可怕的副作用。
现在,还是等18个月
面对 LLM 能力指数级的跃迁,许多研究者会犹豫:一个今天勉强能实现的想法,十二个月后可能变得轻而易举,那还要不要现在做?
Ben 的答案是:必须做。主动去撞墙,才能知道墙在哪里。 只有你反复被某个技术瓶颈卡住六个月,当新工具出现时,你才能瞬间将它嵌入已有的思维框架,获得爆发式的加速。另外,在 alpha 军备竞赛中,十二到十八个月的先发优势可能意味着天壤之别。如果你确信自己看到了别人尚未涉足的领域,等待就等于把护城河拱手让人。
基础架构的博弈
关于用外部模型还是自建模型,Ben 认为最关键的权衡不是成本,而是对模型自主可控和偷看答案的规避。
- • 自主可控:如果你基于 Anthropic 的某个模型精调了一套特征生成流水线,六个月后该模型被停用,你将被迫仓促迁移。但自建模型则可提供稳定性。
- • 偷看答案:LLM 在训练时可能“知道”安然公司的丑闻。当你让它分析 2000 年的安然财报语气时,它潜意识里的负面关联会污染你的回溯测试结果。不了解模型的训练数据边界,就可能被自己生成的特征愚弄。
但完全忽视前沿实验室的进步同样不明智。Two Sigma 的解法是架构上的分散化:构建一个能够灵活插拔、可以随时在外部前沿模型和内部可控模型之间切换的栈,不在任何单一路径上下赌注。
过拟合的魔鬼
更快更低廉的特征生产,自然会加剧 p-hacking 和 过拟合 的焦虑。Ben 对此坦诚道:“我们必须承认,一切预测都过拟合,因为未来从来不是过去的简单重复。” 关键不在于完全消除过拟合,而在于:
- 1. 让它可度量:通过严谨的统计检验框架,量化过拟合的程度;
- 2. 让它可控:确保在扣除过拟合带来的衰减后,信号在实盘中依然具有经济价值;
- 3. 研究者的自我修养:如果你的模型过拟合到未来无法交易,职业生涯自然会终结。这本身就是一种达尔文式的筛选。
AI 确实让“一个人等于一支实验大军”成为可能,放大风险。但 Two Sigma 凭借长期积累的最佳实践、教育体系和稳健性检测工具,认为他们有能力驾驭这种规模化的探索。
是否需要精益求精
当一个数据供应商发布新版数据集时,很多团队的想法是:重训模型,力求更好。Ben 提醒我们,这种“博士论文思维”——在一个点上死磕到极致——往往在工业界并不划算。把单一模型的预测能力从 90 分打磨到 95 分所耗费的精力,可能足够你从零开始,再做出 10 个 85 分且相互正交的模型。
知道何时说“够了”并交付,或者果断放弃一个方向,是顶级量化研究员的分水岭。 对特征工程师而言,时间的机会成本至关重要。追求组合层面的多样性,往往比执着于单个特征的极致深度更能带来稳健的 alpha 流。
AI 让“定制”走向工业化
主观投资经理的优势在于对少数公司的深度、定制化理解。传统量化手段很难捕捉这种“特异性”,因为样本量太小,无法形成统计规律。
Ben 提出的 “特异性规模化” 概念,正是 AI 带来的范式突破。借助 AI,你可以先针对一家公司的独特业务模式构建一套极其个性化的分析逻辑(比如某 SaaS 公司的续约率与特定关键词搜索量的关系),然后将这套推理范式泛化,自动应用到其他 3000 家完全不同的公司身上。这使得量化模型第一次有可能在保持广覆盖的同时,深入到主观分析师才能触及的微观层面,实现真正的“千人千面”。
下一代特征工程师
对于那些刚踏入这个领域的年轻从业者,Ben 的建议是:单纯将想法落地为代码的技术能力,其相对价值正在急剧下降。 因为 AI 正逐渐接管这一部分。真正会随着时间复利增值的技能是:
- • 与 AI 协作的熟练度:将大语言模型作为扩音器,放大你自己的独特视角和学科背景;
- • 提问的能力:未来是自然语言交互的时代,谁能提出最精准、最具创造性的问题,谁就掌握了生产力的源头;
- • 跨领域迁移的创造力:能够将物理学的思维模式或社会学的方法论迁移到金融数据上,并指导 AI 去执行。
未来属于那些能利用 AI 将自己的“独特性”规模化的人,而不是那些只懂得被动接受任务的执行者。
结语
对于每一位量化特征工程师来说,在这个工具日新月异的时代,唯一不会贬值的资产,是你对世界运作方式永不枯竭的好奇心,以及将这份好奇转化为可量化假设的思维方式。 其余的事情,交给 AI 去放大就好。
点击关注,共同进步
引用链接
[1] https://www.flirtingwithmodels.com/episodes/mDCRKBfrVHQ
量化交易进入大语言模型时代,特征的创造、生命周期与组织方式正在被彻底重写。
查看原文 →
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力