一句话摘要
解析量化研究的完整流程
没人解释的量化研究流水线
2026 年 7 月 19 日 · 15 分钟阅读 · 查看原文 ↗ 量化 金融 自动化 AI
从原始市场数据到可交易的 alpha。每一个真实优势背后的完整流程。
大多数人以为量化研究始于一个策略想法。
它通常开始得早得多。
在模型之前。在回测之前。在信号之前。
一条真正的量化研究流水线,始于一个关于市场、并且经得住数据碰撞的问题。
为什么这个价格波动会存在?
是谁在制造它?
它会持续多久?
能不能在所有人都测量它之前,先把它测出来?
扣除成本之后,它还能交易吗?
这才是几乎没人解释的部分。
人们看到的是最终策略。
他们看到 Sharpe ratio。
他们看到机器学习模型。
他们看到执行系统。
他们看不到的是支撑这一切的漫长流水线。
原始数据从一端进入。
一小片可交易信息从另一端出来。
中间的几乎一切都会被淘汰。
这套淘汰流程,就是量化研究。
Alpha 不始于模型
在量化交易中浪费六个月最容易的办法,就是从算法开始。
打开 XGBoost。
搭一个神经网络。
喂给它十年的价格数据。
让它预测明天。
这感觉像研究,因为代码很难。
但困难不等于优势。
最强的量化研究,通常始于一个有关市场实际如何运作的假设。
也许大型机构订单制造了暂时性的价格压力。
也许投资者对某些信息反应缓慢。
也许两种相关资产偶尔会因为其中一个的流动性消失而分叉。
也许当波动率变化时,期权做市商被迫以可预测的方式对冲。
也许一次指数再平衡制造了与基本面无关的机械性需求。
第一个问题不是:
我该用哪个模型?
而是:
什么机制可能创造一种可重复的无效定价?
这个区别会改变整条流水线。
如果从模型开始,你会在数据中寻找任何它能预测的东西。
如果从市场机制开始,你会寻找该机制是否留下可测量足迹的证据。
一种方法制造模式。
另一种方法才有机会制造 alpha。
模型在后面。
很后面。
阶段一:把市场变成数据
市场不会以干净表格的形式来到你面前。
它以成交的形式到来。
报价。
订单簿更新。
公司行动。
经济数据发布。
新闻。
期权链。
资金费率。
清算。
ETF 资金流。
财报电话会文字稿。
另类数据集。
数百万个发生在不同时间轴上的事件。
量化研究的第一个真实问题,是判断市场在某一个具体时刻究竟是什么样子。
这听起来很简单,直到你真的去构建它。
价格需要正确调整。
退市证券必须保留在历史数据集中。
时间戳必须对齐。
缺失值需要被理解,而不是盲目填充。
一项宏观经济数据必须反映它最初发布时交易者知道的数字,而不是今天能看到的修订后数字。
一份财报应该在它公开的时刻出现在数据集中,而不是在那个季度结束的时刻。
在高频环境下,连毫秒都重要。
一条在成交之后才收到的报价,不能拿来解释它之前的成交。
所以机构量化公司会在数据基础设施上投入巨大精力。
一个在污染数据上训练的复杂模型,依然是一个被污染的模型。
垃圾不会因为经过了神经网络就变成 alpha。
第一份优势,往往只是知道究竟发生了什么。
阶段二:创建研究范围
在测试信号之前,量化研究者需要决定这个信号被允许存在在哪里。
这就是研究范围。
也许是美国最大的 500 只股票。
也许是每一份流动性充足的期货合约。
也许是日成交量超过某个最低值的加密永续合约。
也许是未平仓量足够的股票期权。
这个决定看起来很无聊。
其实不然。
改变研究范围,就可能彻底改变结果。
假设你只用今天仍存在的公司测试一套股票策略。
破产公司消失了。
退市公司消失了。
倒闭的企业消失了。
你不小心创造了一个失败者会从历史中被删除的市场。
回测变好了。
现实没有。
流动性还会制造另一个问题。
一个信号可能在数千只微型股票上看起来惊人。
但如果你的策略需要买入价值 $5 million、而每天只成交 $200,000 的某样东西,那这个信号在你的规模上并不存在。
所以研究范围不只是:
这个想法在哪里有效?
而是:
这个想法在哪里真的能被交易?
量化研究从这里开始区分数学上的可能性和金融上的现实。
阶段三:把观测变成特征
原始价格很少是最终输入。
研究者把市场行为转化成模型可以理解的变量。
收益率。
波动率。
成交量失衡。
动量。
与移动平均线的距离。
相对估值。
收益率曲线变化。
期权偏度。
资金费率。
订单流。
情绪。
横截面排名。
残差收益。
这些就是特征。
但金融领域的特征工程与普通机器学习不同。
普通 ML 问题往往假设输入与输出之间的关系相对稳定。
金融不会给你这种奢侈。
一个特征可能有效五年,然后消失。
它可能反转。
可能变得拥挤。
可能只在高波动期间有效。
可能只存在于小盘股。
可能在交易成本上升的瞬间消失。
这意味着每个特征都需要上下文。
以动量为例。
"价格涨了"还不够。
多长的时间范围?
相对于什么?
市场?
板块?
它自己的历史波动率?
这次移动是由一次大跳跃推动,还是由二十个渐进的交易日推动?
成交量确认了吗?
这个资产是独立移动,还是仅仅跟随整个市场?
同一段原始价格序列,会根据你如何提出问题而生成几十种不同信号。
所以好的量化研究往往不是寻找更多数据,而是正确表示同一批数据。
信息早已在那里。
特征让它可见。
阶段四:移除你不想交易的东西
量化研究中最强大的思想之一,是分解。
一只股票涨了 3%。
散户看到一只涨了 3% 的股票。
量化研究者会问,这 3% 是从哪里来的。
也许整个市场涨了 2%。
也许科技板块又贡献了 0.5%。
也许动量因子解释了另外 20 个基点。
也许这只股票对利率的敏感度又解释了一些。
全部移除之后,可能只剩 30 个基点无法解释。
这个残差可能比原来的 3% 波动更有意思。
因为量化研究者可能不想交易市场。
也不想交易科技。
也不想交易利率。
他想交易的是移除这些敞口之后留下的具体异常波动。
这就是因子模型和多种统计套利背后的逻辑。
从观测到的收益开始。
移除共同成分。
研究剩余部分。
有时残差里什么都没有。
有时里面有暂时性压力。
有时它会识别出一个相对于所有通常能解释它的因素而言,已经走得太远的资产。
目标不总是预测完整价格。
往往是隔离出价格中可能具有可预测性的那一小部分。
这是一个容易得多的问题。
阶段五:把特征变成信号
特征描述市场。
信号告诉系统该做什么。
两者不是一回事。
假设你的研究显示,异常负的残差收益往往会在随后两天反转。
你仍然没有一套策略。
你需要规则。
负到什么程度才算异常?
每个事件都交易吗?
只交易最极端的?
你要给整个范围排名,买入残差最低的资产吗?
要做空残差最高的吗?
持有一天?
两天?
五天?
要按波动率缩放仓位吗?
要中和市场敞口吗?
板块敞口?
Beta?
现在研究变成了投资组合构建。
很多有希望的想法都消失在这里。
一个信号可以在统计上具有预测性,却依然构成一个糟糕透顶的投资组合。
也许你的所有多头仓位都是科技股。
也许你号称市场中性的策略,暗中带着巨大的 Beta。
也许十个不同信号,实际上只是同一笔动量交易换了十个名字。
也许你最强的仓位都出现在流动性最差的资产里。
信号并不独立存在。
它活在一个投资组合里。
而真正赚钱或亏钱的是投资组合。
阶段六:追问信号是否真实
量化研究从这里开始变得充满敌意。
好的研究者不是试图证明信号有效。
研究者试图摧毁它。
换一个时期。
还能活吗?
换一个研究范围。
还能活吗?
把信号后移一天。
还能活吗?
使用略微不同的参数。
还能活吗?
移除表现最好的一年。
还能活吗?
提高交易成本。
还能活吗?
测试另一个市场。
还能活吗?
薄弱的研究流程问:
Sharpe ratio 有多高?
强大的研究流程问:
要让 Sharpe ratio 消失,到底有多难?
这就是稳健性。
一个只在 37 天回看期有效、换成 35 或 40 天就死掉的信号,很可疑。
一个在 30、40、50 和 60 天都有效、只是强度不同的信号,更有意思。
目标不是找到完美参数。
完美参数通常属于过去。
目标是识别出一个经济效应持续出现的区域。
真实 alpha 应该能弯曲。
它不该一碰就断。
阶段七:把发现与验证分开
这是整条流水线里最重要的部分之一。
发现策略的同一个流程,不应被信任去验证它。
为什么?
因为研究会制造依恋。
你在这个信号上花了三周。
你理解其理论。
你写了代码。
你看到了漂亮的回测。
你想让它有效。
这让你变得危险。
量化公司通过把创造与验证分开来解决这个问题。
研究者产出想法。
另一个流程攻击它。
检查数据。
检查假设。
检查统计。
检查敞口。
检查泄漏。
检查结果能否在样本外存活。
制造者问:
这可能是 alpha 吗?
检查者问:
它在怎么骗我们?
两者缺一不可。
当自动化进入流水线时,这一点变得更加重要。
一个系统可以生成数百个研究假设。
另一个流程可以写代码。
再一个流程可以优化参数。
发现速度变得几乎没有上限。
但更快发现也意味着更快制造假阳性。
如果你能多测试一千倍的策略,你的验证系统就需要怀疑一千倍。
自动化不会移除科学方法。
它让科学方法变得更重要。
阶段八:模拟交易,而不是模拟信号
这是学术 alpha 遇到真实市场的地方。
你的信号说买入。
以什么价格?
这个问题可以杀死整套策略。
回测假设你在收盘价成交。
你真的能在收盘价成交吗?
信号使用的信息是在收盘竞价前到达的吗?
有多少成交量可用?
你的订单会推动市场吗?
你会吃掉点差吗?
成交会立即发生吗?
信号会在订单执行期间衰减吗?
执行不是研究结束后补上的一个小调整。
对许多策略来说,执行就是研究的一部分。
假设一个信号预测 10 个基点的收益。
如果交易成本为 8 个基点,你有的是一套弱策略。
如果交易成本是 12 个基点,你根本没有策略。
在高频环境中,原始 alpha 可能几乎不可见。
几个基点。
有时更少。
整个业务取决于在不摧毁这份优势的前提下把它提取出来。
所以两家公司可以发现同一个信号,却产出完全不同的回报。
一家执行更好。
信号是公开的。
实现才是护城河。
阶段九:确定优势规模
即使找到了真正的信号,仍然还有一个问题。
应该下注多少?
预测从这里变成风险。
一个信号可以盈利,却依然会因为规模错误而摧毁投资组合。
预期回报很重要。
但波动率也重要。
相关性。
回撤。
尾部风险。
流动性。
容量。
一套预期回报高、但极端下行风险也高的策略,可能只配拿到比一套更弱却更稳定的策略更少的资本。
多个信号也会互相作用。
五个独立优势可以构成一个强投资组合。
五个高度相关的优势,可以构成一个隐藏的巨额下注。
仓位规模把研究变成一个资本配置问题。
问题不再是:
这笔交易好吗?
它变成:
相对于我们拥有的每一个其他优势,这个优势应该获得多少资本?
这是完全不同层级的思考。
策略不是在和现金竞争。
它在和资本的每一种其他可能用途竞争。
阶段十:生产环境是另一场研究实验
最大的错误,是以为策略上线时流水线就结束了。
那才是最有价值的数据集开始出现的时候。
真实业绩。
现在你可以把真实策略与模拟策略进行比较。
预期滑点与实际滑点。
预期成交与实际成交。
预期换手与实际换手。
预期 alpha 衰减与实际衰减。
模拟与生产之间的差异包含信息。
也许信号是对的,但执行很差。
也许市场冲击被低估了。
也许策略在一天中的某些时间表现不同。
也许某个场所持续给出更差成交。
也许 alpha 消失得比预期快。
也许回测假设了实际上从未存在的流动性。
生产环境生成反馈。
反馈回到研究。
流水线变成循环。
数据。
假设。
特征。
信号。
验证。
投资组合。
执行。
监控。
反馈。
然后回到数据。
量化系统不是一堆策略的集合。
它是一台持续检验现实的机器。
大多数研究想法都应该死掉
这是没人喜欢谈的部分。
一条健康的量化研究流水线会摧毁大多数想法。
你可能从一百个假设开始。
五十个没有统计关系。
二十个只在某一段历史时期有效。
十个在修复数据泄漏之后消失。
八个死于交易成本。
五个在样本外崩塌。
四个与组合中已有策略的相关性太高。
两个容量不足。
一个存活。
那一个甚至可能并不惊艳。
也许 Sharpe ratio 只有 1.1。
也许优势只有几个基点。
也许它只在市场一个很小的角落里有效。
没关系。
流水线的目的从来不是让每个想法都有效。
目的是阻止坏想法接触资本。
一家研究者很优秀、但淘汰流程很差的量化公司,依然可能亏钱。
一家有强研究流水线的公司,能从数千次失败实验中活下来。
失败变得便宜。
这就是优势。
真正的护城河是流水线
人们执迷于秘密算法。
隐藏指标。
魔法模型。
那个能预测市场的系统。
这通常是看错了地方。
单个信号会衰减。
策略会变得拥挤。
数据会被竞争对手获得。
模型会被开源。
真正存活的是围绕它们的系统。
你能多快测试一个新假设?
你的数据有多干净?
你能多激进地淘汰错误发现?
你能多准确地模拟执行?
你能多快发现信号衰减?
你能多安全地部署新策略?
失败研究留下的知识,有多少被保存下来?
这才是真正的复利机制。
一个策略可以死掉。
流水线会产出另一个。
一个数据源会失去价值。
流水线会评估一个新的。
一个市场会变得竞争过于激烈。
研究会转移到别处。
永久优势并不总是 alpha 本身。
永久优势是持续寻找、测试、部署和杀死 alpha,比其他人都更快的能力。
量化研究实际是什么样
它远没有人们想象的那么光鲜。
大多数日子不是在发现十亿美元策略中度过。
而是在清洗数据。
调试时间戳。
质疑可疑结果。
寻找隐藏敞口。
看着有希望的想法在扣除成本后消失。
淘汰模型。
重建测试。
把真实业绩与模拟进行比较。
最终策略可能看起来很简单。
让你能够信任它的流程并不简单。
这才是外人永远看不到的部分。
他们看到一个方程。
一个模型。
一个交易机器人。
它下面是一整套研究架构,围绕着一个原则而构建:
不要让随机性接触资本。
最后的重新理解
量化研究不是寻找预测。
它是一套过滤系统。
市场产生几乎无限的噪声。
流水线一点点移除它。
先移除坏数据。
再移除无意义模式。
再移除共同风险。
再移除不稳定信号。
再移除统计意外。
再移除无法承受成本的策略。
再移除无法扩大规模的策略。
再移除在生产环境中失败的策略。
留下的通常很小。
几个基点。
一种微弱的统计倾向。
一个暂时性的无效定价。
一些大多数人会忽略的东西。
但如果它是真的。
如果它经得住验证。
如果它经得住执行。
如果它能被安全地确定规模。
如果它可以重复。
那么这一小片东西就会成为 alpha。
模型从来不是整场游戏。
回测从来不是整场游戏。
信号从来不是整场游戏。
流水线才是游戏。
因为最好的量化公司,并不是更擅长一次性预测未来。
它们更擅长构建持续把真实与"看起来真实"分开的系统。
而在一个几乎完全由噪声构成的市场中,这或许是最有价值的优势。
如果你读到了这里:
收藏本文。
**关注 @0xTatara**
标签:# X # Quant # Finance # Automation # AI
相关文章 The 12 People Who Actually Built Quantitative Finance. Steal Their Fundamental Knowledge for $0
教训:房间里头脑的质量,比任何文凭都重要。Medallion 团队可能是地球上任何一家金融公司里最聪明的一群人。不是开玩笑。Finance Quant Automation AI
原文参考:https://maxed.wiki/posts/the-quant-research-pipeline-nobody-explains/ (Maxed.wiki,本页为站内中文整理)