作者:量化投资与机器学习
题图:量化投资与机器学习 微信公众号
在本专栏中,QIML会与那些具有海外背景,又深根国内量化事业的佼佼者面对面交谈,聚焦当下大家关注的前沿热门话题,给全网读者带来不一样的量化视角。
本期嘉宾介绍
本文受访者为一位有二十余年中美量化从业经历、物理背景出身、曾管理高频交易团队的资深从业者,应本人要求匿名。
一、AI进入量化:从工具到研究伙伴
如果要定义 AI 在量化工作中的角色,我会说它正在从“助手”变成“工程级协作者”——只是这个协作者需要一个很强的人来带。
最直观的体现是:过去从“我有个想法”到“我知道这个想法行不行”,中间那段又脏又慢的活——清数据、写回测、搭框架、跑归因、做可视化——现在很大一部分可以交给它,而且质量不差。它能写、能调、能把一个粗糙的思路落成可运行的实现。
但有一条界线一直很清楚:能交给它的,是执行;不能交给它的,是判断。具体说,数据处理、代码实现、把已经想清楚的东西做出来,可以放手;但“该验哪个假设”“这个漂亮的结果是真的还是运气”“这条路要不要走下去”,这些必须是人。AI 很擅长把事做出来,不擅长判断这件事该不该做、做出来的东西可不可信。所以我们团队里,人的角色在往上走——从“做研究”变成“决定研究什么、以及判断研究的结果能不能信”。
如果你问“是不是每家都已经把 AI 织进了整个研究流程”,答案是否定的——大量应用仍停留在局部提效,某个环节用一下,零敲碎打。真正把工作流围绕 AI 重新组织的,还是少数。
但如果你问“这是不是一场范式变化”,我认为是,而且已经越过了“要不要”的阶段。原因很简单:当验证一个想法的成本被压到接近零,你能做的事、你团队的组织方式,会被迫改变——这不是提速,是换了一种做事的方式。所以我的看法是:它现在还是加分项,但正在很快地变成必备项。一家完全不用它的机构,今天不会突然出问题,但会像一个还在用手抄账的账房,在一个已经用上计算器的行业里,一年一年地悄悄掉队。
二、AI正在如何改变量化工作流?
目前AI渗透最深的,是研究的“前半段”——从想法到验证。
数据清洗、特征构造、回测搭建、结果归因、快速原型,这些环节现在改变最彻底,也最成熟:它们本来就吃时间但不吃天才,正是 AI 的甜区。
短板在“后半段”——判断和承担。一个结果出来了,它到底能不能信、要不要真的拿钱去做、错了谁负责——这些 AI 帮不上,甚至越复杂的 AI 越容易在这里制造出“看着很有道理、其实是幻觉”的东西。
所以一个健康的分工是:让 AI 把研究的成本降下来,让人把研究的下限守住。你可以让它跑一百个想法,但那一百个里哪个是真的,以及把假的挡在实盘之外,这个闸门,必须是人。
我们内部有一句近乎铁律的话:AI 说它发现了规律,这句话本身信息量为零,真正的工作从这句话之后才开始。
模型很擅长在历史里找到“解释得通”的模式,但“解释得通”和“未来还成立”是两件事。所以我们不问它找到了什么,我们问三件事:
第一,它敢不敢被证伪。一个真正的规律,你能说清楚它在什么条件下会失效。如果一个信号怎么解释都对、涨也能圆跌也能圆,那它不是规律,是叙事。我们会专门派一组力量(现在越来越多是另一个 AI)去反向攻击这个发现,目标不是证明它对,是拼命证明它错;攻不破的,才留下。默认立场是“它是偶然”,举证责任在这个发现身上。
第二,它在样本外、在它没见过的市场环境里还成不成立。回测好是入场券,不是结论。我们更看重把时间切开、按市场状态(牛熊、高低波动、拥挤与否)分层去看它稳不稳,以及最坏的那几段路径长什么样——均值好没用,得看它在最差的环境里会不会把你打穿。
第三,也是最容易被 AI 结果误导的地方——多重比较。你让机器搜一万个组合,里面必然有几个纯靠运气“漂亮”的。人最容易犯的错,是看到那个漂亮的就兴奋,忘了它是从一万个里挑出来的。所以我们对“AI 挑出来的最优”天然警惕:它越漂亮,越要问它是从多大的搜索空间里幸存下来的。
一句话:我们不信 AI 的发现,我们信一套能让 AI 的发现活下来的、严苛到近乎刻薄的验伪流程。一个肯对自己说“这条我判不了”的团队,它说“这条能用”的时候,才可信。
三、AI是否正在成为下一代量化研究助手?
我可以给一个我亲身经历的观察:在我自己的实践里,一个人借助 AI,已经能推进过去需要一个中型团队才能完成的研究工作量。一个人同时带着几个 AI 助手,一个在跑数据、一个在写实现、一个在反向验证,人在中间做的,恰恰就是你说的那三件事——提对的问题、设计怎么验、判断结果能不能信。
我说这个不是想说个人有多强,恰恰相反,它说明产出的瓶颈正在从“你雇得起多少人”转移到别处。研究员的角色确实在从“执行大量任务”,变成“提出好问题、设计好实验、并且守住评估这道闸”。
障碍主要有两个。一个是判断力不像执行力那样能被 AI 放大——你能让 AI 替你跑一百个实验,但你没法让 AI 替你培养出“一眼看出这个漂亮结果是假的”的直觉,那个还得靠人长年累月养。另一个是人容易被淹没:当你能验一百个想法,怎么不在一百个验证结果里迷失、怎么还能保持判断的锋利,这本身成了新的挑战。工具解决了“做得快”,没解决“想得清”。
AI 最大的价值,恰恰不在那些光鲜的新东西上,而在那些行业忍了很多年的旧痛点上。两个例子:
一个是“人的带宽一直是研究的隐形天花板”。过去一个团队一年能认真验证的假设数量,被人的手速死死卡住——不是因为想法不够,是因为把每个想法验完的活太多太慢。AI 把这段压缩了。这带来的不是“研究变简单了”,而是你敢想的假设数量,从被手速限制,变成被判断力限制。这是很不一样的:以前是“我只能验这几个,选哪个”,现在是“我能验很多个,难的变成怎么问出好问题、怎么不被结果淹没”。
另一个更老的痛,是“知识留不住、复盘不闭环”。量化团队里,一个人踩过的坑、为什么放弃某条路,往往随他离开就带走了,下一个人换个马甲把同样的错再犯一遍。这行有句自嘲叫“每一代人重新发明一次同样的轮子”。AI 在这里的作用被低估——它能把这些散落的判断、这些“当时为什么否掉它”沉淀下来、随时可查。过去我们靠老人的记忆,现在开始能靠可追溯的账本。
所以是效率还是生产方式?我的答案是:当效率提升到某个量级,它就变成了生产方式的改变。当验证一个假设的成本降到接近零,你研究的方式、组织的方式、甚至你该雇什么样的人,都会跟着变——你不再需要一屋子人干又脏又慢的活,你需要少数几个会提问、会判断、能驾驭一群 AI 的人。
四、AI时代,量化公司的竞争优势是否会改变?
我给一个可能有点反直觉、但我亲身经历的观察:在我自己的实践里,一个人借助 AI,已经能完成过去需要一个二三十人团队才能推进的研究工作量。
我说这个不是想说个人有多强,而是想说明:产出的瓶颈,正在从“你雇得起多少人”转移到别的地方。过去大机构的护城河,很大一部分是“人多”——有人清数据、有人写回测、有人搭系统。这些活现在很多可以压给 AI,于是“人头规模”这道墙,第一次开始松动。
但我要非常诚实地补一句,免得话说得太满:AI 顶掉的,是那些又脏又慢、但不需要天才的活;它没顶掉的,是判断力。一个人能驾驭一群 AI 做二三十个人的事,前提是这个人得会提对的问题、会一眼看出哪个漂亮结果是假的、能对自己的东西保持足够的不信任。AI 把执行的成本降到接近零,于是判断力的价值被放大了,而不是被取代了。
所以壁垒在往哪走?
我认为在从规模,转向人机协作的效率、以及背后那个人的判断质量。这不意味着大机构会输——它们如果转得快,规模反而是放大器;但它确实意味着,一个想清楚了、又会用 AI 的小团队,第一次有机会在研究能力上,和一个反应慢的大机构正面掰手腕。至于完全不用 AI 的机构会怎样——它不会突然死掉,但会像一个还在用手抄账的账房,在一个已经用上计算器的行业里,一年一年地悄悄掉队。
AI 的持续发展,让那些可被清晰定义、可被重复的执行类工作逐渐减少:标准化的数据处理、常规的回测编写、模板化的实现。不是这些工作不重要,是它们越来越不需要占用一个人的全部时间。
而变得更重要的,是三样很难被自动化的东西:提问的能力(在无穷多可以做的事里,知道哪个值得做);判断的能力(在一堆看着都不错的结果里,知道哪个是真的);以及承担的能力(拿真金白银去下注、错了自己扛)。
所以未来最核心的竞争力,我认为不是“会用多少工具”,而是在一个执行几乎免费的世界里,你的判断有多值钱。当所有人都能让 AI 帮自己跑实验,区别就不在谁跑得多,而在谁问得准、谁看得真、谁扛得住。工具会拉平很多东西,但拉不平判断力——它反而把判断力的差距放大了。
五、AI量化的边界与风险
有一类反复让人失望的方向,是“模型越复杂越好”的执念——用越来越大、越来越黑箱的模型去拟合价格,期待复杂度本身能变出Alpha。实盘反复证明:在信噪比极低、且对手也在进化的市场里,复杂度带来的往往不是更强的预测,是更精致的过拟合。
最大的认知误区,我认为是把“预测得准”当成了终点。很多人默认只要预测更准,钱就来了。但从“预测”到“赚钱”中间隔着交易成本、容量、拥挤、执行、风险——一个预测得稍准、但便宜稳健的东西,常常打败一个预测得很准、却脆弱昂贵的东西。盲目追捧的,是模型的聪明;真正稀缺的,是整条链路的皮实。
很多人认为大模型能力提升,AI 量化能力会自然提升。但从实盘看:AI 量化真正的瓶颈,从来不是模型能力,是别的东西。
先说瓶颈
“大模型越强,AI 量化越强”是最大的误区。因为市场不是一个等你解题的静态题库,它是一个所有人同时在解、而且解法会反过来改变题目的对抗系统。你用更强的模型找到一个信号,别人用同样强的模型、同样的公开数据,大概率也能找到——然后这个信号就被交易没了。所以在同质的模型和数据上,更强的算力买不到更持久的Alpha,它只是让所有人更快地把彼此的边际收益卷平。瓶颈不在模型,在你有没有别人没有的东西:独特的数据、独特的视角、独特的执行,或者独特的、别人还没走过的验证纪律。
再说拥挤
这正是上面的直接后果。当越来越多机构用相似的模型和数据,策略拥挤不是“会不会”,是“正在发生”。它的危险在于:平时你看不见拥挤,大家都赚钱,岁月静好;直到某天市场一转,所有拿着相似仓位的人同时想出门,踩踏就发生了——你以为你分散了风险,其实你和一大群人下的是同一注。所以我们越来越在意“我这个信号有多少人也在用”,而不只是“它历史上赚多少”。
最后说过拟合,最老、也最致命,而 AI 让它更隐蔽
传统的过拟合你还看得见——参数太多、样本太少。但复杂 AI 模型的过拟合更狡猾:它能拟合出一条极其漂亮、极其“讲得通”的历史曲线,漂亮到让你舍不得怀疑它。传统验证体系够不够?我的回答是:方法论没过时,但纪律必须更狠。具体说:严格的、按市场状态聚类的样本外测试;对“从大搜索空间里幸存下来的最优结果”保持敌意;宁可要一个简单、你能讲清楚它为什么成立的模型,也不要一个复杂、只能靠“回测很好”来说服你的黑箱。
我常跟团队说一句:回测好是最不值钱的东西,因为它太容易被制造出来了。真正值钱的,是这个策略在你完全没优化过、它也无从作弊的那段时间和那种环境里,还站得住。判别一个 AI 量化团队成不成熟,不看它的模型多先进,看它对自己的结果有多不信任。
六、当下AI量化的落地启示与行业现状
目前,在各类团队在布局 AI、落地 AI 投研体系时,最容易被忽视的,不是模型,是数据和验证的地基。
很多团队一上来就追最新的模型,却在数据质量、口径一致、以及“回测和实盘是不是同一套逻辑”这些不性感的地方留着大窟窿。结果是模型越先进,越把地基里的脏东西放大——一条被污染的数据、一个回测和实盘不一致的口径,可以悄悄毒害几个月的信号,直到做归因时才暴露。
第二个隐形风险,是用 AI 的效率,喂养了人的懒惰。当验证变得太便宜,人容易滑向“多试试呗”的心态,少了过去那种“我必须先想清楚才敢动手”的敬畏。搜索空间一旦无限放大,而验证纪律没有同步收紧,你收获的不是更多Alpha,是更多披着漂亮回测外衣的假货。
如果传统量化团队转型 AI 量化,我会说:先改“从想法到验证”这一段,而不是先去追最炫的模型。
原因很实际。这一段是每个团队每天都在重复、又最吃时间的地方,把它的成本降下来,收益立竿见影、而且天天复利——你验证假设的速度可能翻好几倍,这个提升当天就能感觉到。相比之下,一上来就上复杂模型,风险高、周期长、还容易掉进过拟合的坑。
更深一层的原因是:先把执行的成本降下来,人才能腾出手去做那件真正稀缺的事——判断。你把研究员从又脏又慢的活里解放出来,他才有精力去提好问题、去守验证的闸。所以性价比最高的改造,表面上是提效,本质上是把人从执行推向判断——而判断,才是这个行业在 AI 时代真正的护城河。
免责声明:
您在阅读本内容或附件时,即表明您已事先接受以下“免责声明”之所载条款:
1、本文内容源于作者对于所获取数据的研究分析,本网站对这些信息的准确性和完整性不作任何保证,对由于该等问题产生的一切责任,本网站概不承担;阅读与私募基金相关内容前,请确认您符合私募基金合格投资者条件。
2、文件中所提供的信息尽可能保证可靠、准确和完整,但并不保证报告所述信息的准确性和完整性;亦不能作为投资决策的依据,不能作为道义的、责任的和法律的依据或者凭证。
3、对于本文以及文件中所提供信息所导致的任何直接的或者间接的投资盈亏后果不承担任何责任;本文以及文件发送对象仅限持有相关产品的客户使用,未经授权,请勿对该材料复制或传播。侵删!
4、所有阅读并从本文相关链接中下载文件的行为,均视为当事人无异议接受上述免责条款,并主动放弃所有与本文和文件中所有相关人员的一切追诉权。
