当算法交易员们还在为过去几年里通过强化学习模型斩获的超额收益而沾沾自喜时,一场无声的“回撤风暴”正在席卷华尔街和上海陆家嘴的量化交易室。近期,多家顶尖量化对冲基金和自营交易团队接连披露,其基于深度强化学习(DRL)的股票交易模型出现了前所未有的预测失灵与净值回撤,部分产品的最大回撤幅度已超过20%,引发业界对“AI炒股”可靠性的深度反思。

模型“幻觉”频发,经典策略集体失效

强化学习(RL)的核心逻辑在于让智能体(Agent)在动态环境中通过试错学习最优策略——这在棋类游戏和机器人控制领域取得了巨大成功。但在股票市场,这个被学者称为“部分可观测、非平稳、多智能体博弈”的复杂系统中,RL模型正暴露出致命短板。

“春节前后,我们部署在主交易系统上的一个自研RL模型开始频繁出现异常信号。”上海某百亿级量化私募的技术总监李明(化名)向记者透露,“它在模拟回测中表现完美,年化收益率超过40%,但实盘交易却连续买入高波动小盘股,并在市场风格切换的瞬间反向加仓,单周亏损超过8%。”

这并非孤例。据记者多方了解,多家采用“深度Q网络”(DQN)或“近端策略优化”(PPO)框架的团队,近期均遭遇了相似问题:模型在训练集上的表现优异,但在无法预见的市场冲击面前显得异常脆弱。例如,面对政策突发利好或财报数据超预期,RL智能体往往无法像人类交易员那样快速调整逻辑,而是机械地沿用过去几个月积累的“旧经验”,导致踩踏式亏损。

原因剖析:环境非平稳性成算法“天敌”

伦敦帝国理工学院计算金融学教授阿德里安·怀特(Adrian White)在接受记者视频采访时指出:“股票市场是典型的非平稳环境,而强化学习假设环境是平稳的或者变化是缓慢的。当市场结构(如波动率、关联性、趋势持续性)发生突变时,RL模型的策略参数会瞬间变得毫无意义。”

更致命的是,许多交易团队在训练RL模型时,未能有效处理“分布外”数据。市场在2023年至2024年初经历了低波动、高流动性的“牛市”阶段,模型学习到的交易策略高度依赖“追涨杀跌”的动量效应。然而进入2025年,地缘政治风险加剧、全球流动性收紧,市场转为高波动、高换手格局,旧策略彻底失效。

此外,过度依赖历史数据强化训练也带来了过拟合问题。国内某量化研究机构的联合创始人张浩指出:“很多团队用过去五年甚至十年的数据训练模型,但股市的结构性变化(如注册制改革、量化交易占比提高)使得历史数据的代表性大打折扣。模型只是记住了过去的‘答案’,而非真正理解了市场。”

行业震荡:从“信仰投资”到回归基本面

模型失灵引发的连锁反应已开始蔓延。据知情人士透露,已有数家中小型量化私募暂停了RL策略的实盘运行,并紧急启动了人工干预机制。某外资对冲基金的亚太区量化主管更是直言:“我们正在重新评估所有基于RL的阿尔法因子,未来可能会大幅削减其组合权重。”

更深远的影响在于,整个量化行业对于“AI替代人类”的叙事开始降温。过去两年,大量资金涌入号称“全时段、全市场”的强化学习策略基金,投资者将其视为“印钞机”。如今,连续的亏损让渠道和客户开始追问:算法的“黑箱”里到底发生了什么?

“这其实是一次必要的‘排毒。’”资深市场人士吴铭(化名)评论道,“很多人把RL神化了。它本质上是一个优化工具,而不是市场预言家。当一个模型在回测中表现出过于完美的光滑曲线时,恰恰应该警惕。”

展望:技术迭代与监管侧敲警钟

面对困境,技术圈并未坐以待毙。一些前沿团队开始尝试将“逆强化学习”与“元学习”结合,让模型具备快速适应新环境的能力。同时,“行为克隆”和“模仿学习”技术也被引入,通过引入人类交易员的专家交易记录来约束RL模型的“野性”。

监管层面也有新动向。国际证监会组织(IOSCO)在一份最新报告中指出,对使用强化学习等高级算法的自动交易系统,应进行更严格的反向压力测试,并在模型部署前提交“可解释性评估报告”。这意味着,未来RL模型必须能向监管者和投资者“说清楚”自己为何要买入或卖出,而不仅仅是交出业绩曲线。

“这次麻烦暴露了AI金融应用的脆弱性,但未必是坏事。”李明在采访最后总结道,“它让所有人明白:股票市场终究是人的市场,算法可以辅助,但不能替代敬畏之心。”