回测年化50%、夏普1.78满天飞:这周量化圈吵翻的"回测滤镜",Google拿9600个策略做了个狠实验

源自103位全网作者

04:08

如果你最近常刷量化内容,应该已经闻到味儿了:这一周(9月15日—21日),B站、知乎、小红书、微博上,几乎同时在吵同一件事——回测好看,实盘为什么亏钱

我随便截几个这周的真实标题,你感受一下浓度:

  • B站《回测过拟合:你的Sharpe可能都是假的》,9月20日发布,519播放、14收藏。哔哩哔哩

  • B站《回测年化50%上实盘就亏?量化过拟合一次讲透》《回测年化300%,为什么我反而不敢实盘?》,都发在9月21日。

  • 微博认证机构号"交易之家盘立方"发了篇《回测胜率60%,为什么实盘反而不赚钱?》,就发在9月21日。微博

  • 知乎也冒出新问题:《为什么量化策略回测表现好,实盘却可能亏损?》。知乎

  • 小红书上,《策略衰减|实盘跑不过回测的3个原因》《你的回测结论,可能只靠一只股票》《量化交流会:不要在回测里找安慰》清一色发布于9月21日当天。

我在B站按最新发布搜"量化回测",一页30条视频全部发布于这一周,其中直接讲"回测过拟合、回测与实盘落差"的有6条,剩下还有十几条在讲回测工具、因子回测和回测提速。一个常青话题在七天里被全网UP主集中开火,从来不是巧合——背后是AI把"生成一条回测漂亮的策略"的成本,打到近乎为零了。

一边是"回测神话",一边是"回测刺客"

同一周里还有另一批内容在反向狂奔。有人晒基于QMT的XGBoost机器学习回测,标题直接写"年化50%夏普1.78";也有人晒日内做T策略,号称"回测年化获取超额8%,胜率在80%以上",拿了836播放、52收藏。 更有意思的是一个叫Quant-AutoResearch的开源项目:让AI自主提假设、构造因子、改策略、跑回测、根据结果继续迭代,宽基实验在24个指数及ETF的候选池里20小时完成488次尝试,测试期最好策略累计收益172.52%、年化31.24%。 这篇笔记拿了241赞、409收藏,是近期量化垂类里最热的笔记之一。哔哩哔哩小红书

回测年化50%、夏普1.78满天飞:这周量化圈吵翻的

注意这个项目自己的口径:测试期2023年初至2026年9月11日、训练期完全不可见、统一按下一交易日收盘成交、买卖各收0.03%费用。工程上已经比绝大多数个人回测严谨了,但作者自己在笔记末尾还是补了一句:历史回测仍存在过拟合和事后选择风险,后续还需要新增数据与模拟交易验证。 这句话就是本周整个讨论簇的题眼。当AI让"提出一个策略"变得极度便宜,"验证一个策略"就成了整条链路里最贵、也最容易被跳过的一环。小红书

Google的狠实验:约9600个AI策略,最后只活2个

这周知乎上流传最广的一篇解读,讲的是一篇题为《Can AI Do Financial Research?》的论文,作者来自Google、Boston College、Columbia University,全文84页。 实验设计很简单:把大语言模型放进一个提前搭好的金融实验室,给它66个会计变量和32个运算符,让它在盈利、估值、投资等8个主题里自己提出选股假设、接受批评、看测试结果、继续修改,6轮运行一共评估了约9656个假设,平均每轮约1600个。知乎

结果有多惨?走完论文设计的"七道门",最后完全存活的只有2个。 这七道门值得每个自己跑回测的人看一遍,我把它翻译成大白话:知乎

  1. 多重检验校正:你一共试了多少次?论文用BY方法控制错误发现率——完全无效的策略如果被测1000次,按5%显著性标准也会随机蹦出几十个"看起来显著"的。这一刀下去,449个候选剩325个。

  2. 贝叶斯后验:不是问"假设信号无效,出现这个结果多罕见",而是反过来问"看到结果之后,信号仍然无效的概率是多少"。要求后验概率低于5%,对应|t|>2.943。

  3. 重算显著性门槛:普通t检验默认你没有从上千次尝试里挑最好看的那个——AI恰恰就是这么干的。论文用signed double bootstrap重新校准,这一批数据的门槛是|t|≥2.50,而且论文明确写了:换一批数据、假设数量或相关结构,这个门槛要重新算,不能直接套用。

  4. 拆时间窗:历史切成7个固定窗口,候选至少要在4个窗口里方向正确且显著。很多信号"全周期有效",主要贡献却来自几十年前某段行情;单看2011年以后的窗口,只剩115个显著。

  5. 查信号衰减:60个月滚动回归,t值随时间下降的直接淘汰。325个候选里201个稳定、6个增强、118个衰减——超过三分之一的"发现"正在过期。知乎

  6. 三套因子模型同时有Alpha:分别在Fama-French五因子、六因子、q-factor模型下都要保留显著Alpha。能赚钱可能只是因为长期偏向价值股、盈利股或动量股,换个名字并没有产生新信息。三套同时通过的只剩103个。

  7. 新颖性检验:和209个已发表预测因子比相关性,挑出最相近的10个一起回归,候选自身的条件t值仍需大于1.96。103个进去,11个出来——其中4个的共同样本只有24—28个月。

论文里还有一句写得非常直白的话,大意是:任何一道门没过,都不能用另一道门的强来补。而整篇论文真正想说的,不是"AI不行",恰恰相反——AI在量化上不是不够聪明,而是太"会考试"了。它把量化交易最难的那件事摊在桌面上:提出想法的成本趋近于零之后,稳健且真正新颖的信号依然极其稀缺。知乎

把七道门降维:个人建模者能直接用的五条自检

论文那套Fama-MacBeth、BY校正,个人玩家大概率用不上也不用硬上。但把它和这周社区里反复出现的翻车案例对着看,可以压缩成五条上手就能查的:

第一,数一数你一共试了多少次。这是最容易被忽略的一条。你在周末调了30组参数、试了20个因子组合,最后挑出来那个"最好的"——那个5%的显著性,是建立在50次尝试里的1次运气之上的。知乎上一条47赞的回答聊的也是这事:那位答主说自己操盘就看几个指标,50和200日均线、动量、成交量,顶多加个VWAP,简单策略在实践中反而经常跑赢复杂AI模型——因为复杂模型的搜索空间大得多,撞上运气的面积也大得多。知乎

第二,你的"样本外"可能根本不是样本外。小红书博主zengbin93这周把它讲得很透:样本内外切了,但"按外样本表现挑策略"这个动作本身,就是一次没有公开的回测——你的注意力反复扫过外样本,它就悄悄变成了半个样本内。 你最看好的那条曲线,大概率在分布的最右尾,上线后回归均值是统计期望,不是黑天鹅。小红书

第三,剔掉极端个股,看结论还在不在。小红书另一篇这周的笔记给了一个具体做法:把全市场按便宜程度分五组,最便宜组和最贵组的收益差就是因子成绩单——但这个差是两个平均数相减,一组里混进一只特别扎眼的,整组均值就被它抬上去了。原话是"把那只剔掉重算,同样的时间、同样的股票,差直接腰斩还多"。 你该看的不是那个数有多大,而是它有多稳。小红书

第四,检查成交价口径。B站有个做了137期的系列,这期专门讲"回测里的成交价,你真的拿得到吗":信号用什么价算出来,和你实际能在什么价上成交,是两件事;限价单有逆向选择,成交率越低,漏掉的越是涨得最好的那些日子;涨停封板对追涨策略的破坏力,得做"买不进就留现金"的口径修正。 配套的还有复权问题——有笔记专门提醒,很多人直接用行情软件导出的复权价回测,很大概率踩了复权的未来信息陷阱,收益可能是"骗"出来的。哔哩哔哩小红书

第五,问一句:空仓在你系统里是一个合法决策吗?知乎这周有个真实案例:一位博主把2026年6月1日到9月15日自己十几个策略挨个跑回测,全部为负,最差-9.00%,最好的也还有-0.80%。知乎

回测年化50%、夏普1.78满天飞:这周量化圈吵翻的

他没换策略,而是给系统加了一层仓位管理(指数强度分档+情绪温度),337天里有129天完全空仓,曲线反而走出来了。他的结论值得抄下来——亏损不是策略的问题,是仓位选择的问题,他从来没允许自己空仓。 很多人能回测策略,却没法回测"什么时候换策略、什么时候干脆不做",而这一步恰恰决定你能不能活过逆风期。知乎

回测年化50%、夏普1.78满天飞:这周量化圈吵翻的

"回测越靓丽越值得期待"是站不住脚的

最后说个反直觉的判断标准。策略衰减(实盘跑不过回测)几乎是必然发生的,社区归纳下来是三个机制在叠加:你挑出来的那个本身带赢家偏差;你的信息优势在被双向稀释——研报、因子库、人才流动让类似想法被独立重新发明,你自己的成交留在订单流里被对手盘画像;你一下场就在改变市场,做市商照着你的足迹调报价。小红书

回测年化50%、夏普1.78满天飞:这周量化圈吵翻的

衰减速度可以对照自查:短周期、日内、小容量高换手、只用公开K线财报、成交规律可见的,衰减快;中长周期、多因子复合、大容量低换手、用另类数据或自研事件库、低频拆单的,衰减慢。所以真正决定一个策略前景的,不是历史夏普多高,而是你所在的生态有多拥挤、对手盘有多容易复制你。小红书

不同人群,先查哪条

  • 纯指标党(通达信/MACD这类系统化复盘):先查第四条成交价口径和第一条参数尝试次数——有UP主直接把前视偏差、过拟合、幸存者偏差、偷价假设称作让策略"原形毕露"的四个美颜滤镜,你们是重灾区。哔哩哔哩

  • QMT/Python自研党:五条全查,重点放在第二条——你们最容易在"挑策略上线"这一步把样本外用掉。

  • 因子党:重点第三条和第五条,单因子别只看分组收益差,多因子组合记得给"换仓闸门"做回测。

  • AI党(用LLM生成或迭代策略的):直接把Google那七道门打印出来贴墙上。AI生成的每一条"显著",都默认按"考试型选手"处理,直到它在你没碰过的数据上活下来。

上实盘之前,至少把上面五条过一遍;上实盘之后,给自己设一个观察信号——记录策略实盘表现与回测的偏离速度,短周期策略如果3个月内就明显分道扬镳,先怀疑衰减而不是先加仓。以及老规矩:所有回测数据都只代表历史,本文提到的所有策略、项目和数字均为公开内容转述,不构成任何投资建议,股市有风险,入市需谨慎。

这周这个讨论簇能被集中引爆,本质上是因为工具的门槛先塌了:AI把生成策略的成本打到地板上,接下来筛掉九成九假信号的活儿,得你自己干。你手上的策略,实盘多久开始跟回测分道扬镳?评论区聊聊。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章