凌晨两点,城中村的出租屋里只有键盘敲击声和机箱风扇的低鸣。
林晨盯着屏幕上那行刺眼的亏损数据,已经整整复盘了三个小时。6.1万——这是他优化模型后投入实盘的剩余资金。一周时间,从7万到6.1万,12%的跌幅像一记闷棍敲在头上。
但奇怪的是,此刻他心里没有恐慌,反而异常冷静。
“代码可以骗人,但逻辑不会”。他低声重复着自己的口头禅,鼠标在历史K线图上缓缓移动。
问题就出在验证环节。
之前的模型在回测中表现完美,是因为他用了全部历史数据来训练,又用同样的数据来验证——这就像让学生既用课本复习,又用同一本课本考试,考满分不代表真会了。一旦遇到没见过的题目(新的市场行情),立刻露馅。
这就是机器学习里臭名昭着的“过拟合”。
林晨关掉交易软件,打开pycharm。屏幕上是他过去一个月写的量化系统代码,三千多行,像他亲手搭建的积木城堡。现在,他得拆掉一部分,重新设计地基。
“训练集、验证集、测试集…”他念叨着这三个机器学习最基本的概念,在草稿纸上画图。
传统的做法是把数据随机分成三块:70%训练,15%验证,15%测试。但金融数据有个致命特点——时间序列依赖。今天的股价受昨天影响,不能像图片分类那样随机打乱顺序。
“得用时间序列分割”。林晨在搜索引擎里输入这几个字。
凌晨三点,他找到了解决方案:滚动窗口交叉验证。
原理很简单——假设你有2010年到2023年的数据,先用2010-2015年训练,用2016年验证;然后用2010-2016年训练,用2017年验证…以此类推,像一扇窗户在时间轴上滚动。这样既尊重了时间顺序,又能充分验证模型在不同时期的泛化能力。
理论懂了,实现起来又是一堆坑。
林晨的代码原本是直接用train_test_split函数随机分割,现在要重写数据加载模块。他泡了杯浓茶,开始敲代码。
def time_series_cv_split(data, train_years=5, val_years=1):
时间序列滚动窗口分割
data: 按时间排序的dataFrame
返回: [(train_idx, val_idx)] 列表
splits = []
start_idx = 0
while start_idx + train_years + val_years <= len(data):
train_end = start_idx + train_years
val_end = train_end + val_years
train_indices = list(range(start_idx, train_end))
val_indices = list(range(train_end, val_end))
splits.append((train_indices, val_indices))
start_idx += 1 # 每次滚动一个时间单位
return splits
写完后,他跑了一遍测试。用A股沪深300指数2010年到2023年的日线数据,设置5年训练1年验证,程序生成了8组不同的训练-验证组合。
“这样应该够了”。林晨揉了揉发酸的眼睛。
但验证集只是第一步。真正的考验在样本外测试——用模型完全没见过的、最新的数据进行最终评估。
林晨做了个决定:把2023年全年数据留出来,作为最终的测试集。用2010-2022年的数据做滚动交叉验证,选出在多个验证期表现最稳定的模型参数,最后再用2023年的数据看真实效果。
这个流程,专业量化机构叫“walk-Forward Analysis”(向前步进分析),是避免过拟合的黄金标准。
凌晨四点,程序开始运行。
屏幕上的进度条缓慢移动,每一次滚动窗口分割,模型都要重新训练一次。8组验证,意味着要训练8次模型。林晨那台三年前的游戏本风扇狂转,cpU温度飙升到85度。
他起身走到窗边。城中村的凌晨很安静,远处偶尔有外卖骑手的电动车驶过。楼下那家潮汕粥铺已经亮起灯,准备早市的食材。
半年前,他还在跨境电商公司加班到这个时候,为了一个促销活动页面。现在,他为一个验证流程的代码熬夜。
身份变了,但那种沉浸在心流状态的感觉,没变。
一个小时后,程序跑出第一轮结果。
林晨坐回电脑前,屏住呼吸看屏幕上的输出:
第1组验证 (2010-2014训练,2015验证):年化收益率 12.3%,最大回撤 -8.7% 第2组验证 (2010-2015训练,2016验证):年化收益率 9.8%,最大回撤 -10.2% 第3组验证 (2010-2016训练,2017验证):年化收益率 15.1%,最大回撤 -7.3% ... 第8组验证 (2010-2021训练,2022验证):年化收益率 6.4%,最大回撤 -12.5%
8组验证的平均年化收益率:10.2%,平均最大回撤:-9.6%。
“稳了”。林晨长舒一口气。
最关键的是,8组验证的结果没有出现极端值——没有某一年突然暴赚50%,也没有某一年巨亏30%。收益曲线相对平稳,这说明模型没有过度拟合某个特定时期的市场风格。
他接着运行最终的样本外测试:用2010-2022年全部数据重新训练最优参数模型,然后在2023年的全新数据上测试。
进度条再次移动。
这一次,林晨反而没那么紧张了。如果验证集的设计是科学的,那么测试集的结果应该不会偏离太远。就像你用了正确的方法学习,考试不会突然不及格。
二十分钟后,结果弹出:
样本外测试 (2023年数据): 年化收益率:8.7% 最大回撤:-11.2% 夏普比率:1.05 胜率:58.3%
比验证集的平均表现略差,但完全在可接受范围内。最关键的是,这个模型在2023年那种震荡下跌的市场中,依然实现了正收益,最大回撤控制在12%以内。
“这才叫鲁棒性”。林晨靠在椅背上,笑了。
鲁棒性(Robustness)——系统在异常或危险情况下的生存能力。这个词今天有了具体的意义:就是他的模型在不同年份、不同市场风格下,都能保持相对稳定的表现。
他看了眼时间,凌晨五点十分。
该睡了,但他兴奋得睡不着。干脆打开实盘账户,把新的模型部署上去。不过这次,他只投入了1万元——先用小资金跑一段时间,确认实盘表现和回测一致,再逐步加仓。
“慢慢来,这次不能再犯急功近利的错误”。他对自己说。
部署完系统,天已经蒙蒙亮。林晨走到阳台,晨风带着深圳湾方向传来的潮湿气息。远处天际线开始浮现轮廓,那些他曾经在里面加班的大楼,此刻还沉睡在黎明前的昏暗里。
他突然想起苏婉昨晚睡前说的话:“老公,乐乐下个月幼儿园要交下学期的学费了,八千多”。
当时他正盯着亏损的账户,只含糊应了声“嗯,我想办法”。
现在,看着阳台上那盆自己失业后开始养的绿萝——三个月,已经从几片叶子长得爬满了半个栏杆——林晨心里有了些底气。
“会好起来的”。他轻声说,不知道是对绿萝说,还是对自己说。
回到电脑前,他最后检查了一遍新的系统架构:
数据模块:支持时间序列滚动分割
训练模块:集成交叉验证流程
验证模块:多期历史验证+样本外测试
实盘模块:小资金起步,逐步扩容
这个架构,比之前那个追求“完美回测”的脆弱系统,健壮了不止一个量级。
关机前,林晨新建了一个文档,标题是《量化系统开发日志》。他在今天那栏写下:
“2023年x月x日,凌晨。吃一堑长一智,终于理解了验证集的意义。模型不是要拟合历史,而是要捕捉那些能在未来重复出现的规律。就像人生经验——有用的不是某次成功的具体做法,而是那次成功背后的底层逻辑”。
“下一步:让这个系统在实盘上跑一个月。如果表现稳定,就可以考虑增加资金了”。
他保存文档,合上电脑。
窗外,第一缕晨光照进城中村狭窄的巷道。粥铺的蒸汽升腾起来,新的一天开始了。
林晨躺到床上,闭上眼睛前,脑子里闪过一个念头:
“如果这个系统真的能稳定盈利…那我不但能解决眼前的生计问题,也许还能…”
他没想完,就沉沉睡去。
枕头边的手机屏幕亮了一下,是苏婉设置的闹钟:六点半。再过一小时,她就要起床给乐乐做早餐,然后赶去学校上早自习。
而林晨,将在几个小时后醒来,继续他无人监督、自我驱动的学习之路。
两条不同的生活轨迹,在这个小小的出租屋里交错。一个向外,面对学生和课堂;一个向内,面对代码和数据。
但他们都相信,方向是对的。