ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

【Python量化数据工程实战 #06】前复权后复权分不清?回测数据准备的最佳实践

【Python量化数据工程实战 #06】前复权后复权分不清?回测数据准备的最佳实践 你跑回测的时候有没有遇到过这种诡异情况某只股票昨天收盘 150 元今天开盘直接跳到 100 元——没跌停但跌了 33%。策略信号在除权日疯狂触发买入卖出全乱套。同一段代码Tushare 拉的数据收益 20%自己拉的数据收益 -5%——数据来源一样只是没复权。问题出在除权除息。A股每年都有分红、送转股如果不做复权处理K线会出现断崖式跳空你的收益率、均线、波动率全部失真。这篇文章不讲复杂的金融工程只给你一个可落地的前复权计算方案用真实分红数据手动算出复权因子让回测结果不再被除权日绑架。本文你将得到什么不复权、前复权、后复权的本质区别一句话说清用company_dividends拉分红送股数据手动计算前复权因子一段可直接运行的代码输出复权后的收盘价回测中复权处理的 2 个铁律一句话说清三种价格类型含义适用场景不复权交易所原始成交价格看真实委托、撮合逻辑前复权以最新价格为基准历史价格往回调整回测、策略研究推荐后复权以上市首日为基准后续价格往前调整长期收益累计、财富增长回测必须用前复权。原因前复权保持了最新价格的现实意义历史价格按比例压缩收益率计算不会受除权日干扰。代码实战手动计算前复权下面演示完整的复权流程先拉不复权行情和分红数据再计算前复权因子。frommairuiimportClientimportpandasaspd clientClient(LICENCE-66D8-9F96-0C7F0FBCD073)code600519# 1) 拉不复权日线rawclient.stock_history(code,lt120,dividendn)dfpd.DataFrame(raw)df[t]pd.to_datetime(df[t])dfdf.sort_values(t).reset_index(dropTrue)# 2) 拉分红送股数据divsclient.company_dividends(code)df_divpd.DataFrame(divs)df_div[sdate]pd.to_datetime(df_div[sdate])# 只取在行情区间内且已实施的分红mask(df_div[sdate]df[t].min())(df_div[line].isin([实施,已实施]))df_divdf_div[mask].sort_values(sdate)# 3) 计算前复权因子从除权日往历史回溯df[adj_c]df[c].astype(float)for_,rowindf_div.iterrows():sdaterow[sdate]sendfloat(row[send])ifrow[send]!-else0.0givefloat(row[give])ifrow[give]!-else0.0# 送转比例10送3 0.3即每股变 1.3 股ratio1.0(give/10.0)# 对除权日之前的所有价格先乘股数比再加现金红利mask_beforedf[t]sdate df.loc[mask_before,adj_c]df.loc[mask_before,adj_c]*ratiosend# 4) 输出对比print(df[[t,c,adj_c]].tail(10).to_string(indexFalse))核心逻辑拆解前复权的核心就一句话历史价格要反映如果当初买了现在值多少。假设你持有 1 股股价 100 元公司 10 送 3你的 1 股变成 1.3 股每股价格变成 100 / 1.3 76.92 元再每股派 2 元你拿到 2 元现金每股价格变成 76.92 元现金不影响股价但你的总资产增加了所以前复权的历史价格需要乘股数比股变多了每股价格变低反过来历史价格要变高加现金红利你拿到了现金相当于成本降低回测复权的 2 个铁律铁律 1回测全程用前复权但下单必须用不复权策略信号计算均线、突破、收益率全部基于前复权价格但生成交易指令时要映射回交易所真实价格不复权否则你的买入价和实际撮合价对不上。# 伪代码信号计算用 adj_c下单用 csignaldf[adj_c]df[adj_ma20]# 前复权算信号order_pricedf.loc[signal,c]# 用不复权价格下单铁律 2复权因子一旦确定回测期间不能变如果你在 2024 年跑回测用到了 2025 年才披露的分红数据那就是未来函数——你在 2024 年不可能知道 2025 年会分红多少。正确做法回测到某天只使用该日期之前已公告的分红方案。company_dividends返回的line字段如果是预案说明还没实施回测中不应纳入。小结复权不是可有可无的数据清洗而是回测的基础设施。记住三点回测用前复权保持最新价格的真实意义手动算复权因子 股数比累乘 现金红利累加下单用不复权模拟真实交易所撮合掌握这套流程你的回测结果才具备横向可比性——不会因为某只股票分红多、送转多就凭空跑输其他策略。下篇预告数据合并完了复权也做了但特征还是太多、相关性太高怎么办#07 带你用相关性去重 RFE 递归特征消除把 100 个特征筛到 10 个最有效的。免责声明本文仅供技术学习交流不构成任何投资建议。市场有风险决策需谨慎。代码与文档更多接口文档和 SDK 使用示例可查阅官方文档https://github.com/MaiRuiApi/mairui
返回列表