A股量化分析框架:中国特色估值体系的多因子模型构建与实战

发布时间:2026/8/27 20:50:52
A股量化分析框架:中国特色估值体系的多因子模型构建与实战 1. 项目概述从一道赛题到一套可复用的A股量化分析框架去年带队打“大湾区杯”数学建模竞赛B题“基于中国特色估值体系的股票模型分析和投资策略”给我留下了挺深的印象。这道题出得很有水平它没有停留在传统的DCF、PE、PB这些西方经典估值模型上而是直接把“中国特色估值体系”这个近几年在资本市场被反复提及、但又让很多从业者感觉“有点虚”的概念抛给了我们这些参赛者。说白了就是让你用数学建模的方法去量化那些“讲政治”、“担责任”、“有潜力”但可能短期不赚钱的公司的价值。这恰恰是当前A股市场尤其是涉及国家安全、产业链自主、科技创新等关键领域投资时大家最困惑的点。传统的财务模型算出来估值很低但股价就是跌不下去甚至还能涨背后的逻辑是什么这道赛题就是要求我们构建一套能够融合财务指标与非财务、定性因素的量化分析模型并基于此形成可操作的投资策略。我把我当时的解题思路、模型构建的细节、编程实现的坑以及后续一些延伸思考整理成这篇长文。无论你是对量化投资感兴趣的学生还是想在A股实践新估值思路的从业者相信都能从中找到可以直接参考甚至“抄作业”的模块。2. 解题核心思路拆解什么是“中国特色估值体系”拿到题目第一步不是急着找数据、跑回归而是必须彻底理解命题背景。“中国特色估值体系”这个词近一两年在官方文件和券商研报里高频出现。它不是一个已经定型的标准模型而是一个研究方向其核心在于引导市场关注那些无法被传统估值模型充分定价的“隐性价值”。2.1 传统估值模型的“失灵”与中国特色因素的引入我们熟知的绝对估值法如DCF和相对估值法如PE、PB其底层逻辑高度依赖可量化的财务数据现金流、利润、净资产。这些模型在评估消费、制造等成熟行业时非常有效。但当面对以下类型的中国企业时就会“失灵”战略科技企业比如某些半导体设备公司研发投入巨大连续多年亏损但关乎产业链安全。按DCF算价值可能为负但国家战略支持使其拥有确定的长期订单和生存保障。公用事业与基础设施如水务、电网、铁路公司盈利稳定但增长有限PE往往很低。但在“共同富裕”、“现代化基础设施体系”背景下其提供的社会服务稳定性价值被低估。国有企业特别是央企它们承担着宏观调控、稳定就业、保障供应等非经济目标利润可能部分让渡于社会责任。传统的ROE净资产收益率指标无法衡量其社会贡献和风险抵御能力。因此构建中国特色估值模型本质上是在传统财务估值模型的基础上增加一系列“中国特色因子”作为调整项或新的定价维度。这些因子通常是非财务的、半定量的甚至是定性的。2.2 我们的建模总体框架设计我们的核心思路是构建一个多因子综合评分模型而非一个试图算出绝对股价的单一模型。这个框架更灵活也更符合投资实务投资往往是比较和排序。框架分为三层底层数据层收集股票的传统财务数据和中国特色主题数据。因子量化层将抽象的“中国特色”概念转化为可计算的指标因子。模型综合层将各因子标准化、加权得到每只股票的综合得分据此构建投资组合。这个框架的优势在于模块化。你可以根据对不同“特色”的理解调整因子的构成和权重。我们当时构建的因子主要围绕四个维度国家安全与自主可控、社会责任与绿色发展、公司治理与股东回报、创新驱动与成长潜力。接下来我会详细拆解每个维度下因子的具体量化方法这是整个项目最核心也最烧脑的部分。3. 核心因子量化如何把“特色”变成数字把“服务国家战略”、“科技创新”这样的定性描述变成可以输入模型的数字是最关键的步骤也是最具创造性的部分。这里分享我们当时采用以及赛后反思优化的方法。3.1 国家安全与自主可控维度这个维度主要筛选在关键领域如半导体、工业软件、种业、能源资源具备进口替代能力或保障国内供应链安全的公司。量化方法1研发投入强度与资本化率。不仅看研发费用占营收比传统指标更关注研发投入资本化比率。在会计准则中满足条件的研发支出可以资本化计入无形资产。对于攻关关键技术的公司较高的资本化率可能预示着更多研发成果正在形成技术壁垒和未来资产。因子值 (研发费用 / 营业收入) * (1 资本化研发支出 / 总研发支出)。这里做了一个简单加权强调成果转化。量化方法2供应链国产化深度。这部分数据较难直接获取。我们采用替代方案分析公司前五大供应商披露信息来自年报若供应商名称多为国内厂商或关联方则给予较高评分同时结合机构研报文本挖掘利用Python的jieba分词和sklearn的TF-IDF算法提取研报中关于“国产化”、“替代”、“突破”、“卡脖子”等关键词的频率和情感倾向作为一个文本因子。量化方法3政策受益关联度。收集国家层面关于集成电路、工业母机、新能源等产业的专项规划文件构建关键词词库。通过上市公司年报“管理层讨论与分析”章节的文本分析计算其业务描述与这些政策关键词的余弦相似度相似度越高因子得分越高。实操心得文本数据是非结构化数据处理起来耗时但价值高。不要只做简单的关键词匹配情感分析如使用snownlp库能帮你判断市场情绪是“期待”还是“担忧”。对于供应商数据如果无法获取可以退而求其次使用公司所属细分行业的国产化率行业报告数据作为该行业所有公司的代理变量虽然粗糙但好过没有。3.2 社会责任与绿色发展维度ESG环境、社会、治理投资在全球都是热点在中国语境下“社会责任”更强调乡村振兴、共同富裕、绿色发展等。量化方法1绿色收入占比。理想数据是公司绿色业务如光伏组件、污水处理、节能服务的营收占比。但披露不全。我们采用环境行政处罚金额与营收之比负向指标和环保投入与资本开支之比来间接衡量。因子值需要进行反向处理处罚越少得分越高和标准化。量化方法2员工与社会贡献。用人均薪酬增长率与利润增长率的比值衡量发展成果共享程度。比值大于1说明薪酬增长快于利润增长可能更符合“共同富裕”导向。同时可以计算税收贡献率支付的各项税费/营业收入作为企业履行社会责任的另一个代理指标。量化方法3ESG评级数据。直接引入第三方ESG评级如华证、商道融绿、Wind ESG作为现成的综合因子。但要注意不同机构评级方法差异大最好先做一致性检验或取多家评级的平均值。3.3 公司治理与股东回报维度良好的公司治理是价值实现的基础在中国特色下还特别关注中小投资者保护和现金分红。量化方法1股权结构稳定性。计算前十大股东持股比例和机构投资者持股比例。比例高通常意味着股权结构稳定但也要警惕“一股独大”。我们更关注机构投资者持股比例的变化趋势持续增加是积极信号。量化方法2现金分红承诺与兑现。不仅看股息率更看分红政策连续性和稳定性。我们设计了一个因子过去三年每年都进行现金分红且分红率分红总额/归母净利润波动小于一定阈值如20%的公司得分更高。这体现了对股东回报的重视和可预期性。量化方法3管理层能力与诚信。这是一个软指标。我们采用代理变量高管团队平均薪酬与公司业绩的关联度如与ROE的相关性以及是否存在财务造假历史或监管处罚记录严重负向指标一票否决或大幅扣分。3.4 创新驱动与成长潜力维度这是传统成长股估值的一部分但在这里更强调符合国家产业方向的“硬科技”成长性。量化方法1专利质量而非数量。不仅统计发明专利数量更关注专利被引用次数需专业数据库或公司参与制定国家/行业标准数量从年报中挖掘。这比单纯的数量更能体现技术领先性。量化方法2营收增长的“含金量”。分析营收增长来源是来自毛利率更高的新产品还是低毛利的传统业务扩张我们计算新产品营收占比的年度变化或毛利率与营收增长的协同性营收增长时毛利率是否同步提升或保持稳定。量化方法3产业政策支持强度。类似于3.1的方法但聚焦于“未来成长”。通过分析“十四五”规划等文件中对具体技术路径如“碳化硅”、“固态电池”、“人工智能大模型”的支持表述强度并结合公司业务与这些技术路径的匹配度进行评分。4. 模型构建、加权与回测实战有了几十个甚至上百个因子下一步就是整合成一个可用于选股的综合模型。4.1 数据预处理与因子标准化数据主要来自Wind、Tushare开源接口或国泰安CSMAR数据库。预处理是关键直接决定模型稳健性。缺失值处理对于财务数据行业均值填充比较常用。对于文本分析产生的因子缺失可能意味着无相关描述可直接赋值为行业中位数或较低分值。异常值处理使用MAD中位数绝对偏差或3σ原则进行缩尾处理Winsorize防止极端值影响。标准化由于因子量纲不同百分比、金额、次数等必须标准化到同一尺度。我们常用Z-Score标准化或Rank标准化排序后分位数。对于偏态严重的因子先取对数再标准化效果更好。4.2 因子合成与权重确定这是体现主观判断和模型技巧的地方。我们采用了分层加权的方法第一步维度内合成。将同一个维度如“国家安全”下的几个因子先进行等权或根据逻辑重要性赋予权重如我们认为“研发资本化率”比单纯的“研发费用率”更重要赋予更高权重合成该维度的综合得分。这步可以用主成分分析PCA降噪但我们当时为了解释性选择了加权平均。第二步维度间加权。四个维度的得分如何加权合成最终总分我们尝试了三种方法并进行了对比等权法最简单假设四个维度同等重要。历史收益回归法用过去一段时间如3年的维度得分对下一期的股票超额收益相对于市场指数进行横截面回归回归系数作为权重。这相当于让历史数据告诉我们市场更看重哪个维度。主观赋权法基于对当前政策导向的理解。例如在当前强调科技自立自强的阶段可以赋予“国家安全与自主可控”维度40%的权重其他维度各20%。踩坑记录直接使用回归法得到的权重可能不稳定特别是样本期较短时。我们最终采用了等权与主观赋权相结合的方式先等权再根据当年《政府工作报告》和中央经济工作会议通稿中相关关键词的词频对权重进行微调。例如某年“科技”一词出现频率远高于“绿色”则相应调高科技相关维度权重。这虽然引入了主观判断但让模型有了“与时俱进”的灵活性。4.3 投资策略构建与回测得到每只股票的综合得分后就可以构建策略了。选股每月末对所有股票按综合得分从高到低排序。选择排名前10%的股票作为投资组合。权重采用等权重配置。也可以按得分高低分配权重但等权重更简单也避免了过度集中在少数高分股。调仓每月调仓一次重新计算得分更新组合。回测设置回测期我们选择了2018年初至2022年底赛题时间点这期间包含了贸易摩擦、疫情、风格切换等多种市场环境考验模型韧性。基准沪深300指数。成本假设单边交易成本为千分之三印花税佣金。禁止池剔除ST、*ST、上市不足半年的新股、以及交易日数据缺失过多的股票。我们使用Python的backtrader或zipline框架进行回测。核心代码逻辑如下示意# 伪代码/思路示例 import pandas as pd import numpy as np # 假设 factor_score_df 是包含日期、股票代码、各维度得分及综合得分的DataFrame portfolio_returns [] benchmark_returns [] # 沪深300同期收益 for date in rebalance_dates: # 每月末的调仓日 current_scores factor_score_df[factor_score_df[date] date] # 按综合得分降序排名取前10% top_10_pct current_scores.nlargest(int(len(current_scores)*0.1), composite_score) selected_codes top_10_pct[stock_code].tolist() # 计算该调仓期内如下一个月投资组合的收益等权 # 此处需要连接价格数据计算下个月这些股票的平均收益率 # portfolio_return ... # benchmark_return ... 同期沪深300收益率 portfolio_returns.append(portfolio_return) benchmark_returns.append(benchmark_return) # 计算累计收益、年化收益、夏普比率、最大回撤等指标 final_portfolio_value (1 pd.Series(portfolio_returns)).cumprod() final_benchmark_value (1 pd.Series(benchmark_returns)).cumprod()5. 结果分析、问题与策略优化回测结果是我们模型价值的最终检验。5.1 回测核心绩效对比在我们的回测期内2018-2022模型策略等权月度调仓相对于沪深300指数取得了显著的超额收益。具体来看年化收益率策略约XX%具体数值取决于因子和权重细节通常显著高于指数沪深300约X%。夏普比率策略的夏普比率也高于基准表明在承担单位风险时获得了更高的回报。最大回撤策略的最大回撤小于沪深300尤其是在2018年和2022年的市场下行期表现出一定的抗跌性。这说明融入“特色因子”的组合在市场悲观时可能因为其“政策护城河”或“社会价值”而获得相对支撑。分年度表现策略在2020-2021年科技成长风格主导的市场中表现尤为突出在2018年、2022年价值风格占优或普跌市场中也能跑赢或持平指数显示了较好的风格适应性。5.2 模型稳健性检验与常见问题回测表现好不代表未来一定好必须做稳健性检验。参数敏感性测试改变因子合成时的权重如将主观权重在±10%范围内扰动观察策略收益是否发生剧烈变化。我们的模型收益曲线形状类似说明对权重不极度敏感。样本外测试如果数据允许最好使用更早的数据如2013-2017构建因子和确定权重然后在2018-2022年测试这是更严格的检验。过拟合问题这是量化建模最大的陷阱。我们采用了以下方法预防逻辑驱动优先所有因子的引入都必须有清晰的经济学或政策逻辑支撑而不是纯粹的数据挖掘。简化模型避免使用过于复杂的非线性模型如神经网络来合成因子多用线性加权增强可解释性。减少数据窥探确保在回测中任何时间点使用的数据都是在该时点“已知”的避免使用未来函数。例如年报数据要在公告日后才能使用。5.3 实际应用中会遇到的问题及优化方向因子失效与动态调整没有永远有效的因子。例如“国产化”因子在某一阶段被充分定价后超额收益可能消失。需要定期如每年回顾因子的有效性并考虑引入新的主题因子如“数据要素”、“人工智能”等。流动性考量高分股票可能是小盘股流动性差实际交易冲击成本高。在选股后应加入日均成交额过滤剔除流动性过差的股票。行业与风格中性化我们的策略可能在某些阶段超配了某个行业如科技其收益可能来源于行业贝塔而非Alpha。可以在选股时控制组合相对基准的行业暴露不超过一定比例或直接对因子做行业中性化处理即因子值减去行业均值。与传统量价因子结合纯粹的“特色基本面因子”可能换手率较低信号更新慢。可以尝试与一些趋势、动量、反转等量价因子结合构建多频段、多层次的混合策略。6. 从建模到实盘的思考与建议做完这个赛题我更深刻地认识到所谓“中国特色估值体系”的建模不是一个纯粹的数学问题而是一个金融学、政策解读和数据科学的交叉课题。它要求研究者不仅会编程、懂统计还要对宏观政策、产业动态有持续的关注和理解。对于想要将此思路应用于实盘或深入研究的朋友我的建议是从小处着手不要一开始就试图构建一个包罗万象的复杂模型。可以从一个你最有把握的“特色”维度开始比如就做“研发创新”因子或“ESG”因子把它做深做透验证其单独的有效性再逐步扩展。重视另类数据财报数据是后视镜另类数据可能提供前瞻性。除了文本还可以关注招聘数据公司扩大招聘的岗位方向、专利数据技术布局、供应链关系数据来自企业征信平台等。保持逻辑的简洁与透明模型越复杂越难维护和解释。每一个因子的计算、每一步权重的赋予最好都能用一两句话向别人讲清楚逻辑。这样当模型失效时你才能快速定位问题。理解这是一项持续的工作政策在变市场认知在变因子的内涵和有效性也在变。你需要建立一个持续更新的数据管道和因子库像维护一个花园一样维护你的模型。最后这道赛题的价值在于它逼着我们去思考投资的本质。在A股价值发现不仅仅是计算现金流更是理解一家公司在国家发展蓝图中的位置理解其超越利润的社会价值。量化模型是我们将这种理解系统化、纪律化的工具但它永远不能替代深度的思考和独立的判断。模型给出的高分名单是一个值得深入研究的起点而不是投资的终点。真正的“特色估值”可能永远有一部分无法被完全量化它存在于你对时代脉搏的把握之中。