特征工程方法论梳理

发布时间:2026/7/28 14:29:56
特征工程方法论梳理 文章目录概论引言特征工程特征工程概念特征工程相关资料搜索特征工程过程概论机器学习算法及应用场景不断更新变化也意味着也必须跟得上学术及大牛的脚步在这条路上迈着魔鬼的步伐不断前进不敢停歇。知识的更新需要随时记录写的过程其实也是一种梳理的过程并且加强一遍记忆。第一次写最近比较关注的是特征选择过程。引言其实在每一次做数据分析的过程中这是不可缺少的一步。但是当面试官问你阐述一下对特征工程的理解你还是觉得心慌。为什么因为你没有对它的概念、以及在机器学习中的角色及作用进行过系统的思考过。因此我决定记录一下也是对它的搜索、思考及系统的梳理。特征工程特征工程概念关于特征工程业界的一句话数据和特征决定了机器学习的上限而模型和算法只是逼近这个上限。机器学习模型需要数据来训练但是通常需要对数据进行预处理以便在训练的时候发挥作用。这种预处理也就是所说的“特征工程”。特征工程是指从原始数据转换为特征向量的过程。特征工程是机器学习中最重要的起始步骤会直接影响机器学习的效果并通常需要大量的时间。特征工程包括数据清理、特征提取、特征选择等过程。清华大学数据科学研究院中提过在机器学习黑客马拉松和竞赛中特征工程的质量通常是进入排行榜10强和无缘50强的重要区别。因此可见特征工程的重要性。特征工程相关资料搜索http://www.sohu.com/a/253092596_787107这是我觉得讲的框架性很全面的一篇文章。涵盖了特征工程的很多方面让我之前凌乱的思路得到了骨架成为了一体。https://www.jiqizhixin.com/articles/2018-06-21-2除了上面一惊喜发现之外还知道了去年更新的python FeatureTools实现了特征选择自动化的想法想法简单但逻辑复杂以下附上项目名称及代码地址。项目地址https://docs.featuretools.com/代码地址https://github.com/WillKoehrsen/automated-feature-engineering/blob/master/walk_through/Automated_Feature_Engineering.ipynb特征工程过程特征使用方案a 要实现我们的目标需要哪些数据——基于业务理解尽可能找出对因变量有影响的所有自变量b 可用性评估 获取难度 覆盖率 准确率特征获取方案a 如何获取这些特征b 如何存储特征处理a 特征清洗aa 清洗异常样本方法标准差法 1sigma 68% 2 95% 3 99.7% 之外 异常值bb 采样: 数据不均衡 样本权重b 预处理aa 单个特征归一化、离散化、虚拟变量、缺失值、数据转换指数、对数、Box-Coxbb 多个特征aaa 降维LDA 线性判别分析、PCA主成分因子分析bbb 特征选择过滤法思路-自变量与因变量之间的关联-相关系数法、卡方检验、信息增益等包裹法思路-根据目标函数来决定是否加入一个变量。迭代-产生特征子集评价完全搜索、自发式搜索、随机搜索嵌入法 思路-学习器自动选择特征正则化lasso、岭回归、决策树、深度学习c 衍生变量对原始数据加工生成有商业意义的变量特征监控特征有效性分析特征重要性、特征权重特征监控尽管前方是洪水猛兽但无所谓只有往前冲因为你要知道后退一步即是悬崖。针对某种情景的无奈与无所畏惧。——送给自己以及还在犹豫徘徊、失望懊恼的你。