ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

一种基于LightGBM机器学习算法的用户年龄及性别预测方法

一种基于LightGBM机器学习算法的用户年龄及性别预测方法 摘要处于当今这个时代, 差不多每个人都没法离开手机, 在但凡任何的时间, 以及任何的地点, 移动用户能够借助手机去浏览网页, 还能聊天、玩游戏, 手机差不多涵盖了每个用户的属性特征以及行为偏好, 如此这般, 便能够精确地预测用户的属性特征, 像性别和年龄这种, 还有在精准营销里经常会用到的特征标签, 综合上面这些所说的, 提出了一种借助开源的监督学习算法来预测用户性别与年龄的办法。引言伴随着移动网络及智能手机的快速发展, 差不多每个人都没法离开手机。咨询公司所作报告予以显示, 在将近5年期间内, 智能手机于移动市场的渗透率, 已由2014年时的50%攀升至2019年的80% , 在2019年年底时, 预估将会攀升至85%。在日常的生活当中, 人们差不多每天都运用手机去浏览网页、进行聊天以及展开网上购物的说, 可以讲, 手机承载着一个人的差不多所有的属性特征以及行为偏好。所以, 运营商能够借助智能网管平台, 去采集移动用户终端的 APP 安装列表, 以及 APP 使用记录, 还有终端类型与终端价格等数据, 之后再结合开源的机器学习算法, 如此便可开展移动用户的精准画像工作, 像预测用户年龄、性别等信息, 这些在精准营销里全都是极为重要的客户标签属性。它不但能够助力互联网公司了解用户行为特征, 进而去迭代开发产品, 而且也能够帮助企业提升广告投放精准度, 进而实现节约广告投资成本。机器学习算法领域之中, 监督学习算法这点存在两类较为常用的算法, 其一为回归算法被称作回归, 其二为分类算法便是分类。回归算法与分类算法两者之间所存在的区别是输出变量的那类别方面的内容。如果定量输出那还有可能是连续变量预测的情况就会被叫做回归, 然而要是定性输出或者当它是离散变量预测的这种情况便是被叫做分类。对于移动用户年龄加上性别这方面的预测过程它是属于一个典型的分类问题, 所以利用分类算法用来对移动用户年龄以及性别进行精准预测。当下较为流行的分类算法涵盖经典的决策树, 以及集成学习算法里的梯度提升树GBDT——Tree算法与极端梯度提升——算法。当中, GBDT算法凭借多轮迭代来进行, 每一轮迭代会生成一个弱分类器, 后续各个分类器是在上一轮分类器的残差基础之上展开训练的, 就如同图1所展示的那样。图1. GBDT的模型训练过程所应用的算法是对 GBDT 的改进, 它是用于大规模并行 tree 的工具, 是当前最快最优的开源 tree 工具包。此后, 微软公司又提出一种算法用以增强 GBDT 的性能。它是一个实现 GBDT 算法的框架, 具备支持高效率并行训练的特性, 且拥有更快的训练速度、更低的内存消耗、更好的准确率以及具备支持分布式海量数据处理的能力。首先, 它摒弃了GBDT算法所采用的按层生长这种决策树生长策略, 转而运用带有深度限制的按叶子生成的算法, 这么做是为了加快训练进度, 削减内存运用。所以, 鉴于上述集成机器学习算法优势与劣势的比较, 提出了一种借助机器学习算法来预测用户年龄以及性别的办法。一种基于机器学习算法的用户年龄及性别的预测方法由于要提升算法模型预测之时的精准程度, 笔者选用了机器学习那种算法以及交叉验证的训练形式。此模型的算法在整体方面的流程框架就如同图2所呈现的那般, 整个模型的训练进程能够划分成5个步骤, 分别是: 数据收集, 还有特征工程, 再就是模型训练, 以及交叉验证, 最后是精度评价。图2. 用户年龄及性别预测算法的整体流程框架2.1 数据采集运营商借助智能网管平台能够实时采集关于用户的基本属性, 这些属性包含用户标识, 还有终端品牌, 再有终端子品牌, 另外有终端价格, 更有性别, 岁数以及用户的业务信息, 业务信息可细分为APP的安装列表, APP所属类型, APP所属子类型, APP的访问时间以及结束时间记录。当然, 用户的年头和性别信息仅仅在训练集中得以存在, 于预测集中则是目标预测结果。本次研究展开了数据收集工作 , 所聚焦的方向是近七万三千名用户的基本属性以及业务信息。在全部数据里 , 存在着五万用户提供来性别与年龄信息这个特定板块情况。处于这般具备特定版块样本当中 , 其中显示出来男性用户数量是三万两千三百二十四人 , 其所占据的比例是百分之六十四点六。而女性用户有一万七千六百七十六人 , 在同样这个板块里所占的比率则是百分之三十五点四。智能网管平台采集到的用户基本属性以及业务信息, 通过表1和表2进行展示, 在后续流程里, 那些数据会被用于训练预测模型2.2 特征工程在机器学习的研究这一范围内, 最关键至极的便是特征工程这个部分。为了完成分类原始数据有关的工作事宜, 在这类工作进行里, 一定要寻找到那表现分类真实本性最为有力的种种特征。不管怎么说, 特征工程的研究精细情形如何, 无可避免将会直接对考量的影响产生对应作用, 也就是模型预测方面的性能事项。所以, 首先就要针对拥有多达5万用户的训练数据集, 开展关于大数据这样技术手段的全面挖掘以及细致又深入的科学分析。给男性和女性用户分别赋予1和2的表示与此同时, 对于每个用户群体的年龄, 按照10年作为一个段落来进行划分, 举例来说, 处于25到30组的使用者, 在年龄特征方面会用3来表示, 就像表3所呈现的那样。借助针对用户基本属性以及业务信息展开的分析, 发觉了不同性别以及不同年龄段之于终端品牌的倾向分布规律, 如图3与图4各自所示。依据图3能够看出, 华为、小米、三星占据了安卓智能手机的主要市场份额, 当中, 使用小米手机的男性性别占比为20.5%, 女性占比为18.7%。由图4能够看出, 对于1至5年龄组的用户而言, 小米、三星品牌展现出“齐头并进”的态势, 而8至10年龄组又呈现出“反转”的走向, 这主要是受到样本数量的作用。图3. 不同性别对终端品牌的倾向性分析图4. 不同年龄对终端品牌的倾向性分析接下去针对用户APP安装列表展开了分析, 不同性别人群所安装的APP类型分布状况如同图5呈现的那样。就左图里的男性用户来讲, 最受青睐的3类应用是社交应用、购物应用还有应用管理方面的应用。而对于右图当中的女性用户来说, 社交APP、购物APP以及健康类APP备受瞩目。当然了, 这般市场规律的分布乃是经由不同的生活习惯、思维方式予以决定的。图5. 不同性别对APP类型的倾向性分析2.3 模型训练本文章展开了对于涵盖 GBDT 以及另外 3 种最为常用的机器学习算法之间区别和特点的研究, 借助对预测精度与复杂度予以比较, 最终做出了将其选定为整个模型核心算法的抉择, 并且经由达成数据处理以及模型训练来达成。其中, 当中的参数设置如同表 4 所展示的那样。2.4 交叉验证在这个步骤当中, 以交叉验证这种方式, 去对算法进入迭代分类进程期间特征之间存在的各异权重情形予以优化。按照要求, 把训练数据集划分成5份, 其中有1份被用来进行模型训练, 而其余的4份数据则是用于对模型精度进行验证。2.5 精度评估采用损失函数评估其分类精度, 以此来明确模型训练之后的精准性, 损失函数呈现为如式1所展示的那样。当中, N为预测集中的用户数量。j是依据性别以及年龄划分的各异用户组数。yij是个布尔值, 用以表明用户是不是属于这一个年龄—性别组。pij是经模型计算得出的该用户属于这一年龄—性别组的概率。在模型训练进程里, 借助损失函数算出该次训练的分类精度。模型对比分析此文针对实际用户的基本属性, 以及业务信息这类数据, 展开了分析跟挖掘, 进而提出了一套基于机器学习算法的, 用于预测用户年龄以及性别的方法, 后面还靠数据挖掘工具实现了整体的流程。靠调用工具包当中的机器学习模型这一举措, 去仔细斟酌不同继承算法之下模型的精准程度, 最终呈现的结果宛如图 5 所展示的那般。图6. 不同集成算法下模型精准性的差异从图5能够看出, 整体模型算法的精准程度会随着特征持续积累而得到提升, 并且, 图5所罗列的特征全都是给分类带来增益的, 对结果产生干扰的特征已被排除。借助不断进行的特征迭代训练, 运用算法的最佳损失函数能够控制在2.78左右, 这是整个研究进程中所能达成的最佳成果。总结本文给出了一种预测方法, 此方法是围绕大数据的剖析以及机器学习的演算法来实现对用户性别与年龄的预测的, 那种演算法架构是借助集成演算法对移动用户的岁数及性别予以预测, 其最佳成果能够把损失函数把控在类似于2.78的程度, 并且如果在后续的探究里导入更多且更为丰富的数据, 整体模型的精确性还能够进一步地得到提高, 那个模型对应的演算法可不光能丰富用户的标签讯息, 还能让互联网公司明了用户的行为特性, 进而开展迭代式的产品开发, 同时又为企业提升广告投放的精确程度铺桥搭路, 以此降低广告投资成本, 以上便是全部内容。
返回列表