机器学习现在在很多地方都是十分流行,无论现在的你是否从事建模工作,还是你将来想从事相关工作,对于从业者可以从中看出一些同感与意见,对于未来从业者可以了解这个职业到底是做些什么。
话不多说,一个机器学习模型的开发周期一般可以分为:
1、业务需求挖掘(Business insight)
2、数据搜集处理(Data Curation)
3、模型训练开发(Modeling)
4、部署及测试上线(Deployment)
5、模型闭环监控及继续优化(Feedback & Improvement)
本文也是按照这个结构来进行展开总结与思考。
01 业务需求挖掘(Business insight)
当我们接到业务需求的时候,第一件事情需要了解的,就是需求的整体逻辑。一个合理的产品设计通常都是与业务痛点相挂钩的。如果业务提出一个比较空泛的需求,如:
我想要提高一下营销成功率,帮我搞个模型吧。
这个时候,我们需要沉住气,,有的时候数据建模师也需要充当起“心理辅导员”,慢慢引导业务说出实际的业务痛点与需求,好让我们对症下药(当然靠谱且有经验的业务是不会犯这种行为的)。在经过若干分钟的业务了解,其实业务真正想提高的,是最后的审批通过率,而继续了解,发现是由于最近业务的增长,电销人员的人手不足,导致审批的效率低下,而真正有意愿购买产品的客户被营销的可能性降低,导致最终的整体转换率过低。
了解过后,其实我们会有一个初步的模型设计思路,那就是可以设计一个模型对客户进行意愿度的预评估,根据评分对客户进行营销优先级,结合电销人员的经验度(营销成功率)与营销黄金时间等等维度的结合,输出营销计划,提高转化率。
那么在了解了业务需求后,接下来就需要针对具体的需求,继续咨询业务方一些业务知识点,而不是有了一点眉目就马上开工,毕竟模型还是做出来还是业务在用,事先沟通好一些细节性的问题也是无碍,而且沟通的过程可以让你对业务有更加深入的了解,对你后面的特征开发有很好的帮助。
02 数据搜集处理(Data Curation)
当我们确定了要开发的模型之后,这个时候需要做的是搜集数据与处理数据了。顾名思义,这一步也就是收集你可以用的数据去训练模型,而这是我认为是最为重要的一步。而在开始搜集数据前,需要了解几点内容:
1、模型应用节点
2、时效性要求
2、有没有预算,预算有多少
3、项目紧急程度
模型应用节点
模型的应用节点,决定了你有哪些变量是不可以用的,避免说出现“事后变量”或者是无法上线的变量,这往往是和业务逻辑是挂钩的,在上一步的Business insight过程需要了解清楚。比如:一个模型是打算应用于初审环节(贷款审批流程),因此我们在初审节点后的变量都是不能用的,比如终审环节、门店审核等等,还有一些贷后的变量都是不能用的。
时效性要求
有些模型可能需要应用在实时的审批过程,要求秒级响应,但也有些模型的时效性要求则没那么高,小时级别的,次日级别的都会有,了解清楚,这样子在设计你的模型或者变量的时候,更加地灵活。
预算多少
预算这个东西其实很难说,但是如果能有,那当然是最好的了,因为有了钱,自然可以从第三方机构接一些外部数据源,类似于外部征信之类的,这对于我们的模型效果会有很好的提升。当然,很多时候,我们都会是用公司已经接入的数据源来开发特征的了。
项目紧急程度
这个不仅是对于模型开发项目,其实所有的项目都是需要的,了解清楚项目所能给的最大时长,做好项目计划,马上开始工作。搜集数据,不需要等到所有的特征都搜集完才开始开发特征或者训练模型,有多少数据,就先搞多少数据。
在了解了以上的内容后,你就可以开始搜集所有相关的数据了,因为你的数据源会非常多,所以这里你必须做好数据的归档,不然后期会很乱,而且原始数据需要备份一份不要动,方便后续复盘使用。具体可以参考我先前的一篇文章内容《分享8点超级有用的Python编程建议》: https://mp.weixin.qq.com/s/eOeXA0ctErvd2mmEexZcBA
搞到数据后,需要做的事情大概可以分为:
1、消化所有的数据含义、逻辑;
2、对数据进行各种清洗,变成你熟悉的结构;
3、对数据进行质量控制,找出明显有问题的数据,探寻原因,实在找不到原因就直接剔除不用;
4、对数据衍生的特征做好备注,方便后面的回溯。
更加细致的数据挖掘过程这里就不展开,有很多好的书籍和开源代码可以参考。
03 模型训练开发(Modeling)
模型训练开发,这里指的是已经做完特征工程的步骤,重点在于筛选变量、选择算法、算法调参、模型评估等等的操作。这里也有几点建议分享给大家:
1、变量筛选,尽量多用自动化工具,对你的效率提升很大。最好还是通过自己总结多方特征筛选的方法,写一套自己的方法,方便自己调用;
2、如果是使用传统机器学习算法,如rf、gbdt、xgb等,建议变量个数不要太多,50个以内差不多了。如果是一些深度学习相关的模型算法就另当别论。
3、对于模型算法的选择,如果不知道选啥,可以都试试看看效果最直接。但是作为一个有经验的模型开发专家,你还是需要了解算法的原理,根据实际问题的情况来选择算法会更加好,比如类别型变量的占比、数据维度、样本目标占比、数据分布等等。
4、算法调参和模型评估的方法太多太成熟了,可以自己试着总结一份demo代码。
04 部署及测试上线(Deployment)
关于模型部署,涉及到的步骤就没那么多了,主要分成:
1、模型部署常用的就是pmml模型文件,所以你需要导出来给到后台开发小哥
2、而在这之前,一般需要我们写好接口文档,确定好特征逻辑与部署节点,给到产品经理
3、自己在对应的平台上写sql,测试对数等,更多地,这一步考验的是模型开发者的细心程度,当然,熟悉的老司机会总结出合适自己的一套的变量上线套路,弯道超车
4、模型文件部署到生产环境后,拿一些实际的单子进行AB test,看下实际输出是否满足预期,没有问题就万事大吉,不然得细心从变量开发的逻辑开始检查
05 模型闭环监控及继续优化(Feedback & Improvement)
至于模型上线后,我们并不是就完全不管了,我们需要时刻监控模型的表现,对于排序模型,主要可以从下面几个角度去监控:
1、排序性情况,比如评分卡模型,各个分组间的badrate是否仍存在单调性
2、分类占比,也就是各个类别的占比情况,如果出现与建模时候差异较大的情况,需要有所提示
3、与模型相关的业务指标波动,有些模型会直接影响通过率或者是转化率的,通过这些指标也是可以看出异常
除此之外,评分卡模型一般一年左右就需要迭代或更换,需要时刻留意效果作出决策。
以上是对机器学习建模的一些总结与思考,欢迎指正!