假设我们要构建一个决策树来预测一个人是否会购买某个产品。我们将使用以下特征来进行预测:
年龄:年龄范围在18岁到65岁之间
性别:男性或女性
收入:收入范围在0到100,000之间
我们有一个包含以下数据的训练集:
现在,我们将使用这些数据来构建一个决策树模型。
我们可以使用信息增益或基尼不纯度等指标来选择最佳特征。在这个例子中,我们选择使用信息增益。计算结果显示应该选择性别作为根节点。
接下来,我们根据性别的取值(男性或女性)将数据集分割成两个子集。
对于男性子集:
对于女性子集:
对于男性子集,我们可以看到购买的结果是"是"和"否"都有,所以我们需要进一步划分。我们选择年龄作为下一个节点。
对于年龄的取值(小于等于30岁和大于30岁):
对于小于等于30岁的子集:
对于大于30岁的子集:
对于小于等于30岁的子集,购买的结果都是"否",所以我们不需要再进行划分。
对于大于30岁的子集,购买的结果都是"是",所以我们不需要再进行划分。
对于女性子集,购买的结果都是"是",所以我们不需要再进行划分。
请根据上述过程绘制决策树:
性别
年齡
购买
购买
不购买
上述例子是决策树相关的一个简单案例,实际中决策树可以用于金融领域的精准营销,利用大数据建模,分析客户年龄、收入、职业、历史信贷记录等信息,锁定哪些客户群里更有可能发生信贷风险,
哪些属于优质客户,更可能购买产品和服务等。
来源:https://zhuanlan.zhihu.com/p/651602495
机器学习是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能。
它是人工智能核心,是使计算机具有智能的根本途径。
机器学习是计算机科学的一个分支,它允许计算机在不被明确告知这些模式是什么的情况下,从数据中自动推断出模式。这些推断通常基于使用算法来自动检查数据的统计属性,并创建数学模型来表示不同数量之间的关系。
让我们将其与传统计算进行对比,传统计算依赖于确定性系统,其中我们明确地告诉计算机一组规则来执行特定任务。这种计算机编程方法被称为基于规则的。机器学习与基于规则的编程的不同之处在于,它能够自己推断出这些规则。
假设你是一名银行经理,你想弄清楚一个贷款申请人是否有可能拖欠贷款。在基于规则的方法中,银行经理(或其他专家)将明确地告诉计算机,如果申请人的信用评分低于阈值,则拒绝该申请。
然而,机器学习算法只需要获取客户信用评分和贷款结果的历史数据,然后自己计算出这个阈值应该是多少。在这样做的过程中,机器从历史数据中学习并创建自己的规则。
当然,这只是对机器学习的介绍,因为现实世界的机器学习模型通常比简单的阈值复杂得多。尽管如此,这仍然是一个很好的例子,说明机器学习可以有多么强大。
只要您拥有相关数据,任何组织KPI都可以进行优化。例如,给定一个历史客户数据集,您可以预测当前的哪些客户有离开的危险,这样您就可以在流失发生之前阻止它。
机器学习方法已经取得了巨大的进步,而且可以完成的远不止于此。从自动驾驶汽车到语音识别,再到标记收件箱垃圾邮件的自动电子邮件过滤系统,机器学习算法构成了我们今天所依赖的许多技术进步的基础。
机器学习算法通常分为三大类:监督学习、无监督学习和强化学习。接下来,让我们了解一下不同类型的机器学习算法以及它们可以解决的特定类型的问题。
1 监督学习
监督学习指的是一类算法,在这种算法中,机器学习模型被赋予一组数据,这些数据带有我们感兴趣的数据的明确标签(这个标签通常被称为响应变量或目标变量)。半监督学习使用标记和未标记数据的组合来训练人工智能模型。
如果处理的是无标签的数据,则需要对数据打上标签。打标签是对数据实例进行注释以帮助训练机器学习模型的过程。打标签通常由人工完成,这可能既昂贵又耗时。然而,有一些方法可以使打标签过程自动化。
监督学习的一个很好的例子是我们前面考虑的贷款申请场景。在这里,我们有过去贷款申请人的信用评分(以及潜在的收入水平、年龄等)的历史数据,以及明确的标签,这些标签告诉我们这些申请人是否拖欠贷款。
监督学习算法可以进一步细分为回归和分类。这个差异是指我们的目标变量的类型。如果目标是在几个离散的类别之间进行选择——例如,申请人是否拖欠贷款,这是一张猫、狗还是人的照片,等等——那么这个问题就被称为分类,因为我们正在试图给数据确定所属的类别。然而,如果我们的目标变量是连续的,那么这个问题就被称为回归。例如,根据卧室的数量和位置来预测房子的价格。
常见的监督学习算法有线性回归、逻辑回归、支持向量机、决策树等
2 无监督学习
在无监督学习问题中,我们得到的数据没有标签,我们只是在寻找模式。常见的无监督学习算法有聚类分析、关联规则挖掘、降维和特征提取等。例如,给定亚马逊客户的购买历史,我们能否识别任何集群(类似客户的组)?
在这种情况下,即使我们没有明确的、确定的数据,关于一个人的兴趣是什么,只要确定一个特定的客户群体购买了类似的商品,我们就可以根据集群中的其他人也购买了什么来进行购买推荐。类似的系统是亚马逊的“你可能也会感兴趣”推荐引擎的核心。
K-means聚类是一种聚类模型,它根据客户行为模式的相似性将客户群体分配到不同的集群或组中。在技术层面上,它的工作原理是找到每个集群的质心,然后将其用作集群的初始平均值。然后根据新客户与集群中其他成员的相似性将其分配到集群中。
此外,一旦我们确定了集群,我们就可以研究它们的特征。例如,假设我们看到一个给定的集群正在购买许多电子游戏。在这种情况下,我们可以有根据地猜测这群用户是游戏玩家。一旦我们完成了这种形式的分析,我们甚至可以使用无监督学习的标签来创建监督学习模型,例如,让我们能够预测一个25岁的玩家与一个50岁的钓鱼爱好者相比,可能会在我们这里花多少钱。
3 强化学习
强化学习是一类机器学习算法,我们分配计算机代理执行某些任务,而不给它确切的指导。相反,我们允许计算机做出自己的选择,并根据这些选择是否会导致我们想要的结果,我们分配惩罚和奖励。我们多次重复这个过程,让计算机通过试错和反复迭代来学习做某事的最佳方式。
有趣的是,玩游戏是强化学习显示出最惊人结果的应用。谷歌臭名昭著的AlphaGo模型就是利用强化学习建立起来的,它甚至击败了排名最高的人类围棋选手。此后,谷歌将同样的技术扩展到了AlphaZero,它是最初的AlphaGo的继承者,被国际象棋选手用作确定最佳策略的参考。