监督学习，非监督学习和半监督学习

监督学习，非监督学习和半监督学习

监督学习

通俗的讲：监督学习是我们给定一个输入和（期望）输出，然后进行学习（learning）或者训练（trainning），最后使程序能够自主对输入进行识别，得到一个结果（我们进行越多的训练，得到的结果越接近我们期望的值，值不一定是1个，2个，可以是很多，但是复杂程度会越高）。

学术性的讲：从给定的训练数据集中学习出一个函数（模型参数），当新的数据到来时，可以根据这个函数预测结果。监督学习的训练集要求包括输入输出，也可以说是特征和目标。训练集中的目标是由人标注的。监督学习就是最常见的分类（注意和聚类区分）问题，通过已有的训练样本（即已知数据及其对应的输出）去训练得到一个最优模型（这个模型属于某个函数的集合，最优表示某个评价准则下是最佳的），再利用这个模型将所有的输入映射为相应的输出，对输出进行简单的判断从而实现分类的目的。也就具有了对未知数据分类的能力。监督学习的目标往往是让计算机去学习我们已经创建好的分类系统（模型）。

监督学习是训练神经网络和决策树的常见技术。这两种技术高度依赖事先确定的分类系统给出的信息，对于神经网络，分类系统利用信息判断网络的错误，然后不断调整网络参数。对于决策树，分类系统用它来判断哪些属性提供了最多的信息。

常见的有监督学习算法：回归分析（regression）和统计分类（classification）。最典型的算法是KNN和SVM。

回归分析：Y是实数vector。回归问题，就是拟合(x,y)的一条曲线，使得价值函数(costfunction) L最小。

统计分类：Y是一个有穷数(finitenumber)，可以看做类标号，分类问题首先要给定有lable的数据训练分类器，故属于有监督学习过程。分类过程中cost function l(X,Y)是X属于类Y的概率的负对数。

其中fi(X)=P(Y=i/X)。

无监督学习

通俗的讲：我们只负责给数据（样本）（很杂，很乱，举例：新闻信息），计算机可以根据数据（样本）之间的相似性，对数据（样本）进行分类，达到一种效果（新闻可以分类）。

学术性的讲：输入数据没有被标记，也没有确定的结果。样本数据类别未知，需要根据样本间的相似性对样本集进行分类（聚类，clustering）试图使类内差距最小化，类间差距最大化。无监督学习目标不是告诉计算机怎么做，而是让它（计算机）自己去学习怎样做事情。非监督学习有两种思路。第一种思路是在指导Agent时不为其指定明确分类，而是在成功时，采用某种形式的激励制度。需要注意的是，这类训练通常会置于决策问题的框架里，因为它的目标不是为了产生一个分类系统，而是做出最大回报的决定，这种思路很好的概括了现实世界，agent可以对正确的行为做出激励，而对错误行为做出惩罚。

无监督学习分类：

1.基于概率密度函数估计的直接方法：指设法找到各类别在特征空间的分布参数，再进行分类。

2.基于样本间相似性度量的简洁聚类方法：其原理是设法定出不同类别的核心或初始内核，然后依据样本与核心之间的相似性度量将样本聚集成不同的类别。利用聚类结果，可以提取数据集中隐藏信息，对未来数据进行分类和预测。应用于数据挖掘，模式识别，图像处理等。

两者的不同点：

1. 有监督学习方法必须要有训练集与测试样本。在训练集中找规律，而对测试样本使用这种规律。而非监督学习没有训练集，只有一组数据，在该组数据集内寻找规律。

2. 有监督学习的方法就是识别事物，识别的结果表现在给待识别数据加上了标签。因此训练样本集必须由带标签的样本组成。而非监督学习方法只有要分析的数据集的本身，预先没有什么标签。如果发现数据集呈现某种聚集性，则可按自然的聚集性分类，但不予以某种预先分类标签对上号为目的。

3. 非监督学习方法在寻找数据集中的规律性，这种规律性并不一定要达到划分数据集的目的，也就是说不一定要“分类”。这一点是比有监督学习方法的用途要广。譬如分析一堆数据的主分量，或分析数据集有什么特点都可以归于非监督学习方法的范畴。

4. 用非监督学习方法分析数据集的主分量与用K-L变换计算数据集的主分量又有区别。后者从方法上讲不是学习方法。因此用K-L变换找主分量不属于无监督学习方法，即方法上不是。而通过学习逐渐找到规律性这体现了学习方法这一点。在人工神经元网络中寻找主分量的方法属于无监督学习方法。
相关阅读:
Construct Binary Tree from Preorder and Inorder Traversal leetcode java
win7-X64用死性不改的系统安装锐起网吧无盘V4.5 Build 3535_64位客户端老不出物理映射盘的问题
 routeros ros M ikrotik 硬件产品命名规则
 CentOS下配置常用Tunnel隧道gre，ipip
pptp隧道断了以后，重拨也不通的情况。新any可能出现的几个问题,包括T人下线的方法
 MariaDB(mysql)+daloRADIUS 导入数据库导入用户的方法
 centos策略路由-基于源地址的策略路由ip rule
2019年逾期率上升_24家头部P2P平台最新运营数据解读：8家近一年逾期率走势曝光
 关于逾期率你所不知道的秘密
 Vintage_坏客户定义
原文地址：https://www.cnblogs.com/KeithTee/p/14717142.html