KNN邻近算法（转）

KNN邻近算法（转）

KNN算法的决策过程

k-Nearest Neighbor algorithm 　　

　　右图中，绿色圆要被决定赋予哪个类，是红色三角形还是蓝色四方形？如果K=3，由于红色三角形所占比例为2/3，绿色圆将被赋予红色三角形那个类，如果K=5，由于蓝色四方形比例为3/5，因此绿色圆被赋予蓝色四方形类。　

　　K最近邻(k-Nearest Neighbor，KNN)分类算法，是一个理论上比较成熟的方法，也是最简单的机器学习算法之一。该方法的思路是：如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别，则该样本也属于这个类别。KNN算法中，所选择的邻居都是已经正确分类的对象。该方法在定类决策上只依据最邻近的一个或者几个样本的类别来决定待分样本所属的类别。 KNN方法虽然从原理上也依赖于极限定理，但在类别决策时，只与极少量的相邻样本有关。由于KNN方法主要靠周围有限的邻近的样本，而不是靠判别类域的方法来确定所属类别的，因此对于类域的交叉或重叠较多的待分样本集来说，KNN方法较其他方法更为适合。

　　KNN算法不仅可以用于分类，还可以用于回归。通过找出一个样本的k个最近邻居，将这些邻居的属性的平均值赋给该样本，就可以得到该样本的属性。更有用的方法是将不同距离的邻居对该样本产生的影响给予不同的权值(weight)，如权值与距离成正比。　　

该算法在分类时有个主要的不足是，当样本不平衡时，如一个类的样本容量很大，而其他类样本容量很小时，有可能导致当输入一个新样本时，该样本的K个邻居中大容量类的样本占多数。该算法只计算“最近的”邻居样本，某一类的样本数量很大，那么或者这类样本并不接近目标样本，或者这类样本很靠近目标样本。无论怎样，数量并不能影响运行结果。可以采用权值的方法（和该样本距离小的邻居权值大）来改进。该方法的另一个不足之处是计算量较大，因为对每一个待分类的文本都要计算它到全体已知样本的距离，才能求得它的K个最近邻点。目前常用的解决方法是事先对已知样本点进行剪辑，事先去除对分类作用不大的样本。该算法比较适用于样本容量比较大的类域的自动分类，而那些样本容量较小的类域采用这种算法比较容易产生误分。

转自：百度百科-http://baike.baidu.com/view/1485833.htm

有用链接：http://hi.baidu.com/hxtang/blog/item/a29e9a87b519e12dc65cc3db.html
相关阅读:
SQOOP的安装配置_Linux伊甸园开源社区24小时滚动更新开源资讯，全年无休！
Cloudera's Hadoop Demo VM for CDH4 Cloudera Support
海量文档查同或聚类问题 Locality Sensitive Hash 算法
 part 1: resemblance with the jaccard coefficient
计算机科学中最重要的32个算法zz
详细的tfidf构建过程实例（转）
2012 Beijing Google Dev FastDay(11/03/2012) 移动新观察
 百度技术沙龙
 Hive官方手册翻译(Getting Started) 实践检验真理 51CTO技术博客
 《周末休闲吧》：教你如何玩车震——车震全程攻略！_周末休闲吧_百度空间
原文地址：https://www.cnblogs.com/wintergrass/p/2138661.html