MapReduce的Shuffle机制

MapReduce的Shuffle机制
map阶段处理的数据如何传递给reduce阶段，是MapReduce框架中最关键的一个流程，这个流程就叫shuffle。

shuffle: 洗牌、发牌——（核心机制：数据分区，排序，合并）。

shuffle是Mapreduce的核心，它分布在Mapreduce的map阶段和reduce阶段。一般把从Map产生输出开始到Reduce取得数据作为输入之前的过程称作shuffle。
1. Collect阶段：将MapTask的结果输出到默认大小为100M的环形缓冲区，保存的是key/value，Partition分区信息等。
2. Spill阶段：当内存中的数据量达到一定的阀值的时候，就会将数据写入本地磁盘，在将数据写入磁盘之前需要对数据进行一次排序的操作，如果配置了combiner，还会将有相同分区号和key的数据进行排序。
3. Merge阶段：把所有溢出的临时文件进行一次合并操作，以确保一个MapTask最终只产生一个中间数据文件。
4. Copy阶段： ReduceTask启动Fetcher线程到已经完成MapTask的节点上复制一份属于自己的数据，这些数据默认会保存在内存的缓冲区中，当内存的缓冲区达到一定的阀值的时候，就会将数据写到磁盘之上。
5. Merge阶段：在ReduceTask远程复制数据的同时，会在后台开启两个线程对内存到本地的数据文件进行合并操作。
6. Sort阶段：在对数据进行合并的同时，会进行排序操作，由于MapTask阶段已经对数据进行了局部的排序，ReduceTask只需保证Copy的数据的最终整体有效性即可。
Shuffle中的缓冲区大小会影响到mapreduce程序的执行效率，原则上说，缓冲区越大，磁盘io的次数越少，执行速度就越快

缓冲区的大小可以通过参数调整, 参数：io.sort.mb 默认100M

总结：
- 每个map有一个环形内存缓冲区，用于存储任务的输出。默认大小100MB（io.sort.mb属性），一旦达到阀值0.8（io.sort.spill.percent）,一个后台线程把内容写到(spill)磁盘的指定目录（mapred.local.dir）下的新建的一个溢出写文件。
- 写磁盘前，要partition,sort。如果有combiner，combine排序后数据。
- 等最后记录写完，合并全部溢出写文件为一个分区且排序的文件。
- Reducer通过Http方式得到输出文件的分区。
- TaskTracker为分区文件运行Reduce任务。复制阶段把Map输出复制到Reducer的内存或磁盘。一个Map任务完成，Reduce就开始复制输出。
- 排序阶段合并map输出。然后走Reduce阶段。
Shuffle的过程
相关阅读:
zookeeper 简介
 缓存雪崩缓存穿透
 SpringCloud实战2-Ribbon客户端负载均衡
 SpringCloud实战1-Eureka
JVM笔记9-Class类文件结构
 JVM笔记8-虚拟机性能监控与故障处理工具
 JVM笔记7-内存分配与回收策略
 SpringAOP-JDK 动态代理和 CGLIB 代理
 MySQL多数据源笔记5-ShardingJDBC实战
 MySQL多数据源笔记4-Mycat中间件实战
原文地址：https://www.cnblogs.com/TiePiHeTao/p/8be26460b47a42b74e3900bd002f97bf.html

MapReduce的Shuffle机制

总结：

Shuffle的过程