• hadoop之 mapreduce example(2)


    解释下 第一篇 程序的意思

    Job ’s setJarByClass() 便于hadoop查找并加载相关的jar包文件

    FileInputFormat.addInputPath() 设置输入路径,可以是一个文件,也可以是一个文件夹,而且可以被调用多次,用以加载不同的输入路径。

    FileOutputFormat.setOutputPath() 设置输出路径,reduce函数会讲 文件写入该路径。在job执行前,该文件夹不能存在,否则hadoop会抛出异常.

    org.apache.hadoop.mapred.FileAlreadyExistsException: Output directory hdfs://hadoop:9000/hadoop/out already exists
    	at org.apache.hadoop.mapreduce.lib.output.FileOutputFormat.checkOutputSpecs(FileOutputFormat.java:146)
    	at org.apache.hadoop.mapreduce.JobSubmitter.checkSpecs(JobSubmitter.java:266)
    	at org.apache.hadoop.mapreduce.JobSubmitter.submitJobInternal(JobSubmitter.java:139)
    	at org.apache.hadoop.mapreduce.Job$10.run(Job.java:1290)
    	at org.apache.hadoop.mapreduce.Job$10.run(Job.java:1287)
    	at java.security.AccessController.doPrivileged(Native Method)
    	at javax.security.auth.Subject.doAs(Subject.java:422)
    	at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1657)
    	at org.apache.hadoop.mapreduce.Job.submit(Job.java:1287)
    	at org.apache.hadoop.mapreduce.Job.waitForCompletion(Job.java:1308)
    	at com.hadoop2.serialize.job.MaxTemperatureJob.main(MaxTemperatureJob.java:46)
    	at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
    	at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:62)
    	at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
    	at java.lang.reflect.Method.invoke(Method.java:497)
    	at com.intellij.rt.execution.application.AppMain.main(AppMain.java:144)
    
    

    通过setMapperClass()和setReducerClass()方法 设置map和reduce类型

    setOutputKeyClass()和setOutputValueClass() 方法用以控制reduce函数输出类型,并且必须匹配reduce函数的输出类型,比如程序中输出key是Text,value 是IntWritable。

    如果map和reduce的输出类型是一致的,就不需要设置map函数的输出类型,默认是一致的。但是如果不一样,需要设置map函数的输出类型。

    job.setInputFormatClass() 可以设置输入类型,默认使用TextInputFormat,所以 如果使用文本不需要设置。

    waitForCompletion() 从命名上就可以看出是 提交job并等待完成。

    上面的程序是远程执行的,不需要打jar包,我认为这样更加方便。

    用放荡不羁的心态过随遇而安的生活
  • 相关阅读:
    重拾IP路由选择:CCNA学习指南中的IP路由选择
    Ubuntu Eclipse ns3编译中 遇到的OSError 系列问题
    Ubuntu 上 执行命令 java -version 显示 没有那个文件或目录
    Ubuntu 登陆界面无限循环问题 以及 root用户无法使用命令问题
    【TCP/IP详解 卷一:协议】TCP的小结
    Ubuntu上 配置Eclipse:安装CDT
    【TCP/IP详解 卷一:协议】第二十四章 TCP的未来与性能
    【TCP/IP详解 卷一:协议】TCP定时器 小结
    【TCP/IP详解 卷一:协议】第二十三章 TCP的保活定时器
    【TCP/IP详解 卷一:协议】第二十二章 TCP的坚持定时器
  • 原文地址:https://www.cnblogs.com/re-myself/p/5521224.html
Copyright © 2020-2023  润新知