• Hadoop的Archive归档命令使用指南


    hadoop不适合小文件的存储,小文件本省就占用了很多的metadata,就会造成namenode越来越大。Hadoop Archives的出现视为了缓解大量小文件消耗namenode内存的问题。

    采用ARCHIVE 不会减少 文件存储大小,只会压缩NAMENODE 的空间使用

    1.单文件打包

    hadoop archive -archiveName weibotest2014.har -p /crawler/weibo/2014-06-26 /crawler/weibo/

    2.多文件夹打包

    hadoop archive -archiveName weibotest2014.har -p /crawler/weibo/ 2014-06-26 2014-06-27 /crawler/weibo/

    3.匹配打包

    hadoop archive -archiveName weibotest2014.har -p /crawler/weibo/ 2014-06* /crawler/weibo/

    4.解压

    hadoop distcp har:////crawler/weibo/weibotest2014.har /crawler/weibo/

    5.查看文件夹大小

    hadoop fs -du -s /crawler/weibo/2014-06-28

    6.删除文件夹

    hadoop fs -rm -r /crawler/weibo/2014-06-28

  • 相关阅读:
    浏览器返回按钮不会触发onLoad事件
    js常用方法
    清除浮动
    Hbuilder快捷键
    页面跳转
    castapp.js颜色配置
    mui学习
    css 特殊使用技巧
    mui框架如何实现页面间传值
    从0到千万级访问量网站架构演变史
  • 原文地址:https://www.cnblogs.com/lingwang3/p/10254913.html
Copyright © 2020-2023  润新知