日志数据清洗,主要采用spark 的定时任务,清洗出有效数据,并保存到hive数据仓库中存储。常用流程如下:
参考:https://gaojianhua.gitbooks.io/bigdata-wiki/content/sparkclean.html
日志数据清洗,主要采用spark 的定时任务,清洗出有效数据,并保存到hive数据仓库中存储。常用流程如下:
参考:https://gaojianhua.gitbooks.io/bigdata-wiki/content/sparkclean.html