• Storm 单词计数


    Apache Storm是一个免费的开源分布式实时计算系统。Storm可以非常容易地实时处理无限的流数据。所谓实时处理是指在每条数据的产生时刻不确定的情况下,一旦有数据产生,系统就会立刻对该条数据进行处理。

    单词计数

    Storm WordCount与Hadoop WordCount有很多不同之处

    依靠Storm的实时性以及大规模数据的特点,在Spout中随机发送内置的语句作为消息源;使用一个Bolt进行语句切分,将句子切分成单词发射出去;使用一个Bolt订阅切分的单词Tuple,并且选择使用按字段分组的策略进行单词统计,将统计结果发射出去;最后使用一个Bolt订阅统计结果,词频实时排序,把前10个单词打印到log中。

    整个单词计数统计的流程如图所示

    依赖:

    <dependency>
        <groupId>org.apache.storm</groupId>
        <artifactId>storm-core</artifactId>
        <version>1.1.0</version>
    </dependency>

    书籍:Hadoop大数据技术开发实战 13.6 案例分析:单词计数

    https://gitee.com/caoyeoo0/xc-springboot/tree/hadoopApi/src/main/java/com/xc/xcspringboot/test/storm

  • 相关阅读:
    Effective C++ 1.让自己习惯C++
    C++Primer 第十九章
    C++Primer 第十八章
    C++Primer 第十七章
    C++Primer 第十六章
    C++Primer 第十五章
    C++Primer 第十四章
    ~~在python中踩过的坑以及问题~~(不断更新)
    ~~Python解释器安装教程及环境变量配置~~
    ~~Py2&Py3~~
  • 原文地址:https://www.cnblogs.com/ooo0/p/16895111.html
Copyright © 2020-2023  润新知