• redis HyperLogLog结构学习


    Redis 在 2.8.9 版本添加了 HyperLogLog 结构。

    Redis HyperLogLog 是用来做基数统计的算法,HyperLogLog 的优点是,在输入元素的数量或者体积非常非常大时,计算基数所需的空间总是固定 的、并且是很小的。

    在 Redis 里面,每个 HyperLogLog 键只需要花费 12 KB 内存,就可以计算接近 2^64 个不同元素的基 数。这和计算基数时,元素越多耗费内存就越多的集合形成鲜明对比。

    但是,因为 HyperLogLog 只会根据输入元素来计算基数,而不会储存输入元素本身,所以 HyperLogLog 不能像集合那样,返回输入的各个元素。

    摘录下网上的一些说明

    1.HyperLogLog是一种算法,并非redis独有


    2.目的是做基数统计,故不是集合,不会保存元数据,只记录数量而不是数值。


    3.耗空间极小,支持输入非常体积的数据量


    4.核心是基数估算算法,主要表现为计算时内存的使用和数据合并的处理。最终数值存在一定误差


    5.redis中每个hyperloglog key占用了12K的内存用于标记基数(官方文档)


    6.pfadd命令并不会一次性分配12k内存,而是随着基数的增加而逐渐增加内存分配;而pfmerge操作则会将sourcekey合并后存储在12k大小的key中,这由hyperloglog合并操作的原理(两个hyperloglog合并时需要单独比较每个桶的值)可以很容易理解。


    7.误差说明:基数估计的结果是一个带有 0.81% 标准错误(standard error)的近似值。是可接受的范围


    8.Redis 对 HyperLogLog 的存储进行了优化,在计数比较小时,它的存储空间采用稀疏矩阵存储,空间占用很小,仅仅在计数慢慢变大,稀疏矩阵占用空间渐渐超过了阈值时才会一次性转变成稠密矩阵,才会占用 12k 的空间

    方法说明:

    2.HyperLoglog相关命令

    1)

    命令:PFADD key element [element ...]

    时间复杂度:O(1)

    命令描述:将除了第一个参数以外的参数存储到以第一个参数为变量名的HyperLogLog结构中。这个命令的一个副作用是它可能会更改这个HyperLogLog的内部来反映在每添加一个唯一的对象时估计的基数(集合的基数)。如果一个HyperLogLog的估计的近似基数在执行命令过程中发了变化, PFADD返回1,否则返回0,如果指定的key不存在,这个命令会自动创建一个空的HyperLogLog结构(指定长度和编码的字符串)。如果在调用该命令时仅提供变量名而不指定元素也是可以的,如果这个变量名存在,则不会有任何操作,如果不存在,则会创建一个数据结构。

    返回值:如果 HyperLogLog 的内部被修改了,那么返回 1,否则返回 0 。

     

    (2

    命令:PFCOUNT key [key ...]

    命令描述:当参数为一个key时,返回存储在HyperLogLog结构体的该变量的近似基数,如果该变量不存在,则返回0。当参数为多个key时,返回这些HyperLogLog并集的近似基数,这个值是将所给定的所有key的HyperLoglog结构合并到一个临时的HyperLogLog结构中计算而得到的。HyperLogLog可以使用固定且很少的内存(每个HyperLogLog结构需要12K字节再加上key本身的几个字节)来存储集合的唯一元素。返回的可见集合基数并不是精确值, 而是一个带有 0.81% 标准错误(standard error)的近似值。

    返回值:PFADD添加的唯一元素的近似数量。

     

    (3

    命令:PFMERGE destkey sourcekey [sourcekey ...]

    命令描述:将多个 HyperLogLog 合并(merge)为一个 HyperLogLog , 合并后的 HyperLogLog 的基数接近于所有输入 HyperLogLog 的可见集合(observed set)的并集。合并得出的 HyperLogLog 会被储存在目标变量(第一个参数)里面, 如果该键并不存在, 那么命令在执行之前, 会先为该键创建一个空的。

    返回值:这个命令只会返回 OK。

    先上下代码:

    <?php
    
    //实例化redis
    $redis = new Redis;
    $redis->pconnect('127.0.0.1',6379);
    $redis->select(2);
    $redis->flushDb();
    
    $logKey = 'testLog';
    
    for ($i=0; $i < 10000; $i++) { 
        $redis->pfadd($logKey,[$i]); 
    }
    
    echo $redis->pfcount($logKey);//9976

    正如上面所说,是存在一定误差的,但是误差在可接受范围内,比如统计网站UV的时候总不可能那么的精确把。

    ps:

    1.什么是基数?

    一个集合[1,2,3,4,5]基数为5,另一个集合[6,2,3,4,5,5]基数还是5(因为去重).

    应用场景举例:

    1.日均活跃用户数

    2.每日访问ip数

    3.统计注册ip数

    4.统计页面uv数

  • 相关阅读:
    Live Writer配置
    protobufnet 学习手记
    好的Sql语句也能提高效率(二)
    关于CodeSmith的输出问题
    [Scrum]12.29
    [scrum] 1.4
    分享 关于c#注释的规范
    [Scrum] 1.3
    分享:将XML(VS提取注释时生成)转换为Chm的一个方法
    【Scrum】2010.12.27
  • 原文地址:https://www.cnblogs.com/tudou1223/p/11199277.html
Copyright © 2020-2023  润新知