hive 留存率 计算

定义

留存率:某日注册的用户,在之后几天是否活跃,一日留存率就是用户注册后第二天仍然活跃,以此类推,三日留存率,七日留存率。
任务:
计算所有用户注册后的一日留存率,三日留存率和七日留存率。

建表

use default;
show tables;

create table register_tbl(
user_id string,
register_date string)
row format delimited fields terminated by ',' 
location "/HiveTestDB/retention/re"
tblproperties("skip.header.line.count"="1");

create table active_tbl(
user_id string,
active_date string)
row format delimited fields terminated by ',' 
location "/HiveTestDB/retention/ac"
tblproperties("skip.header.line.count"="1");

load data local inpath "/home/hadoop/register_tbl.csv" into table register_tbl;
load data local inpath "/home/hadoop/active_tbl.csv" into table avtive_tbl;

select * from register_tbl;
select * from active_tbl;

查询

说明:register_tbl表记录了所有用户的注册日期,active_tbl是用户所有活动日期;
计算所有注册用户注册后第一天、第三天和第七天的留存率,也就是所有用户注册后第一天、第三天和第七天有登录行为的数量和比例。

步骤;

  1. register_tbl左关联active_tbl,如果要计算特定时间范围内注册用户的留存率,通过where子句过滤。
  2. 按用户和注册日期分组,计算组内活跃日期与注册日期差值分别为1,3,7的记录的个数,通过distinct实现有为1,没有为0
  3. 由此计算全部用户中留存一天、三天和七天的个数及比例
select 
	count(*) total, 
	sum(d1) 1d_Retent,
	sum(d3) 3d_Retent,
	sum(d7) 7d_Retent,
	sum(d1)/count(*) 1d_Retent_Rate,
	sum(d3)/count(*) 3d_Retent_Rate,
	sum(d7)/count(*) 7d_Retent_Rate from 
	(select 
		uid,rd,
		count(distinct if(datediff(ad,rd) = 1, 1, null)) d1,    
		# 也可以 if(count(datediff(ad,rd) = 1 or null)>0,1,null),避免使用distinct
		count(distinct if(datediff(ad,rd) =3, 1, null)) d3,
		count(distinct if(datediff(ad,rd) =7, 1, null)) d7 from 
			(select 
			r.user_id uid,from_unixtime(unix_timestamp(r.register_date,'yyyy-MM-dd')) rd,
			from_unixtime(unix_timestamp(a.active_date,'yyyy-MM-dd')) ad from 
			register_tbl r left join active_tbl a on r.user_id = a.user_id) s1 group by uid,rd ) s2

结果

最终计算结果
《hive 留存率 计算》
过渡结果

每一个用户在注册后第一天、第三天和第七天是否有过登录行为。
《hive 留存率 计算》

    原文作者:兴趣使然的码基
    原文地址: https://blog.csdn.net/weixin_42756361/article/details/97681071
    本文转自网络文章,转载此文章仅为分享知识,如有侵权,请联系博主进行删除。
点赞