Spark大型项目实战:电商用户行为分析大数据平台(史上第一套高端大数据项目实战课程)

3678
5
2020-03-14 00:10:01
18
投币
162
8
https://blog.csdn.net/chenyao1994
https://blog.csdn.net/chenyao1994
视频选集
(25/138)
第1讲-课程介绍
42:13
第2讲-课程环境搭建:CentOS 6.4集群搭建
01:16:26
课程环境搭建:CDH 5.3.6集群搭建_转
26:09
课程环境搭建:Hive 0.13.1安装_转
19:47
课程环境搭建:zookeeper-3.4.5-cdh5.3.6集群搭建_转
08:49
课程环境搭建:kafka_2.9.2-0.8.1集群搭建_转
17:03
课程环境搭建:flume-ng-1.5.0-cdh5.3.6安装_转
15:48
课程环境搭建:离线日志采集流程介绍_转
27:36
课程环境搭建:实时数据采集流程介绍_转
12:42
课程环境搭建:Spark 1.5.1客户端安装以及基于YARN的提交模式_转
13:12
用户访问session分析:模块介绍_转
28:55
用户访问session分析:基础数据结构介绍_转
46:22
用户访问session分析:需求分析_转
23:51
用户访问session分析:技术方案设计_转
27:33
用户访问session分析:数据表设计_转
15:58
用户访问session分析:Eclipse工程搭建以及工具类说明_转
13:29
用户访问session分析:开发配置管理组件_转
25:49
JDBC原理介绍以及增删改查示范_转
57:11
用户访问session分析:数据库连接池原理_转
19:24
用户访问session分析:单例设计模式_转
16:27
用户访问session分析:内部类以及匿名内部类_转
14:41
用户访问session分析:开发JDBC辅助组件_转
24:08
用户访问session分析:开发JDBC辅助组件(下)_转
27:27
用户访问session分析:JavaBean概念讲解_转
11:18
用户访问session分析:DAO模式讲解以及TaskDAO开发_转
21:13
用户访问session分析:工厂模式讲解以及DAOFactory开发_转
08:10
用户访问session分析:JSON数据格式讲解以及fastjson介绍_转
16:39
用户访问session分析:Spark上下文构建以及模拟数据生成_转
19:58
用户访问session分析:按session粒度进行数据聚合_转
59:34
用户访问session分析:按筛选参数对session粒度聚合数据进行过滤_转
39:52
用户访问session分析:session聚合统计之自定义Accumulator_转
24:33
用户访问session分析:session聚合统计之重构实现思路与重构session聚合_转
33:12
用户访问session分析:session聚合统计之重构过滤进行统计_转
17:33
用户访问session分析:session聚合统计之计算统计结果并写入MySQL_转
23:54
用户访问session分析:session聚合统计之本地测试_转
16:22
session聚合统计之使用Scala实现自定义Accumulator_转
14:22
session随机抽取之实现思路分析_转
10:48
session随机抽取之计算每天每小时session数量_转
17:23
session随机抽取之按时间比例随机抽取算法实现_转
22:22
session随机抽取之根据随机索引进行抽取_转
22:43
session随机抽取之获取抽取session的明细数据_转
17:50
session随机抽取之本地测试_转
12:13
top10热门品类之需求回顾以及实现思路分析_转
11:21
top10热门品类之获取session访问过的所有品类_转
14:32
top10热门品类之计算各品类点击、下单和支付的次数_转
20:21
top10热门品类之join品类与点击下单支付次数_转
17:30
top10热门品类之自定义二次排序key_转
08:23
top10热门品类之进行二次排序_转
04:55
top10热门品类之获取top10品类并写入MySQL_转
08:59
top10热门品类之本地测试_转
09:15
top10热门品类之使用Scala实现二次排序_转
05:16
top10活跃session之开发准备以及top10品类RDD生成_转
20:23
top10活跃session之计算top10品类被各sessoin点击的次数_转
12:41
top10活跃session之分组取TopN算法获取top10活跃session_转
18:28
top10活跃session之本地测试以及阶段总结_转
20:06
性能调优之在实际项目中分配更多资源_转
29:40
性能调优之在实际项目中调节并行度_转
43:26
性能调优之在实际项目中重构RDD架构以及RDD持久化_转
37:30
性能调优之在实际项目中广播大变量_转
43:51
性能调优之在实际项目中使用Kryo序列化_转
25:00
性能调优之在实际项目中使用fastutil优化数据格式_转
31:06
性能调优之在实际项目中调节数据本地化等待时长_转
26:40
JVM调优之原理概述以及降低cache操作的内存占比_转
44:07
JVM调优之调节executor堆外内存与连接等待时长_转
32:09
Shuffle调优之原理概述_转
24:36
Shuffle调优之合并map端输出文件_转
36:54
Shuffle调优之调节map端内存缓冲与reduce端内存占比_转
27:06
Shuffle调优之HashShuffleManager与SortShuffleManager_转
38:50
算子调优之MapPartitions提升Map类操作性能_转
14:22
算子调优之filter过后使用coalesce减少分区数量_转
16:07
算子调优之使用foreachPartition优化写数据库性能_转
19:21
算子调优之使用repartition解决Spark SQL低并行度的性能问题_转
21:23
算子调优之reduceByKey本地聚合介绍_转
16:38
troubleshooting之控制shuffle reduce端缓冲大小以避免OOM_转
20:41
troubleshooting之解决JVM GC导致的shuffle文件拉取失败_转
20:06
视频_转
17:46
troubleshooting之解决各种序列化导致的报错_转
09:20
troubleshooting之解决算子函数返回NULL导致的问题_转
05:28
troubleshooting之解决yarn-client模式导致的网卡流量激增问题_转
25:53
troubleshooting之解决yarn-cluster模式的JVM栈内存溢出问题_转
25:57
troubleshooting之错误的持久化方式以及checkpoint的使用_转
25:18
数据倾斜解决方案之原理以及现象分析_转
26:22
数据倾斜解决方案之聚合源数据以及过滤导致倾斜的key_转
29:36
数据倾斜解决方案之提高shuffle操作reduce并行度_转
18:47
数据倾斜解决方案之使用随机key实现双重聚合_转
16:29
数据倾斜解决方案之将reduce join转换为map join_转
21:27
数据倾斜解决方案之sample采样倾斜key进行两次join_转
38:43
数据倾斜解决方案之使用随机数以及扩容表进行join_转
24:47
页面单跳转化率:模块介绍_转
11:18
需求分析、技术方案设计、数据表设计_转
20:57
页面单跳转化率:编写基础代码_转
30:37
页面切片生成以及页面流匹配算法实现_转
30:40
计算页面流起始页面的pv_转
11:05
计算页面切片的转化率_转
10:36
将页面切片转化率写入MySQL_转
12:26
页面单跳转化率:本地测试_转
05:51
页面单跳转化率:生产环境测试_转
27:15
用户访问session分析:生产环境测试_转
14:18
各区域热门商品统计:模块介绍_转
43:59
需求分析、技术方案设计以及数据设计_转
18:47
各区域热门商品统计:查询用户指定日期范围内的点击行为数据_转
13:29
各区域热门商品统计:异构数据源之从MySQL中查询城市数据_转
10:45
各区域热门商品统计:关联城市信息以及RDD转换为DataFrame后注册临时表_转
12:39
各区域热门商品统计:开发自定义UDAF聚合函数之group_concat_distinct()_转
18:50
各区域热门商品统计:查询各区域各商品的点击次数并拼接城市列表_转
08:42
课程视频_转
11:24
各区域热门商品统计:使用开窗函数统计各区域的top3热门商品_转
08:37
各区域热门商品统计:使用内置case when函数给各个区域打上级别标记_转
05:31
各区域热门商品统计:将结果数据写入MySQL中_转
12:46
各区域热门商品统计:Spark SQL数据倾斜解决方案_转
31:01
各区域热门商品统计:本地测试_转
47:49
广告点击流量实时统计:需求分析、技术方案设计以及数据设计_转
32:11
第112讲-广告点击流量实时统计
26:35
广告点击流量实时统计:使用高性能方式将实时计算结果写入MySQL中_转
36:57
广告点击流量实时统计:过滤出每个batch中的黑名单用户_转
49:11
广告点击流量实时统计:计算每天各省各城市各广告的点击量_转
38:14
广告点击流量实时统计:计算每天各省的top3热门广告_转
35:06
广告点击流量实时统计:计算每天各广告最近1小时滑动窗口内的点击趋势_转
33:15
广告点击流量实时统计:实现实时计算程序的HA高可用性_转
19:15
广告点击流量实时统计:对实时计算程序进行性能调优_转
13:56
广告点击流量实时统计:生产环境测试_转
09:21
课程总结:都学到了什么?_转
25:21
Spark 2.0-新特性介绍_转
26:56
Spark 2.0-易用性:标准化SQL支持以及更合理的API_转
17:10
Spark 2.0-高性能:让Spark作为编译器来运行_转
13:18
Spark 2.0-新特性介绍-智能化:Structured Streaming介绍_转
09:55
Spark 2.0-新特性介绍-Spark 1.x的Volcano Iterator Model深度剖析_转
17:02
课程视频_转
14:26
Spark 2.0-Spark 2.x与1.x对比以及分析、学习建议以及使用建议_转
48:49
Spark 2.0-课程环境搭建:虚拟机、CentOS、Hadoop、Spark等_转
54:34
Spark 2.0-开发环境搭建:Eclipse+Maven+Scala+Spark_转
08:13
用户活跃度分析:模块介绍以及交互式用户行为分析系统的解释_转
19:11
用户活跃度分析:统计指定时间内访问次数最多的10个用户_转
24:51
统计指定时间内购买金额最多的10个用户_转
06:28
第135讲-基于Spark 2.0的用户活跃度分析:统计最近一个周期相比上一个周期访问次数增长最多的10个用户
11:30
第136讲-基于Spark 2.0的用户活跃度分析:统计最近一个周期相比上一个周期购买金额增长最多的10个用户
08:18
第137讲-基于Spark 2.0的用户活跃度分析:统计指定注册时间范围内头7天访问次数最高的10个用户
07:40
第138讲-基于Spark 2.0的用户活跃度分析:统计指定注册时间范围内头7天购买金额最高的10个用户
09:48
客服
顶部
赛事库 课堂 2021拜年纪