19-2 字节跳动 MapReduce到Spark 平滑迁移实践 魏中佳

1894
0
2023-09-19 08:29:49
49
20
119
2
随着业务发展,字节跳动内部每天线上约运行 120万 个 Spark 作业,与之相对比的是,线上每天依然约有两万到三万个 MapReduce 任务。作为一个历史悠久的批处理框架,从大数据研发的角度来看,MapReduce 引擎的运维面临了一系列问题。例如,框架更新迭代的的 ROI 较低,对于新的计算调度框架适配性较差等等。而从用户的角度来看, MapReduce 引擎的使用也存在一系列的问题。例如,计算性能不佳,需要额外的 Pipeline 工具管理串行运行的 Job,希望迁移 Spark 但是存量作业数量多且大量作业使用了 Spark 本身不支持的各种脚本。在此背景下,字节跳动 Batch 团队设计并实现了一套 MapReduce 任务平滑迁移 Spark 的方案,该方案使用户仅需对存量作业增加少量的参数或环境变量即可完成从 MapReduce 到 Spark 的平缓迁移,大大降低了迁移成本,并且取得了不错的成本收益。
Apache Local Community 北京本地社区
7858播放
简介
18-1 最近和即将发布的HBase版本有哪些新特性 张铎
47:46
18-3 Spark SQL shuffle join在eBay的改进 王玉明
14:44
18-4 字节跳动千亿文件 HDFS 集群实践 熊睦
44:13
18-5 Apache Kyuubi & Celeborn(Incubating) 助力 Spark 拥抱云原生 潘成
40:25
18-7 Linkis 在理想汽车的应用实践 郗世豪
22:12
19-1 数据安全:Apache Ozone 如何保证数据的存储和访问安全 陈怡
43:58
19-2 字节跳动 MapReduce到Spark 平滑迁移实践 魏中佳
32:46
19-5 Apache Celeborn(Incubating)让 Spark 和 Flink 更快更稳更弹性 周克勇
28:13
19-6 基于Apache Linkis快速高效构建数据应用工具 王和平
30:33
19-3 Apache Kudu 在神策的应用和实践 汪细勖
24:04
19-4 小米 HDFS 数据治理实践与演进 王成伟
25:05
18-6 弹性数据-探索Apache Ozone中的复制和恢复 Sadanand Shenoy
29:37
18-2 深入了解Ozone存储中的资源可管理性 SUMIT AGRAWAL
21:06
7.如何在Apache Cassandra中增加分区大小可以减少超过30%的磁盘使用 John Del Castillo
26:09
客服
顶部
赛事库 课堂 2021拜年纪