18-7 基于 Apache Calcite 的多引擎指标管理最佳实践 谢佳君

2085
2
2023-09-18 19:53:48
36
23
98
8
数据分析中有着各种各样的指标,在维护海量指标的时候,常常有如下的痛点: 重复片段无法得到复用。 不同引擎需要编写不同的SQL。 口径变更难以同步到所有下游。 为了解决这些问题,字节跳动尝试过用已有的技术能力设计方案: 将指标尽可能地存储到 Hive 表中:会极大增大存储成本和回溯成本,不太可行。 将指标封装到View中:不仅会在Hive产生额外的表信息导致表数量翻倍,而且对分区的支持不友好。查询使用体验较差,因此难以推广。 因为目前已有的技术不足以解决上述问题,所以字节跳动基于Apache Calcite设计并实现了两套新的语法能力: 虚拟列:列级别的视图,复用表列权限,推广简单。 SQL Define Function:使用SQL直接定义函数,方便SQL片段的复用。 这两项能力结合,可以有效降低指标管理的成本例如: 指标仅需修改一次,无须下游再同步修改。 MAP、JSON等集合类型中的字段可以定义成虚拟列,逻辑更加清晰、使用更加方便。
Apache Local Community 北京本地社区
自动连播
6835播放
简介
18-1 由SSR和轻量级客户运行时驱动的Apache ECharts包大小革命 Ovilia
18:10
19-2 日志存储分析的数仓化 肖康
44:29
18-3 Apache Arrow DataFusion 极致性能的向量化执行框架 刘昆
28:20
18-5 Apache Doris 在衔远科技的应用实践 王永臣
12:47
18-7 基于 Apache Calcite 的多引擎指标管理最佳实践 谢佳君
53:08
20-5 小米基于Apache Doris的OLAP实践 魏祚
36:21
20-6 中国移动梧桐云原生分析型数据库架构分享 王小玉
40:39
20-3 Apache Druid 开源十年后的 26.x 大版本 金嘉怡
39:45
20-4 Kylin 5:现代化的大数据分析平台 俞霄翔
35:29
20-1 Apache Impala 在神策数据仓库中的最新实践 张倩琼
39:12
2.联邦跨平台SQL与Apache Wayang Kaustubh Beedkar
15:01
18-4 Apache Impala 4.2 & 4.3 版本新特性一览 黄权隆
35:33
客服
顶部
赛事库 课堂 2021拜年纪