文章 2024-03-12 来自:开发者社区

一文了解Apache Hudi架构、工具和最佳实践

1. 什么是Hudi? Apache Hudi代表Hadoop Upserts anD Incrementals,管理大型分析数据集在HDFS上的存储。Hudi的主要目的是高效减少摄取过程中的数据延迟。由Uber开发并开源,HDFS上的分析数据集通过两种类型的表提供服务:读优化表(Read Optimized Table)和近实时表(Near-Real-Time Table)。 ...

一文了解Apache Hudi架构、工具和最佳实践
文章 2024-03-12 来自:开发者社区

OnZoom基于Apache Hudi的流批一体架构实践

1. 背景 OnZoom是Zoom新产品,是基于Zoom Meeting的一个独一无二的在线活动平台和市场。作为Zoom统一通信平台的延伸,OnZoom是一个综合性解决方案,为付费的Zoom用户提供创建、主持和盈利的活动,如健身课、音乐会、站立表演或即兴表演,以及Zoom会议平台上的音乐课程。 ...

OnZoom基于Apache Hudi的流批一体架构实践
文章 2022-05-07 来自:开发者社区

OnZoom 基于Apache Hudi的流批一体架构实践

1. 背景OnZoom是Zoom新产品,是基于Zoom Meeting的一个独一无二的在线活动平台和市场。作为Zoom统一通信平台的延伸,OnZoom是一个综合性解决方案,为付费的Zoom用户提供创建、主持和盈利的活动,如健身课、音乐会、站立表演或即兴表演,以及Zoom会议平台上的音乐课程。在OnZoom data platform中,source数据主要分为MySQL DB数据和Log数据。 ....

OnZoom 基于Apache Hudi的流批一体架构实践
文章 2022-05-07 来自:开发者社区

触宝科技基于Apache Hudi的流批一体架构实践

1. 前言当前公司的大数据实时链路如下图,数据源是MySQL数据库,然后通过Binlog Query的方式消费或者直接客户端采集到Kafka,最终通过基于Spark/Flink实现的批流一体计算引擎处理,最后输出到下游对应的存储。2. 模型特征架构的演进2.1 第一代架构广告业务发展初期,为了提升策略迭代效率,整理出一套通用的特征生产框架,该框架由三部分组成:特征统计、特征推送和特征获取模型训练....

触宝科技基于Apache Hudi的流批一体架构实践
文章 2022-05-06 来自:开发者社区

Apache Hudi 设计与架构最强解读

1.简介Apache Hudi(简称:Hudi)使得您能在hadoop兼容的存储之上存储大量数据,同时它还提供两种原语,使得除了经典的批处理之外,还可以在数据湖上进行流处理。这两种原语分别是:Update/Delete记录:Hudi使用细粒度的文件/记录级别索引来支持Update/Delete记录,同时还提供写操作的事务保证。查询会处理最后一个提交的快照,并基于此输出结果。变更流:Hudi对获取....

Apache Hudi 设计与架构最强解读
文章 2020-04-16 来自:开发者社区

Apache Hudi 设计与架构最强解读

Apache Hudi 设计与架构最强解读 感谢 Apache Hudi contributor:王祥虎 翻译&供稿。 欢迎关注微信公众号:ApacheHudi 本文将介绍Apache Hudi的基本概念、设计以及总体基础架构。 1.简介Apache Hudi(简称:Hudi)使得您能在hadoop兼容的存储之上存储大量数据,同时它还提供两种原语,使得除了经典的批处理之外,还可以...

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

产品推荐

Apache Spark 中国技术社区

阿里巴巴开源大数据技术团队成立 Apache Spark 中国技术社区,定期推送精彩案例,问答区数个 Spark 技术同学每日在线答疑,只为营造 Spark 技术交流氛围,欢迎加入!

+关注
相关镜像