赵渝强apache spark rdd 的相关内容

文章 2025-02-19 来自：开发者社区

【赵渝强老师】Spark RDD的缓存机制

Spark RDD通过persist方法或cache方法可以将计算结果的缓存，但是并不是这两个方法被调用时立即缓存，而是触发后面的action时，该RDD才会被缓存在计算节点的内存中并供后面重用。下面是persist方法或cache方法的函数定义： def persist(): this...

文章 2025-02-01 来自：开发者社区

【赵渝强老师】Spark RDD的依赖关系和任务阶段

Spark RDD彼此之间会存在一定的依赖关系。依赖关系有两种不同的类型：窄依赖和宽依赖。窄依赖：如果父RDD的每一个分区最多只被一个子RDD的分区使用，这样的依赖关系就是窄依赖；宽依赖：如果父RDD的每一个分区被多个子RDD的分区使用，这样的依赖关系就是宽依赖。 map、filter、union等操作都是典型的窄依赖操作，...

文章 2024-11-14 来自：开发者社区

【赵渝强老师】Spark中的RDD

RDD（Resilient Distributed Dataset）叫做弹性分布式数据集，它是Spark中最基本、也是最重要的的数据模型。它由分区组成，每个分区被一个Spark的Worker从节点处理，从而支持分布式的并行计算。RDD通过检查点Checkpoint的方式提供自动容错的功能，并且具有位置感知性调度和可伸缩的特性。通过RDD也提供缓存的机制，可以极大地提高数据处理的速度。 &....