Spark中的数据倾斜是指什么

lewis 2020-01-27 25次阅读

Spark中的数据倾斜是指在数据处理过程中，部分数据分区中的数据量远远超过其他分区，导致任务的执行时间不均匀，部分节点负载过重，影响整个作业的性能。数据倾斜通常发生在数据分布不均匀或者数据倾斜的key在聚合操作中频繁出现的情况下。解决数据倾斜可以采取一些策略，比如使用更合适的分区策略、对数据进行预处理、采用自定义分区函数等。