Apache Spark 性能优化
- 唯一标识:
hub-spark-optimization - 显示名称:Apache Spark 性能优化
- 能力摘要:针对 Apache Spark 的分区、shuffle、内存、倾斜、文件格式、join 和资源配置进行以指标为依据的生产优化,提高大规模数据作业的可靠性和效率。
案例素材
- 日志聚合任务在 reduce 阶段卡住。该 skill 会从 Spark UI 识别数据倾斜分区,采用盐值、预聚合或合适的 join 策略,并比较 shuffle 量与执行时间。
- 作业频繁 OOM。该 skill 会检查缓存、宽依赖、executor 内存和分区尺寸,移除不必要的 collect,改用 Parquet 列裁剪和更合理的并行度。
- 小文件导致云存储读取缓慢。该 skill 会通过压缩、合并输出和分区规划控制文件数量,验证下游查询没有因过度合并而失去并行读取能力。
Scan to join WeChat group