Back to skills
extension
Category: Data & AnalyticsNo API key required

spark-optimization

通过分区、缓存、Shuffle 优化和内存调优来优化 Apache Spark 作业。在改善 Spark 性能、调试慢作业或扩展数据处理管道时使用。

personAuthor: u_d4b8e350hubenterprise

Apache Spark 性能优化

  • 唯一标识:hub-spark-optimization
  • 显示名称:Apache Spark 性能优化
  • 能力摘要:针对 Apache Spark 的分区、shuffle、内存、倾斜、文件格式、join 和资源配置进行以指标为依据的生产优化,提高大规模数据作业的可靠性和效率。

案例素材

  1. 日志聚合任务在 reduce 阶段卡住。该 skill 会从 Spark UI 识别数据倾斜分区,采用盐值、预聚合或合适的 join 策略,并比较 shuffle 量与执行时间。
  2. 作业频繁 OOM。该 skill 会检查缓存、宽依赖、executor 内存和分区尺寸,移除不必要的 collect,改用 Parquet 列裁剪和更合理的并行度。
  3. 小文件导致云存储读取缓慢。该 skill 会通过压缩、合并输出和分区规划控制文件数量,验证下游查询没有因过度合并而失去并行读取能力。