Back to skills
extension
Category: Data & AnalyticsNo API key required

cupynumeric-parallel-data-load

通过手动分区 + 带 CPU/OMP/GPU 变体的 leaf @task 启动,将分片磁盘数据集(分片 .npy、Parquet/Arrow、原始二进制、分片

personAuthor: u_d4b8e350hubenterprise

cuPyNumeric 分片数据并行加载

  • 唯一标识:cupynumeric-parallel-data-load
  • 显示名称:cuPyNumeric 分片数据并行加载
  • 能力摘要:针对多文件 .npy、Parquet/Arrow、原始二进制、分片 HDF5 或自定义布局,使用 Legate 分区与任务启动并行填充分布式 cuPyNumeric 数组;对单文件 .npy 和 HDF5 优先采用内建加载器。

案例素材

  1. 遥感数据按日期生成不同长度的 .npy 分片,预先读取元数据确认 dtype 和尾部形状一致,再按 axis 0 划分全局数组,由多个 GPU 任务各自加载分片。
  2. 数据仓库只能导出 Parquet,任务体使用相应读取器将各分区转换为连续数组块;分区数按机器处理器而非文件个数设定,避免少文件限制 GPU 利用率。
  3. 单一 HDF5 文件时不重复实现自定义加载器,而直接使用 HDF5 技能的分布式 API;加载后验证全局 shape、每分片偏移和无缺口覆盖。