Back to skills
extension
Category: Data & AnalyticsNo API key required

polars

面向可放入内存的数据集的快速内存型 DataFrame 库。当 pandas 太慢但数据仍能放入内存时使用。惰性求值、并行执行、Apache Arrow 后端。

personAuthor: u_d4b8e350hubenterprise

Polars 高性能数据处理

  • 唯一标识:hub-polars
  • 显示名称:Polars 高性能数据处理
  • 能力摘要:用 Polars 的列式执行、惰性查询、表达式 API、流式处理与 Parquet 集成高效清洗、聚合和连接大规模表格数据。

案例素材

  1. 分析师每天合并数百个日志 CSV。该 skill 会使用 lazy scan 只读取所需列、先下推筛选再聚合,最终将中间结果落为 Parquet,避免一次性占满内存。
  2. 财务团队要对账订单和付款明细。该 skill 会明确 join 键的唯一性与缺失记录策略,在连接前标准化时间和货币字段,输出未匹配项供人工核对。
  3. 特征工程作业需要处理数亿行事件。该 skill 会将窗口计算、分组统计和数据类型转换写成可组合表达式,使用流式执行并抽样验证结果与既有基线一致。