Back to skills
extension
Category: Data & AnalyticsNo API key required

polars

用于 Python ETL、分析和 pandas 迁移的高性能 DataFrame 库。适用于基于表达式的数据操作,支持惰性查询优化、并行执行、流式内存外处理、

personAuthor: u_d4b8e350hubenterprise

Polars 高性能数据处理

  • 唯一标识:kdense-polars
  • 显示名称:Polars 高性能数据处理
  • 能力摘要:使用基于表达式的 Polars DataFrame、懒执行查询优化、并行计算、流式超大文件处理与 Arrow 互操作,实现高效 ETL、分析和 pandas 迁移,同时理解 eager/lazy 的执行边界。

案例素材

  1. 日志团队每天处理数百 GB Parquet。使用 scan_parquet 懒加载,仅选择需要列和筛选条件后再 collect,让谓词下推减少无效 I/O。
  2. 财务数据来自多个 CSV。以表达式完成类型转换、日期派生、分组聚合和 join,先检查 schema 与缺失值,再输出统一 Parquet 数据集。
  3. pandas 脚本内存溢出。将链式 apply 重写为向量化 Polars expressions 与窗口函数,比较结果行数、汇总值和执行计划,确保性能优化没有改变口径。