Polars 高性能数据处理
- 唯一标识:
kdense-polars - 显示名称:Polars 高性能数据处理
- 能力摘要:使用基于表达式的 Polars DataFrame、懒执行查询优化、并行计算、流式超大文件处理与 Arrow 互操作,实现高效 ETL、分析和 pandas 迁移,同时理解 eager/lazy 的执行边界。
案例素材
- 日志团队每天处理数百 GB Parquet。使用
scan_parquet懒加载,仅选择需要列和筛选条件后再collect,让谓词下推减少无效 I/O。 - 财务数据来自多个 CSV。以表达式完成类型转换、日期派生、分组聚合和 join,先检查 schema 与缺失值,再输出统一 Parquet 数据集。
- pandas 脚本内存溢出。将链式
apply重写为向量化 Polars expressions 与窗口函数,比较结果行数、汇总值和执行计划,确保性能优化没有改变口径。
微信扫一扫