고성능 데이터프레임 라이브러리 Polars 2.0이 공식 출시되며 데이터 처리의 효율성과 안정성을 대폭 끌어올렸습니다. 특히 LazyFrame.collect()의 기본 실행 엔진이 스트리밍 엔진으로 변경되고, 메모리가 부족할 때 데이터를 디스크로 내보내는 아웃오브코어(out-of-core) 기능이 기본 활성화된 것이 핵심입니다. 이로 인해 대부분의 쿼리에서 메모리 사용량이 줄고 성능이 개선되어 대규모 데이터셋을 다루는 사용자들에게 희소식이 될 전망입니다.
Polars 2.0은 SQL을 일급 기능으로 지원하며 최적화기와 실행 엔진을 개선해 TPC-H/TPC-DS 파생 벤치마크에서 DuckDB 등 경쟁자 대비 우수한 성능을 보였습니다. 또한 Arrow MapType을 직접 지원하는 Map 데이터 타입을 추가하여 딕셔너리 형태의 데이터 연산을 더욱 편리하게 수행할 수 있게 되었습니다. 데이터 불일치 처리를 더 엄격하게 만들어 오류를 조기에 발견하도록 돕고, collect_schema() 기능을 통해 실제 데이터 처리 없이 스키마를 검증하여 개발 및 AI 에이전트의 반복 작업을 가속화할 수 있습니다.
이번 업데이트는 특히 대규모 데이터 처리 환경에서 Polars의 입지를 더욱 공고히 할 것으로 보입니다. 스트리밍 엔진과 아웃오브코어 기능의 기본 활성화는 메모리 제약이 있는 환경에서도 대용량 데이터를 안정적으로 처리할 수 있게 하며, 향후 조인(join) 및 그룹바이(group_by) 연산에도 아웃오브코어 지원이 확대될 예정입니다. 이러한 개선은 기존 Pandas 사용자들이 Polars로 전환하는 중요한 동기가 될 것이며, 데이터 분석 및 머신러닝 분야에서 고성능 데이터 처리 라이브러리의 표준으로 자리매김하는 데 기여할 것입니다.