새로운 AI-SQL 엔진인 퀘일(Quail)이 SQL 쿼리 내에서 AI 모델 추론을 대규모로 실행할 때 발생하는 병목 현상을 해결하며 데이터 분석 속도를 크게 향상했습니다. 퀘일은 문서 분류나 문서 간 관계 판별 등 AI 기능을 SQL에 통합하여 수십만에서 수백만 번에 달하는 모델 호출을 효율적으로 처리합니다. 이는 기존의 개별 추론 요청 방식이 가진 비효율성을 극복하고, AI 기반 데이터 분석의 새로운 가능성을 열고 있습니다.
퀘일의 핵심은 쿼리 실행 계획과 모델 추론 과정을 함께 최적화하는 데 있습니다. 기존 시스템은 대량의 추론 요청을 범용 추론 엔진에 개별적으로 보내면서 CPU의 요청 관리와 반복 계산에서 병목이 발생했습니다. 반면 퀘일은 어떤 필터와 조인을 먼저 실행할지뿐만 아니라, 어떤 문서의 KV(Key-Value) 캐시를 언제까지 보존할지까지 결정하여 불필요한 반복 계산을 줄입니다. 예를 들어, 긴 의료 보고서를 여러 번 비교하는 쿼리에서는 vLLM 대비 14.04배 빠른 성능을 기록했으며, 10만 건의 영화 리뷰를 분석하는 데 약 5분 35초와 0.37달러의 GPU 비용으로 작업을 완료했습니다. 이는 Snowflake Cortex AISQL, BigQuery, Databricks 등에서 지원하는 AI-SQL 기능의 성능 한계를 뛰어넘는 결과입니다.
이러한 최적화는 AI를 활용한 대규모 데이터 분석의 접근성과 효율성을 크게 높일 것입니다. 퀘일은 평가, 라벨링, 에이전트 실행 기록 압축, 대규모 데이터 변환 등 다양한 분야에서 LLM(대규모 언어 모델)의 활용도를 확장할 수 있습니다. 특히, 긴 답변 생성보다는 데이터셋 전체에 걸쳐 수천~수백만 번의 빠르고 정확한 판정이 필요한 경우에 강력한 이점을 제공합니다. 퀘일은 MIT 라이선스로 공개되어 있으며, 향후 MacBook용 소형 모델 지원, CPU 메모리 및 SSD를 활용한 캐시 보관, 행 간 접두사 재사용 기능 등 지속적인 개선을 통해 더 넓은 범위의 사용자와 환경에서 AI-SQL의 이점을 제공할 것으로 기대됩니다.