대규모 언어모델(LLM)은 개별 문서 분석에는 탁월하지만, 기업 규모의 방대한 데이터셋에서 여러 엔티티(entity)에 걸친 복잡한 분석 질문에는 취약했습니다. 컨텍스트 오버플로우, 개별 엔티티 속성 손실, 그리고 순차적인 도구 호출로 인한 선형적인 지연 시간 등이 주요 원인이었습니다. 이러한 한계를 극복하기 위해, LLM이 데이터 분석 작업을 효율적으로 계획하고 실행할 수 있도록 돕는 새로운 시스템 'BatchDAG'가 등장했습니다.
BatchDAG는 LLM이 SQL 쿼리, 시맨틱 검색, 인메모리 변환, 병렬 팬아웃(fan-out), 단일 분석 등 다양한 작업을 포함하는 '유형 지정 방향 비순환 그래프(typed directed acyclic graph, DAG)'를 생성하는 시스템입니다. 이 DAG는 결정론적 엔진에 의해 위상학적 파동 병렬 처리(topological-wave parallelism) 방식으로 평가되며, 구조화된 JSON 데이터 흐름을 활용합니다. 핵심 최적화 기법 중 하나인 '엔티티 인식 배치(entity-aware batching)'는 논리적 엔티티별로 행을 그룹화하여 LLM 호출 횟수를 최대 47배까지 줄여줍니다. BatchDAG는 수동으로 최적화된 파이프라인보다 정확도가 월등히 높다기보다는, 여러 수동 엔지니어링 워크플로우를 자연어 명령만으로 적절한 실행 전략을 생성하는 단일 시스템으로 대체하는 범용 오케스트레이션(orchestration) 계층에 가깝습니다.
실험 결과, BatchDAG는 전문가가 설계한 파이프라인과 유사한 품질(3.74/5 vs 3.25/5)을 달성했으며, ReAct 에이전트(3.09/5)를 크게 능가했습니다. 특히, 77%의 높은 기록 증거율(provenance)을 보여 데이터 출처 추적성(traceability)이 우수했습니다. 구조화된 JSON 중간 데이터는 산출물 환각(hallucination)을 27% 감소시키는 효과도 있었습니다. 이 시스템은 이미 한 회사에서 50,000개 이상의 회의록을 60초 이내에 처리하며, GPT-5.1 가격 기준으로 쿼리당 0.02~0.24달러의 비용으로 운영되고 있습니다. 이는 LLM을 활용한 기업 데이터 분석의 확장성과 효율성을 크게 개선하여, 복잡한 비즈니스 질문에 대한 심층적인 통찰력을 훨씬 빠르고 저렴하게 얻을 수 있게 할 잠재력을 보여줍니다.