대규모 언어모델(LLM) 에이전트가 데이터 과학 워크플로우 자동화의 새로운 지평을 열고 있지만, 그 잠재력을 온전히 발휘하기 위해서는 핵심적인 요소가 필요합니다. 바로 '에이전트 하네스(agent harness)'입니다. 이 하네스는 에이전트가 작업을 수행하고, 실행 상태를 관리하며, 결과물을 제약하고, 평가 피드백을 제공하는 전반적인 프레임워크를 의미합니다. 기존 데이터 과학 에이전트들은 이 하네스 설계가 암묵적으로 이루어져 있어, 다양한 작업에서 결과를 재현하고 비교하며 그 원인을 파악하기 어렵다는 한계가 있었습니다.
이러한 문제를 해결하기 위해 'DS-Lighting'이라는 통합 하네스 툴킷이 등장했습니다. DS-Lighting은 에이전트 하네스 설계를 명시적으로 만들어 데이터 과학 자동화의 효율성을 극대화합니다. 이 툴킷은 하네스를 데이터, 워크플로우, 실행, 평가의 네 가지 재사용 가능한 계층으로 분해합니다. 이를 통해 다양한 에이전트를 미리 정의된 파이프라인과 적응형 탐색을 모두 지원하는 실행 가능한 연산자 프로그램으로 표현할 수 있습니다. 또한, DS-Lighting은 여러 오픈소스 데이터 과학 벤치마크를 MLE-Bench 스타일의 작업 형식으로 통합하여, 공유된 작업 인터페이스, 샌드박스 런타임, 측정 프로토콜 하에서 통제된 비교를 가능하게 합니다.
DS-Lighting의 실험 결과는 명시적인 하네스 설계가 재현성, 비교 가능성, 신뢰성을 크게 향상시키고, 종단 간(end-to-end) 데이터 과학 워크플로우에서 피할 수 있는 시스템 수준의 오류를 줄여준다는 것을 보여줍니다. 이는 데이터 과학자들이 더욱 효율적이고 안정적으로 작업을 자동화하고, 에이전트의 성능을 정확하게 평가하며 개선할 수 있는 기반을 마련합니다. 궁극적으로 DS-Lighting은 LLM 에이전트 기반 데이터 과학 자동화의 신뢰도를 높이고, 연구 및 실제 적용 분야에서 더 넓은 활용 가능성을 열어줄 것으로 기대됩니다.