대규모 언어모델(LLM)의 급격한 발전과 함께, 이들을 효율적으로 운영하기 위한 경량화 기술의 중요성이 커지고 있습니다. 최근 연구에 따르면, 모델 파라미터(parameter)를 줄이는 정적 압축과 토큰(token)별 계산량을 조절하는 동적 압축을 결합한 '복합 희소성(Compound Sparsity)' 기법이 기존 단일 압축 방식의 한계를 뛰어넘는 성능을 보여주었습니다.
이 연구는 먼저 저랭크 근사(low-rank approximation)와 채널 가지치기(channel pruning)를 통해 모델의 정적 압축을 진행합니다. 그 다음, 각 토큰(token)마다 특정 레이어(layer)를 건너뛸지 결정하는 경량 라우터(lightweight router)를 도입하여 동적 계산량 감소를 구현합니다. 이러한 복합적인 접근 방식은 파라미터 희소성과 토큰 수준 계산 희소성을 독립적으로 제어할 수 있게 하며, 동일한 총 희소성(total sparsity) 하에서 단일 메커니즘 압축보다 일관되게 우수한 성능을 나타냈습니다. 특히 언어 이해(language understanding) 작업에서 성능 저하 시점을 늦추고, 모델링(modeling) 성능을 더 강력하게 유지하는 효과를 보였습니다.
복합 희소성 기법은 LLM의 배포 비용을 획기적으로 낮추고, 더 넓은 범위의 하드웨어에서 효율적인 운영을 가능하게 할 잠재력을 가지고 있습니다. 이는 클라우드 환경뿐 아니라 온디바이스(on-device) AI와 같은 엣지 컴퓨팅(edge computing) 환경에서도 LLM을 활용할 수 있는 길을 열어줄 것입니다. 연구팀은 파라미터 가지치기와 토큰 건너뛰기 사이의 교차 차원 간섭(cross-dimensional interference)을 분석했으며, 고정된 희소성 예산(sparsity budget) 내에서는 이 두 가지 요소를 균형 있게 배분하는 것이 가장 효과적임을 밝혀냈습니다. 이는 향후 LLM 압축 연구의 새로운 방향을 제시하며, 궁극적인 압축 한계를 이해하는 데 중요한 통찰을 제공합니다.