대규모 언어모델(LLM)의 추론(inference) 속도와 메모리 효율을 높이는 핵심 기술 중 하나인 KV 캐시(Key-Value Cache) 압축에 있어, 파라미터 효율적인 미세조정(parameter-efficient fine-tuning) 방식에 대한 새로운 연구 결과가 발표되었습니다. 이 연구는 기존의 비교 방식이 가진 맹점을 지적하며, '디코더를 고정하고 인코더만 학습하는' 방식이 실제로는 다른 방식들과 동등한 성능을 내면서도 훨씬 효율적임을 밝혀냈습니다.
이 논문은 사후 SVD(Singular Value Decomposition) 기반 KV 캐시 압축이라는 구체적인 상황을 다룹니다. 이는 이미 사전 학습된 모델의 키(Key)와 값(Value) 가중치를 다운-프로젝션('인코더')과 업-프로젝션('디코더')으로 분해하여 저랭크(low-rank) 캐시로 변환하는 기술입니다. 압축으로 인한 정확도 손실을 복구하기 위해 짧은 미세조정('치유') 과정을 거치는데, 여기서 연구자들은 공통 학습률(shared learning rate)을 적용했을 때 파라미터 수가 적은 방식이 유리해 보이는 착시 현상을 발견했습니다. 하지만 각 방식에 최적화된 학습률을 개별적으로 적용하자, 인코더만 학습하는 방식(encoder-only healing)이 디코더나 양쪽 모두를 학습하는 방식과 동등한 성능을 달성하면서도 학습 가능한 파라미터 수를 3배, 최적화 도구(optimizer) 상태 메모리를 3배 절약하는 것으로 확인되었습니다. 이 결과는 시각-언어 모델(Qwen2.5-VL-3B-Instruct)과 텍스트 전용 모델에서 모두 검증되었습니다.
이번 연구는 미세조정 기법들을 비교할 때 학습 가능한 파라미터 수에 따라 각기 다른 최적의 학습률을 찾아 적용해야 한다는 중요한 교훈을 제시합니다. 인코더만 학습하는 방식은 메모리 효율이 뛰어나므로, 학습 시점에 저랭크 KV 캐시 압축을 적용하려는 경우 즉시 활용 가능한 효과적인 방법이 될 수 있습니다. 이는 LLM의 운영 비용을 절감하고 더 넓은 범위의 하드웨어에서 효율적인 추론을 가능하게 하여, AI 서비스 개발 및 배포에 긍정적인 영향을 미칠 것으로 기대됩니다.