최근 발표된 연구 논문에서 '헤드 가드(HeadGuard)'라는 새로운 기술이 소개되었습니다. 이 기술은 시각-언어 모델(VLM)의 핵심 구성 요소인 키-값(KV) 캐시를 저비트(low-bit)로 양자화(quantization)하여 저장 공간을 크게 절약하면서도, 모델의 정확도 저하를 효과적으로 방지하는 것을 목표로 합니다. KV 캐시 양자화는 VLM을 더 효율적으로 배포하고 실행하는 데 필수적이지만, 지금까지는 정확도 손실이라는 큰 단점이 있었습니다.
헤드 가드는 기존의 KV 캐시 양자화 방식에 '선택적 헤드 보호' 기능을 추가하는 방식입니다. 구체적으로, 이미지 민감도(image-sensitivity)와 출력 민감도(output-sensitivity) 점수를 기반으로 오프라인에서 가장 중요한 물리적 KV 헤드 약 8분의 1을 식별합니다. 이렇게 보호된 헤드의 이미지 키(keys)와 선택적으로 값(values)은 bfloat16(BF16)과 같은 고정밀 형식으로 유지되고, 나머지 보호되지 않은 이미지 엔트리(entries)만 저비트로 양자화됩니다. 이 연구는 8개의 VLM, 3가지 기본 양자화 방식, 그리고 8가지 벤치마크(6개는 판별, 2개는 생성)에 걸쳐 헤드 가드를 평가했습니다. 그 결과, 특히 Qwen과 InternVL 같은 모델에서 약한 양자화 방식 사용 시 손실된 정확도를 상당 부분 회복하는 것을 확인했습니다. 예를 들어, 2비트 양자화 환경에서 가장 약한 기본 양자화 방식의 6가지 판별 작업 평균 정확도가 0.436에서 0.580으로 크게 향상되었습니다.
이 기술은 기존 양자화기를 교체할 필요 없이 VLM의 저비트 정확도를 개선할 수 있는 모듈식(composable) 방법을 제공한다는 점에서 중요합니다. 이는 VLM을 더 넓은 범위의 하드웨어와 환경에서 효율적으로 실행할 수 있게 하여, 모델 배포의 유연성을 크게 높일 수 있습니다. 특히, 제한된 메모리나 컴퓨팅 자원을 가진 환경에서 VLM을 활용하려는 개발자나 기업에게 큰 이점을 제공할 것입니다. 키(keys)만 보호하는 방식으로도 상당한 정확도 회복을 보여, 저장 비용을 더욱 절감할 수 있는 가능성도 제시합니다.