최근 Kimi와 Qwen 같은 대규모 언어모델(LLM)의 핵심 기술로 주목받는 선형 어텐션(linear attention)의 복잡한 변형인 DeltaNet 계열에 대한 심층 분석이 공개되었습니다. 이 글은 기존 어텐션 메커니즘의 비효율성을 극복하기 위해 DeltaNet이 어떻게 발전해왔는지, 그리고 그 복잡한 수식 뒤에 숨겨진 간단한 아이디어를 단계별로 설명합니다.
일반적인 어텐션(attention)은 쿼리(query)와 모든 이전 키(key) 간의 유사도를 계산하여 가중치를 부여하고, 이를 값(value) 벡터에 곱해 출력(output)을 만듭니다. 이 과정에서 시퀀스 길이가 길어질수록 계산량이 제곱(quadratic)으로 증가하는 문제가 있습니다. 특히 소프트맥스(softmax) 함수는 모든 이전 토큰에 대한 의존성을 만들어 병렬화와 효율적인 캐싱을 어렵게 합니다. DeltaNet은 이러한 문제를 해결하기 위해 소프트맥스를 제거하고, 과거 정보를 고정된 크기의 상태 행렬(state matrix)에 축적하는 방식으로 계산 복잡도를 선형(linear)으로 줄입니다. 이는 매 단계마다 새로운 키와 값을 상태 행렬에 더하고, 이 상태 행렬과 현재 쿼리를 곱하여 출력을 얻는 재귀적인(recurrent) 방식으로 작동합니다. DeltaNet은 이 기본 아이디어에서 시작하여 Gated DeltaNet, Kimi Delta Attention(KDA) 등으로 발전하며 성능과 효율성을 모두 잡으려 합니다.
이러한 선형 어텐션의 발전은 LLM의 추론(inference) 속도와 메모리 효율성을 크게 향상시키는 데 기여합니다. 특히 긴 시퀀스를 처리해야 하는 경우, 기존 어텐션의 제곱 복잡도는 실용적인 한계를 가져왔습니다. DeltaNet과 같은 선형 어텐션 변형은 이러한 병목 현상을 완화하여 더 길고 복잡한 텍스트를 효율적으로 이해하고 생성할 수 있게 합니다. 이는 LLM의 실제 적용 범위를 넓히고 사용자 경험을 개선하는 데 중요한 역할을 합니다.