최근 연구에서 대규모 언어모델(LLM)의 핵심 요소인 어텐션(attention) 메커니즘의 효율성을 획기적으로 개선할 수 있는 새로운 방법이 제시되었습니다. 기존의 점곱(dot-product) 어텐션을 주파수 대역 필터링된 내적(inner product)으로 대체하는 '주파수 붕괴 어텐션(Frequency-collapse attention)' 방식이 표준 어텐션 대비 상당한 성능 향상을 가져온다는 것입니다.
이 연구는 어떤 필터 형태가 가장 효과적인지 밝히기 위해 DC 억제, 나이퀴스트 억제, 대역폭, 중심 주파수, 다중 스케일 커버리지 등 다섯 가지 필터 속성을 심층적으로 분석했습니다. 특히, DC 및 나이퀴스트 주파수 성분이 모델 성능에 해롭다는 점을 확인했으며, 최적의 단일 스케일 대역폭은 문단 스케일(약 70 토큰)에 중심을 둔 약 2개의 빈(bin)이라는 결과를 얻었습니다. 이는 기존 어텐션 방식 대비 1.15 나트(nats)의 성능 향상을 가져왔습니다. 또한, 제로 평균(zero-mean)을 갖는 '허용 가능한 필터(admissible filters)'가 비허용 필터보다 우수하며, 양측 FFT 누설(leakage)에 대한 부분적 보호 기능을 제공함이 밝혀졌습니다.
이러한 발견은 어텐션 메커니즘을 단순히 토큰 간 유사도를 계산하는 것을 넘어, 주파수 영역에서 정보를 처리하는 방식으로 진화시킬 수 있음을 시사합니다. 특히, 양방향 어텐션(bidirectional attention) 설정(예: BERT와 같은 인코더 스타일)에서 효과적이며, 완전한 시퀀스 컨텍스트(full-sequence context)를 훈련 및 추론 시 모두 활용할 수 있는 경우에 강력한 성능을 발휘합니다. 이는 LLM의 효율성과 성능을 한 단계 끌어올릴 잠재력을 가지며, 향후 모델 설계에 중요한 영향을 미칠 것으로 예상됩니다.
