그래픽 처리 장치(GPU)는 세대별로 행렬, 특수 함수, 메모리 파이프라인의 확장 속도가 달라 하드웨어 진화에 따라 연산 병목 현상이 이동합니다. 최근 엔비디아 블랙웰(NVIDIA Blackwell) GPU에서 플래시어텐션-4(FlashAttention-4)가 어텐션(attention) 내부의 이러한 불균형을 드러낸 가운데, 새로운 연구는 대규모 언어모델(LLM)의 다른 특수 함수 연산(SFU)에서도 짧은 다항식 프로그램이 가속화를 가져올 수 있는지 탐구했습니다.
로버트 후(Robert Hu)의 연구에 따르면, 시그모이드(sigmoid), 탄젠트 하이퍼볼릭(tanh), 시그모이드 선형 단위(SiLU)와 같은 LLM의 특수 함수를 3차 또는 4차 다항식 프로그램으로 대체하는 실험이 진행되었습니다. 이 다항식 프로그램은 분석적 대칭성, 목표 형식 반올림, 그리고 패킹된 연산(packed arithmetic)을 활용하여 기존 PyTorch 연산 대비 성능을 개선했습니다. 특히, L2 캐시(L2-resident) 환경에서 1.19~2.19배, 고대역폭 메모리(HBM-resident) 환경에서 1.00~1.70배의 개별 경로 개선을 보였습니다.
실제 LLM 통합 테스트에서는 밀집 SiLU(dense SiLU) 연산이 2.7%, 탄젠트 하이퍼볼릭 소프트캡 어텐션(tanh-softcapped attention)이 2.9%, 라우티드-익스퍼트 스위시-게이티드 선형 단위(routed-expert SwiGLU)가 8.0%의 전체 학습 단계 처리량(throughput) 개선을 달성했습니다. 시그모이드 어텐션(sigmoid attention)은 전체 어텐션 순방향(forward) 처리량을 7.4% 향상시키고, 전체 GPU 단계에서는 0.3%의 개선을 보였습니다. 이러한 최적화는 1000억 토큰(token) 학습 후에도 모델의 최종 학습 손실(training loss)에 미미한 차이만을 보여, 성능 향상과 모델 정확도 유지라는 두 마리 토끼를 잡을 수 있음을 시사합니다.
이러한 연구 결과는 LLM의 연산 효율성을 높이는 중요한 방향을 제시합니다. GPU 하드웨어의 발전 속도에 맞춰 소프트웨어 스택을 최적화하는 것은 LLM의 학습 및 추론 비용을 절감하고, 더 크고 복잡한 모델을 개발하는 데 필수적입니다. 특히, 미세한 연산 단위에서의 최적화가 전체 시스템 성능에 상당한 영향을 미칠 수 있음을 보여주며, 향후 LLM 개발 및 배포에 있어 하드웨어-소프트웨어 공동 설계의 중요성을 강조합니다.
