스펙트라 랩스(Spectra Labs)가 대규모 언어모델(LLM) 미세조정(fine-tuning) 과정에서 발생하는 VRAM(비디오 램) 병목 현상을 획기적으로 줄여주는 새로운 최적화 도구 '스펙트라AdamW(SpectraAdamW)'를 발표했습니다. 이 기술은 기존 AdamW 옵티마이저(optimizer)가 사용하는 메모리의 절반만으로도 LLM을 훈련할 수 있게 하여, 특히 소비자용 하드웨어에서 LLM을 다루는 연구자나 개발자에게 큰 도움이 될 것으로 기대됩니다.
LLM 미세조정 시 가장 큰 메모리 병목은 모델 가중치(weights) 자체가 아니라, 훈련 과정에서 사용되는 옵티마이저 상태(optimizer states)입니다. 표준 AdamW 옵티마이저는 모멘텀(momentum)과 분산(variance)이라는 두 가지 거대한 상태 텐서(tensor)를 저장해야 하는데, 이는 모델 파라미터(parameters) 크기의 두 배에 달하는 VRAM을 소모합니다. 스펙트라AdamW는 이러한 문제를 해결하기 위해 '인수 분해된 분산 근사(Factorized Variance Approximation, FVA)'와 '주파수 영역 모멘텀 압축(Frequency-Domain Momentum Compression)'이라는 두 가지 핵심 방법론을 사용합니다. FVA는 2D 가중치 행렬의 분산을 행과 열의 평균으로 분해하여 메모리 사용량을 크게 줄이고, 주파수 영역 모멘텀 압축은 빠른 푸리에 변환(FFT)을 통해 모멘텀의 고주파 신호만 남겨 압축하는 방식입니다. 이를 통해 옵티마이저 상태 오버헤드를 정확히 50% 절감합니다.
스펙트라AdamW는 8192차원 트랜스포머(Transformer) 레이어 업데이트 시뮬레이션에서 AdamW의 256MB VRAM 사용량을 128.16MB로 절반 줄이는 것을 입증했습니다. 또한, 손실 곡선(loss curves)은 기존 AdamW와 완벽하게 일치하는 수렴(convergence) 성능을 보여, 공격적인 양자화(quantization) 방식에서 흔히 나타나는 수렴 지연 문제를 피했습니다. 이는 메모리 효율성을 높이면서도 모델 훈련의 안정성과 성능을 그대로 유지할 수 있음을 의미합니다. 현재 파이썬(Python) 기반의 최소 기능 제품(MVP)이 공개되어 있으며, C++ CUDA 백엔드는 클로즈드 베타(closed beta) 형태로 개발 중입니다. 이 기술은 8B(80억) 파라미터 모델 미세조정 시 필요한 VRAM을 32GB에서 16GB로 줄일 수 있어, 더 많은 개발자가 고성능 LLM을 개인 장비에서도 다룰 수 있는 기회를 제공할 것입니다.