최근 ESP32-S3 마이크로컨트롤러 7대를 클러스터로 묶어 0.5B(5억 개) 매개변수의 1.58비트(BitNet) 언어 모델을 분산 실행하는 오픈소스 프로젝트가 공개되어 주목받고 있습니다. 이 시스템은 마스터 보드 1대와 연산 노드 6대로 구성되며, 마스터는 사용자 입력 처리, 토큰화(tokenization), 임베딩(embedding)을 담당하고, 연산 노드들은 트랜스포머(Transformer) 계층을 나눠 추론하는 파이프라인 구조를 가집니다.
각 연산 노드는 트랜스포머 블록 4개씩을 처리하며, 노드 간에는 고속 SPI(Serial Peripheral Interface) 데이지 체인 방식으로 데이터를 주고받습니다. 특히, 이 프로젝트는 1.58비트 BitNet 방식의 삼진 가중치와 INT4 임베딩을 사용해 모델을 극도로 압축했습니다. 덕분에 각 연산 보드의 16MB 플래시 메모리에 약 15.3MB의 가중치를 저장할 수 있었으며, 어셈블리 최적화를 통해 곱셈 누산(MAC) 연산의 효율을 높였습니다. 이 프로젝트는 펌웨어, 모델 양자화(quantization), 학습, 배선, 보드 기록 도구 및 상세한 안내를 MIT 라이선스로 모두 공개했습니다.
이러한 시도는 저전력, 저비용 마이크로컨트롤러 환경에서 대규모 언어모델(LLM)을 구동할 수 있는 잠재력을 보여줍니다. 비록 현재 제공된 학습 스크립트로는 실용적인 대화 모델을 만들기 어렵고 무작위 토큰을 출력할 수 있지만, 이는 작은 보드에서 분산 추론(distributed inference)을 구현하는 중요한 실험적 진전입니다. 메모리 대역폭이 LLM의 주요 병목 현상으로 지적되는 상황에서, 여러 저가형 칩을 병렬 연결하여 이 문제를 우회하려는 접근 방식은 미래의 엣지 AI(Edge AI) 및 사물 인터넷(IoT) 기기에 LLM을 통합하는 데 중요한 단초를 제공할 수 있습니다.