최근 'MicroLLM 랩'이라는 흥미로운 실험 도구가 공개되어 IT 업계의 주목을 받고 있습니다. 이 도구는 사용자가 별도의 설치나 계정 생성 없이 웹 브라우저에서 직접 7가지 초소형 언어모델(SLM)을 실행하고, 성능을 비교하며 대화할 수 있게 합니다. PetitGPT, SmolLM2, MiniMind2, GPT-2 등 약 15MB에서 216MB 크기의 모델들을 다운로드하여 브라우저에 저장하고, 사용자 기기의 GPU를 활용해 추론을 수행하는 것이 핵심입니다.
MicroLLM 랩은 WebGPU 표준 API를 통해 브라우저에서 하드웨어 GPU의 컴퓨트 셰이더를 활용합니다. 이는 Apple Silicon의 Metal, DirectX 12, Vulkan 기반 GPU 실행을 가능하게 하여, WASM(WebAssembly) CPU 실행 대비 약 10~20배 빠른 100~300+ 토큰/초의 생성 속도를 제공합니다. 또한, Q4 양자화(quantization) 기술을 적용해 모델의 메모리 사용량을 75%까지 줄여, 1억 개 이상 매개변수 모델도 약 50~84MB의 브라우저 메모리에 담을 수 있도록 최적화했습니다. 사용자는 21가지 테스트를 통해 모델별 정답 통과율과 생성 속도를 비교하고, 256토큰 연속 생성으로 지속 처리 속도도 측정할 수 있으며, 결과를 이미지로 저장·공유하는 기능도 제공됩니다.
이러한 로컬 실행 방식은 프롬프트와 사용자 데이터가 외부 서버로 전송되지 않아 개인 정보 보호 및 보안 측면에서 큰 이점을 가집니다. 또한, 클라우드 기반 LLM API 사용료를 지불할 필요가 없어 비용 효율적입니다. 초소형 모델은 폭넓은 상식보다는 질의 분류, 스팸 필터링, 의도 추출 등 특정 작업과 효율적인 엣지(edge) 처리에 초점을 맞추고 있어, 고비용 클라우드 LLM 호출이 필요한지 판단하는 용도로 활용될 수 있습니다. 10ms 미만의 첫 토큰 지연 시간(TTFT)을 활용한 자동 완성이나 실시간 에이전트 구현 등 새로운 애플리케이션 개발 가능성도 열어줄 것으로 기대됩니다. 다만, 현재 제공되는 모델들의 답변 품질은 아직 초기 단계로, 기본적인 질문에도 부정확하거나 엉뚱한 답변을 내놓는 경우가 많아 실제 활용까지는 추가적인 연구와 개선이 필요해 보입니다.