새로운 오픈소스 AI 의사결정 엔진 '스냅(Snap)'이 공개되어, 대규모 언어모델(LLM) 활용 방식에 새로운 가능성을 제시하고 있습니다. 스냅은 텍스트를 생성하지 않고, 사용자가 입력한 데이터와 질문에 대해 단 한 번의 모델 실행(forward pass)으로 유형화된 답변과 전체 확률 분포를 제공하는 것이 특징입니다. 이를 통해 로컬 환경에서 초고속으로 의사결정을 내릴 수 있어, 특히 민감한 데이터를 다루는 경우나 실시간 응답이 중요한 애플리케이션에 유용합니다.
스냅은 기존 LLM이 답변을 생성하기 위해 여러 토큰을 순차적으로 예측하는 방식과 달리, 질문을 단일 글자 답변으로 변환하고 해당 글자의 로짓(logit) 점수를 직접 읽어냅니다. 예를 들어, '어떤 팀이 먼저 맡아야 하는가? A. 청구 B. 인증 C. 기술 D. 영업'과 같은 질문에 대해 모델은 'A', 'B', 'C', 'D' 각 글자에 대한 확률을 한 번에 계산하여 가장 높은 확률의 글자를 선택합니다. 이 과정에서 텍스트 생성 과정이 없어 파싱, 재시도, 정리 등의 추가 작업이 필요 없으며, 이는 응답 속도와 효율성 면에서 큰 이점을 제공합니다. 또한, 여러 질문을 한 번의 배치 처리(batched decode)로 동시에 처리할 수 있어, 여러 단계의 의사결정이 필요한 경우에도 뛰어난 성능을 발휘합니다.
스냅은 맥(macOS), 리눅스(Linux), 윈도우(Windows) 등 다양한 운영체제에서 로컬로 실행 가능하며, 'brew install emnlmn/snap/snap' 명령어로 쉽게 설치할 수 있습니다. 특히 애플 M1 Max 칩에서 미니CPM5-2B(MiniCPM5-2B) 모델을 사용했을 때, 올라마(Ollama)나 오픈AI(OpenAI)의 GPT-6-루나(GPT-6-Luna)와 비교하여 훨씬 빠른 응답 속도를 보여주었습니다. 이는 스냅이 텍스트를 생성하지 않고 로짓만 읽는 독특한 접근 방식 덕분입니다. 또한, 스냅은 프롬프트 주입(prompt injection)과 같은 보안 위협으로부터도 자유롭습니다. 텍스트를 생성하지 않으므로 의도치 않은 시스템 프롬프트 유출이나 악성 코드 삽입이 불가능하며, 응답 스키마가 서버에 의해 고정되어 있어 데이터 유출 위험이 현저히 낮습니다.
이러한 스냅의 등장은 LLM 기반 애플리케이션 개발 방식에 중요한 변화를 가져올 수 있습니다. 특히 데이터 보안과 개인 정보 보호가 중요한 산업 분야에서 LLM을 활용하려는 기업들에게 매력적인 대안이 될 것입니다. 로컬에서 모든 처리가 이루어지므로 외부 API 의존성을 줄이고, 데이터 유출 위험 없이 민감한 정보를 처리할 수 있습니다. 또한, 텍스트 생성 비용을 절감하고 응답 속도를 극대화하여 실시간 의사결정이 필요한 서비스에 효과적으로 적용될 수 있습니다. 스냅은 MIT 라이선스로 공개되어 개발자들이 자유롭게 활용하고 개선할 수 있으며, 이는 LLM 생태계의 다양성과 혁신을 촉진할 것으로 기대됩니다.
