유럽의 주요 AI 기업인 알레프 알파(Aleph Alpha)가 주권형 대규모 언어모델(LLM)인 '콜리브리(Kolibri)'를 공개하며, 그 전체 가중치를 아파치 2.0(Apache 2.0) 라이선스로 허깅 페이스(Hugging Face)에 배포했습니다. 이 모델은 영어와 독일어를 지원하며, 총 780억 개의 파라미터 중 약 30억 개의 파라미터만 활성화하는 MoE(Mixture-of-Experts) 트랜스포머 아키텍처를 채택하여 효율성을 높였습니다. 최대 100만 토큰에 달하는 긴 문맥을 처리할 수 있는 것이 특징입니다.
콜리브리는 공공행정, 산업, 항공우주 등 규제가 엄격한 핵심 업무 환경을 겨냥해 설계되었습니다. 온프레미스(On-premise) 배포를 지원하여 기업이나 기관이 민감한 내부 데이터를 외부 추론 서비스에 전송하지 않고 자체 환경에서 모델을 운영할 수 있도록 합니다. 이는 데이터 주권(data sovereignty)과 공급망 통제(supply chain control)를 강화하려는 유럽의 정책적 기조와도 맞닿아 있습니다. 알레프 알파의 자체 평가에 따르면, 콜리브리는 영어와 독일어 모두에서 품질 대비 서빙 비용 측면에서 파레토 전선(Pareto frontier)에 위치하며, 수학, 코딩, 문서 근거 활용, 긴 문맥 작업에서 활성 파라미터가 최대 4배 많은 다른 모델들과 대등한 성능을 보였습니다. 또한, '멀린-아서 학습(Merlin-Arthur learning)' 방식을 통해 문맥에 근거가 없을 경우 답변을 유보하도록 훈련되어 환각(hallucination) 현상을 줄였습니다.
이번 콜리브리 출시는 유럽이 자체적인 AI 역량을 강화하고 데이터 주권을 확보하려는 노력의 일환으로 해석될 수 있습니다. 특히 규제 산업에 특화된 온프레미스 배포 모델은 민감한 정보를 다루는 기업이나 정부 기관에 매력적인 선택지가 될 것입니다. 이는 단순히 기술적 성능을 넘어, 데이터 보안과 규제 준수가 중요한 시대에 LLM 활용의 새로운 방향을 제시하며, 유럽 내 AI 생태계 발전에도 긍정적인 영향을 미칠 것으로 기대됩니다. 또한, 오픈웨이트(open-weight) 공개를 통해 더 많은 개발자와 기업이 콜리브리를 활용하고 개선할 수 있는 기회를 제공하여, 혁신을 가속화할 잠재력을 가지고 있습니다.