독일의 AI 스타트업 알레프 알파(Aleph Alpha)가 유럽의 규제 환경과 데이터 주권을 고려한 대규모 언어모델(LLM) 콜리브리(Kolibri)의 상세 기술 보고서를 발표했습니다. 콜리브리는 전체 781억 개 파라미터 중 토큰당 34.6억 개(약 4.4%)만 활성화하는 MoE(Mixture of Experts) 구조를 채택하여 효율성을 높였으며, Apache 2.0 라이선스로 가중치를 공개해 기업이나 공공기관이 자체 인프라에 모델을 배포하고 운영할 수 있도록 지원합니다.
콜리브리는 공공행정, 산업, 항공우주와 같이 민감한 데이터를 처리하는 분야의 요구사항을 충족하기 위해 개발되었습니다. 데이터 수집부터 학습, 평가에 이르는 전 개발 과정을 알레프 알파가 직접 통제하며, EU AI Act, GDPR 등 유럽의 규제 환경을 처음부터 고려해 설계되었습니다. 총 24조 토큰으로 학습되었고, 이 중 독일어 데이터 비중이 20% 이상을 차지하여 독일어 성능이 매우 뛰어납니다. 또한, 자체 개발한 UniBPE 토크나이저를 통해 독일어 웹 텍스트 처리 시 GPT-5 토크나이저 대비 11.2% 적은 토큰으로 압축하여 학습 및 서빙 비용을 절감하고 긴 문맥 처리 효율을 높였습니다. 최대 100만 토큰의 문맥을 지원하며, 요청별 추론(inference) 노력 설정을 통해 응답 품질과 비용/지연 시간 사이의 균형을 조절할 수 있습니다.
이러한 콜리브리의 출시는 유럽 내에서 AI 기술 주권을 확보하고, 규제가 엄격한 산업 분야에서 신뢰할 수 있는 AI 솔루션을 제공하려는 움직임의 중요한 진전으로 평가됩니다. 오픈 소스 가중치와 자체 인프라 배포 지원은 민감한 데이터를 다루는 조직들이 데이터 보안과 통제권을 유지하면서도 최신 LLM 기술을 활용할 수 있게 합니다. 특히 독일어에 대한 높은 최적화는 유럽 시장, 특히 독일어권 국가에서 경쟁 우위를 점할 수 있는 요소이며, 이는 글로벌 AI 시장에서 특정 언어 및 규제 환경에 특화된 모델의 중요성을 부각시킵니다.