독일의 인공지능(AI) 스타트업 알레프 알파(Aleph Alpha)가 독일어와 영어에 최적화된 새로운 대규모 언어모델(LLM) '콜리브리(Kolibri)'를 공개했습니다. 이 모델은 독일과 핀란드의 인프라에서 처음부터 학습되었으며, 기업이 자체 서버에서 모델과 데이터를 완전히 통제할 수 있는 '주권 AI(Sovereign AI)' 개념을 강조합니다. 이는 유럽연합(EU)의 엄격한 데이터 규제와 AI 법안(EU AI Act)을 준수하며, 외부 통제 없이 안전하게 AI를 활용하려는 기업들에게 매력적인 대안을 제시합니다.
콜리브리는 전문가 혼합(MoE) 구조를 채택하여 전체 781억 개의 파라미터 중 토큰당 34.6억 개만 활성화합니다. 이는 연산량을 줄이면서도 높은 성능을 유지하는 방식입니다. 특히 독일어의 복합어 특성을 고려한 'UniBPE' 토크나이저를 사용하여 독일어 처리 효율성을 크게 높였으며, 최대 100만 토큰의 긴 컨텍스트 창을 지원하여 방대한 독일어 문서를 기반으로 한 검색 증강 생성(RAG) 작업에 강점을 보입니다. 또한, 근거가 부족할 경우 답변을 유보하도록 학습된 '멀린-아서(Merlin-Arthur)' 프로토콜을 통해 환각(hallucination) 현상을 줄이고 답변의 신뢰성을 높였습니다.
콜리브리의 출시는 유럽, 특히 독일 기업들이 데이터 주권과 규제 준수를 중요하게 여기는 환경에서 의미가 큽니다. 자체 인프라에서 모델을 운영함으로써 민감한 기업 데이터를 외부로 유출하지 않고 AI를 활용할 수 있게 되어, 금융, 공공, 국방 등 보안이 중요한 산업 분야에서 높은 수요가 예상됩니다. 또한, 특정 언어와 문화권에 최적화된 LLM의 등장은 범용 모델로는 충족하기 어려운 지역별 특화 서비스 개발의 가능성을 열어주며, AI 기술의 주권 확보라는 글로벌 트렌드 속에서 유럽의 독자적인 AI 생태계 구축에 기여할 것으로 보입니다.