구글이 텍스트뿐만 아니라 이미지, 오디오, 비디오까지 통합적으로 처리할 수 있는 경량 멀티모달 임베딩 모델 '임베딩 젬마 2(EmbeddingGemma 2)'를 새롭게 선보였습니다. 이 모델은 다양한 형태의 데이터를 하나의 임베딩 공간으로 매핑하여 온디바이스(on-device) 환경에서 효율적인 검색 및 분석을 가능하게 합니다. 상업적 사용이 허용되는 아파치 2.0 라이선스로 공개되어 개발자 커뮤니티의 활용이 기대됩니다.
임베딩 젬마 2는 젬마 4(Gemma 4) 아키텍처를 기반으로 하며 7억 4천만 개의 매개변수를 가집니다. 이는 10억 개 미만의 매개변수를 가진 모델 중 최고 수준의 성능을 자랑하며, 텍스트, 코드, 이미지, 오디오 벤치마크에서 우수한 점수를 기록했습니다. 특히 텍스트 전용 작업에는 2억 7천만 개, 시각(1억 7천만 개) 및 오디오(3억 개) 인코더를 추가하여 전체 멀티모달을 지원하는 모듈식 설계를 채택했습니다. 또한, 마트료시카 표현 학습(MRL)을 통해 출력 벡터 차원을 동적으로 조절하여 최대 6배의 저장 공간 절감 효과를 제공하며, 8K 토큰의 컨텍스트 창으로 오디오 5.5분, 이미지 29장, 비디오 프레임 58개 등을 로컬에서 직접 처리할 수 있습니다.
이 모델의 가장 큰 장점은 온디바이스 추론에 최적화되어 있다는 점입니다. 구글 픽셀 11 프로(Google Pixel 11 Pro)에서 텍스트 전용은 약 191MB, 전체 멀티모달 모델은 약 567MB의 RAM만으로 구동 가능합니다. 이는 데이터 프라이버스를 강화하고, 파이프라인 지연 시간을 줄이며, 완전히 오프라인 상태에서도 교차 모달 검색 및 검색 증강 생성(RAG)을 가능하게 합니다. 개발자들은 허깅 페이스(Hugging Face), 캐글(Kaggle) 등에서 모델 가중치를 다운로드하여 미디어파이프(MediaPipe)나 라이트RT(LiteRT)와 같은 도구를 활용해 다양한 플랫폼에서 온디바이스 AI 애플리케이션을 구축할 수 있습니다.
임베딩 젬마 2의 출시는 개인 기기에서 AI 기능을 더욱 강력하게 활용할 수 있는 중요한 전환점이 될 것입니다. 사용자들은 스마트폰이나 태블릿 같은 기기에서 개인 데이터의 프라이버스를 보호하면서도, 복잡한 멀티모달 검색 및 분석 기능을 경험할 수 있게 됩니다. 예를 들어, 음성 메모로 특정 비디오 클립을 찾거나, 텍스트 질의로 수 시간 분량의 오디오 기록을 검색하는 등의 작업이 가능해집니다. 이는 온디바이스 AI의 활용 범위를 넓히고, 개발자들에게는 혁신적인 애플리케이션을 만들 수 있는 새로운 기회를 제공할 것으로 보입니다.
