구글이 텍스트, 코드, 이미지, 영상, 오디오 등 여러 모달리티(양식)의 데이터를 하나의 벡터 공간에 통합하여 서로 검색할 수 있는 경량 멀티모달 임베딩 모델 'EmbeddingGemma 2'를 공개했습니다. 이는 지난해 출시되어 2천만 회 이상 다운로드된 텍스트 전용 'EmbeddingGemma'의 후속작으로, 온디바이스(기기 내) 환경에서 데이터 정리, 검색, 연결을 목표로 합니다. 아파치 2.0 라이선스로 상업적 이용이 가능하며, 개발자들은 이를 활용해 개인정보 보호에 강하고 지연 시간이 짧은 애플리케이션을 구축할 수 있게 되었습니다.
EmbeddingGemma 2는 구글의 'Gemma 4' 아키텍처를 기반으로 하며, 총 7억 4천만 개의 파라미터(매개변수)를 가집니다. 특히 모듈식 구조를 채택하여 텍스트 전용 작업에는 2억 7천만 개의 파라미터만 사용하고, 필요에 따라 비전(1억 7천만 개)과 오디오(3억 개) 인코더를 추가할 수 있습니다. 또한, 마트료시카 표현 학습(MRL) 기술을 적용해 임베딩 벡터를 768차원에서 128차원까지 동적으로 줄일 수 있어, 로컬 벡터 데이터베이스의 저장 공간과 메모리 사용량을 최대 6분의 1로 절감합니다. 이를 통해 구글 픽셀 11 프로(Google Pixel 11 Pro) 같은 모바일 기기에서도 텍스트 전용 모델은 약 191MB, 전체 멀티모달 모델은 약 567MB의 RAM만으로 실행 가능합니다. 8K 토큰의 문맥 창은 기존 EmbeddingGemma보다 4배 커졌으며, 로컬 하드웨어에서 최대 5.5분 분량의 오디오, 29개 이미지, 58개 영상 프레임을 처리할 수 있습니다.
성능 면에서는 기존 EmbeddingGemma의 다국어 텍스트 성능을 유지하면서 MTEB 코드 점수를 68.76에서 78.68로 크게 개선했습니다. 이는 10억 파라미터 미만 멀티모달 임베딩 모델 중 코드 및 오디오 벤치마크에서 선도적인 성능을 의미하며, 더 큰 규모의 모델들과 동등하거나 우수한 결과를 보입니다. 개발자들은 이 모델을 활용해 음성 메모로 영상 클립을 찾거나, 텍스트로 수 시간 분량의 녹음을 검색하는 등 다양한 교차 모달 검색 기능을 구현할 수 있습니다. 특히 로컬 임베딩 생성은 데이터 개인정보 보호를 강화하고 파이프라인 지연 시간을 줄여주며, Gemma 4와 결합하여 복잡한 멀티모달 데이터를 이해하는 온디바이스 RAG(검색 증강 생성) 파이프라인을 구축할 수 있다는 점이 큰 장점입니다. 이러한 기술은 법률 문서 검색, 미디어 라이브러리 관리, 코딩 에이전트 등 광범위한 분야에서 혁신적인 변화를 가져올 잠재력을 가지고 있습니다.