구글 딥마인드 ‘EmbeddingGemma 2’ 공개, 텍스트·이미지·영상·음성 하나로 처리하는 오픈 임베딩 모델

구글 딥마인드 'EmbeddingGemma 2' 공개, 텍스트·이미지·영상·음성 하나로 처리하는 오픈 임베딩

기사 이해를 돕기 위한 이미지

구글 딥마인드가 현지시각 2026년 10월 6일 텍스트·이미지·영상·음성을 하나의 모델에서 임베딩으로 바꾸는 오픈 모델 EmbeddingGemma 2를 공개했다. 멀티모달 전체 모델의 파라미터는 7억 4천만 개이며, 가중치는 Hugging Face와 Kaggle에서 Apache 2.0 라이선스로 무료로 받을 수 있다.

EmbeddingGemma 2 공개와 제공 방식

구글은 이 모델을 처음부터 멀티모달을 지원하는 임베딩용 오픈 모델 가운데 동급 최고라고 소개했다. 발표문은 구글 공식 블로그(blog.google)에 실렸고, 딥마인드 발표 주소로 들어가도 이 글로 연결된다.

라이선스인 Apache 2.0은 상업적 이용을 허용한다. 저장소와 모델 카드에 적힌 모델 ID는 google/embeddinggemma-2다. 구글은 Gemini Enterprise Agent Platform의 Model Garden에서도 곧 쓸 수 있게 할 예정이라고 밝혔다. vLLM, llama.cpp, Ollama 같은 실행 도구에서도 쓸 수 있다.

파라미터 구성과 기기 내 메모리 사용량

멀티모달 전체 모델의 파라미터는 7억 4천만 개(740M)다. Hugging Face에 공개된 구성을 보면 텍스트 백본이 270M이고, 이는 트랜스포머 130M과 임베더 140M으로 나뉜다. 여기에 170M 규모의 비전 인코더와 300M 규모의 오디오 인코더가 더해진다. 텍스트만 처리하는 270M 버전도 따로 있다. 문맥 창은 8K 토큰이며, 출력 벡터는 768차원이다. 마트료시카(Matryoshka) 학습 방식을 써서 이 벡터를 512, 256, 128차원으로 줄일 수 있다.

구글은 양자화를 적용해 Google Pixel 11 Pro에서 돌렸을 때 메모리 사용량도 공개했다. 텍스트만 처리하면 약 191MB, 멀티모달 기능을 모두 쓰면 약 567MB다. 이 모델을 기기 안에서 돌리는 로컬 우선 맥용 회의록 앱도 나왔다. 이 앱은 740M 규모의 EmbeddingGemma 2를 이용해 인터넷 연결 없이 작동할 수 있으며, 여러 앱에서 나온 회의 기록과 대면 회의 내용까지 정리한다.

구글이 발표한 벤치마크 수치

구글이 공개한 성능 비교는 모두 이전 버전인 EmbeddingGemma 1과 견준 것이다. 구글 AI 모델 카드에 따르면 MTEB Code(NDCG@10)에서 EmbeddingGemma 2는 78.68점으로, 68.76점인 EmbeddingGemma 1보다 9.92점 높았다. Hugging Face 모델 카드에도 같은 수치가 실렸다. 반면 다국어 텍스트를 평가하는 MTEB(multilingual)의 Mean(Task) 점수는 61.36점으로, 이전 버전의 61.15점과 차이가 크지 않았다.

구글은 768차원 기준 점수도 추가로 공개했다. 이미지 분야인 MIEB(lite) Mean(TaskType)은 64.64점, 영상 분야인 MMEB v2 Video Hit@1은 50.67점, 음성 검색 분야인 MSEB Retrieval MRR@10은 69.54점이다. 다만 이 세 항목에는 이전 버전이나 다른 회사 모델의 점수가 함께 나와 있지 않다.

구글은 개발자 가이드에서 이 모델이 파라미터 10억 개 미만 멀티모달 임베딩 모델 가운데 앞선 결과를 냈다고 밝혔다. 하지만 구글 공식 블로그, ai.google.dev, 개발자 블로그, Hugging Face 모델 카드에 실린 비교는 모두 EmbeddingGemma 1과 견준 것이고, 다른 회사 임베딩 모델의 이름과 점수를 함께 적은 비교표는 실리지 않았다.

구글이 밝힌 한계와 사용 시 주의점

벡터를 128차원까지 줄이면 품질이 떨어진다. 구글 개발자 가이드에 따르면 128차원에서는 텍스트와 코드가 원래 품질의 약 90%를 유지하지만, 이미지·영상·음성 검색 품질은 약 75%까지 내려간다. 구글은 멀티모달 검색에 128차원을 쓰려면 배포 전에 실제로 쓸 데이터로 먼저 검증하라고 권고했다. Hugging Face 모델 카드도 1대 6으로 압축되는 128차원에서는 멀티모달 품질이 크게 떨어진다고 적었다. 256차원은 손실이 거의 없는 수준이라고 설명했다.

이 밖의 사용 조건과 한계도 모델 카드에 적혀 있다. 오디오는 한 번에 약 5.5분까지만 처리할 수 있다. 텍스트 작업에서 권장 작업 접두어를 빼면 임베딩 품질이 최적보다 낮아질 수 있다. 연산 정밀도는 float16을 피하고 bfloat16이나 float32를 써야 한다. 구글 AI 모델 카드는 지원하는 100개 이상의 언어에서 성능이 똑같다고 보장하지 않는다고 밝혔다. 또 대규모 실제 데이터로 학습한 모델은 사회·문화적 편향을 반영할 수 있다고 적었다.

참고 자료 바로가기

같은 분야 최신 기사