구글 EmbeddingGemma 2, 폰에서 도는 멀티모달 임베딩

김팔복 2026-10-07 23:32:02
조회 56 추천 0 댓글 0

출처: Google Blog (Sahil Dua, Henrique Schechter Vera / Google DeepMind)
원문: https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
작성자: 팔복소프트-김팔복

한눈에 보기

  • Google DeepMind가 오픈 임베딩 모델 EmbeddingGemma 2를 공개했습니다.
  • 텍스트, 코드, 이미지, 영상, 오디오를 하나의 벡터 공간에 넣는 멀티모달 모델로 바뀌었습니다.
  • 740M 파라미터, Gemma 4 아키텍처 기반이며 Apache 2.0 라이선스라 상업적으로 쓸 수 있습니다.
  • 텍스트만 쓰면 270M만 올리고, 비전과 오디오 인코더는 필요할 때 붙이는 구조입니다.
  • 코드 검색 성능이 크게 올라 MTEB Code 점수가 68.76에서 78.68이 됐습니다.
  • 양자화하면 Pixel 11 Pro에서 텍스트 전용 약 191MB, 전체 약 567MB RAM으로 돌아갑니다.

배경

임베딩 모델은 문장이나 이미지를 숫자 벡터로 바꿔서 의미가 비슷한 것끼리 가까이 놓이게 만드는 모델입니다. RAG(검색 증강 생성)에서 어떤 문서를 LLM에 넘길지 고르는 검색 단계의 품질이 여기서 결정됩니다. 국내 RAG 프로젝트는 대부분 OpenAI나 Gemini의 임베딩 API를 호출하거나, BGE-M3 같은 텍스트 전용 오픈 모델을 서버에 올려 썼습니다. 이미지나 음성까지 검색하려면 CLIP 계열 같은 별도 모델을 하나 더 운영해야 했습니다.

주요 내용

텍스트 전용에서 멀티모달로

작년에 나온 1세대 EmbeddingGemma는 텍스트 전용 경량 모델이었고, 다운로드가 2,000만 건을 넘었습니다. 2세대는 텍스트로 영상 속 특정 장면을 찾거나, 음성 메모로 관련 영상을 찾는 식의 교차 모달 검색을 모델 하나로 처리합니다. 구글은 Gemini Embedding 모델과 같은 기술로 만들었다고 밝혔습니다.

항목 EmbeddingGemma (1세대) EmbeddingGemma 2
입력 텍스트 텍스트·코드·이미지·영상·오디오
컨텍스트 2세대의 1/4 8K 토큰
MTEB Code 68.76 78.68
다국어 텍스트 기준 1세대와 같은 수준

8K 컨텍스트로 오디오는 최대 5.5분, 이미지는 29장, 영상은 58프레임까지 한 번에 넣을 수 있고, 이것들을 섞어서 넣어도 됩니다.

필요한 만큼만 올리는 모듈 구조

구성 파라미터
텍스트 코어 270M
비전 인코더 (선택) 170M
오디오 인코더 (선택) 300M

MRL(Matryoshka Representation Learning, 벡터의 앞부분만 잘라 써도 의미가 유지되도록 학습하는 기법)을 적용해서 768차원 출력을 512, 256, 128차원으로 줄여 쓸 수 있습니다. 저장 공간은 최대 6배까지 줄어듭니다.

Gemma 4와 함께 쓰는 구성

텍스트 토크나이저와 오디오 인코더를 Gemma 4와 공유하기 때문에, 생성 모델과 같이 기기에 올리면 전체 메모리 사용량이 줄어듭니다. 서빙은 transformers, sentence-transformers, vLLM, SGLang, llama.cpp, Ollama, LMStudio, MLX를 지원합니다. 브라우저에서는 transformers.js와 WebGPU로, 모바일에서는 MediaPipe와 LiteRT로 돌립니다. 벡터 저장용으로 Qdrant 연동이, 파인튜닝용으로 Unsloth 가이드가 함께 나왔습니다.

팔복소프트 관점

  • 망분리 환경에서 가장 쓸모가 큽니다. 금융, 공공, 의료처럼 외부 임베딩 API 호출이 막혀 있거나 개인정보 반출이 부담스러운 곳에서는, 상업 이용이 자유로운 오픈 모델을 사내에서 돌릴 수 있다는 점이 그대로 RAG 도입 조건이 됩니다. 텍스트 전용 270M 구성은 GPU 없는 서버에서도 한번 테스트해볼 만한 크기입니다.
  • 한국어 성능은 직접 확인해야 합니다. 원문에는 다국어 성능이 1세대와 같은 수준이라는 말만 있고 한국어 수치는 없습니다. 이미 BGE-M3 등으로 텍스트 RAG를 운영 중이라면 사내 질의 100~200개로 검색 정확도를 비교해본 뒤에 바꿀지 정하세요. 텍스트만 다룬다면 바꿔서 얻는 게 크지 않을 수도 있습니다.
  • 새로 열리는 영역은 코드와 음성입니다. 코드 검색 점수가 오른 덕분에 사내 코드베이스 검색이나 코딩 에이전트의 컨텍스트 검색에 바로 써볼 만합니다. 콜센터 녹취나 회의 녹음처럼 쌓여만 있던 데이터를 STT 없이 벡터화하는 실험도 가능해졌습니다. 다만 한국어 음성에서 "STT 후 텍스트 검색"하는 방식보다 나은지는 아직 아무도 모릅니다.
  • 모바일 수치는 Pixel 기준입니다. 국내 사용자 대부분이 쓰는 Galaxy, 특히 중저가 모델에서 567MB를 추가로 쓰는 건 부담스럽습니다. 앱에 넣는다면 텍스트 전용 구성부터 시작하는 게 안전합니다.
  • 임베딩 모델을 바꾸면 전체 재색인이 필요합니다. pgvector에 768차원으로 쌓아둔 데이터를 128차원으로 줄여 다시 넣는다면, 저장비 절감과 정확도 손실을 함께 따져봐야 합니다.

정리

EmbeddingGemma 2는 작은 오픈 모델 하나로 이미지, 음성, 영상까지 검색하는 구성을 현실적인 크기로 만들었습니다. 텍스트 RAG만 운영한다면 급하게 바꿀 이유는 약합니다. 반면 코드 검색이나 녹취·영상처럼 지금까지 검색 대상이 아니었던 데이터를 다뤄야 하는 팀이라면 PoC를 돌려볼 가치가 있습니다. 어느 쪽이든 한국어 데이터로 직접 측정하기 전에는 결론을 내리지 마세요.


  • EmbeddingGemma
  • 임베딩
  • RAG
  • 온디바이스AI
  • Gemma

댓글 0

아직 댓글이 없습니다.