구글이 온디바이스 환경에 맞춘 멀티모달 임베딩 모델 ‘임베딩젬마2’를 공개했다. 젬마4 아키텍처 기반의 7억4000만 파라미터 모델로, 아파치 2.0 라이선스로 배포된다. 임베딩 모델은 텍스트나 이미지 같은 데이터를 고정 길이 벡터로 바꿔 의미가 비슷한 정보를 찾는 데 쓰이는데, 이번 모델은 텍스트와 코드뿐 아니라 이미지, 비디오, 오디오까지 하나의 임베딩 공간에서 처리한다. 서로 다른 데이터 유형을 직접 연결하는 검색과 검색증강생성 시스템을 로컬 하드웨어에서 구현할 수 있도록 설계된 점이 특징이다.
모델은 모듈형 구조여서 텍스트 전용 작업에는 2억7000만 파라미터만 쓰고, 필요하면 비전 인코더 1억7000만 파라미터와 오디오 인코더 3억 파라미터를 추가할 수 있다. 출력 벡터는 기본 768차원에서 512·256·128차원으로 줄일 수 있어 저장공간과 검색 품질의 균형을 조정할 수 있으며, 로컬 벡터 데이터베이스와 메모리 사용량을 최대 6배까지 줄일 수 있다고 구글은 설명했다. 양자화 적용 시 픽셀11 프로에서 텍스트 전용은 약 191MB, 전체 멀티모달은 약 567MB의 활성 RAM을 사용한다고 밝혔다.






