Google выпустила EmbeddingGemma 2 — открытую модель для создания мультимодальных эмбеддингов непосредственно на пользовательских устройствах. Она преобразует текст, код, изображения, видео и аудио в единое пространство числовых представлений, где похожие по смыслу объекты можно находить и сопоставлять. Модель построена на архитектуре Gemma 4, содержит 740 млн параметров и распространяется по лицензии Apache 2.0.

Архитектура модульная: для задач только с текстом требуется 270 млн параметров, а для полной мультимодальной работы подключаются визуальный и аудиоэнкодеры. Контекст составляет 8 тысяч токенов — вчетверо больше, чем у первой EmbeddingGemma. По данным Google, модель может обработать до 5,5 минуты аудио, 29 изображений или 58 кадров видео, а выходные векторы можно сокращать с 768 до 512, 256 или 128 измерений. Компания оценивает экономию места для локальной векторной базы и памяти до шести раз.

Google также заявляет, что EmbeddingGemma 2 лидирует среди мультимодальных моделей размером менее миллиарда параметров в ряде тестов. В MTEB Code результат вырос с 68,76 до 78,68 балла относительно предыдущей версии. Эти показатели основаны на измерениях разработчика и не заменяют независимое сравнение в конкретном приложении. При квантовании на Pixel 11 Pro текстовые веса, по данным компании, требуют около 191 МБ активной памяти, а полная модель — около 567 МБ.

Веса уже доступны на Hugging Face и Kaggle. Для локального развёртывания Google указывает MediaPipe, LiteRT, transformers.js и WebGPU, а среди совместимых инструментов — transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LM Studio. Появление модели в Gemini Enterprise Agent Platform Model Garden компания обещает позднее.