Google DeepMind выпустила EmbeddingGemma 2 — открытую мультимодальную модель эмбеддингов на 740M, созданную на базе Gemma 4
Google DeepMind выпустила EmbeddingGemma 2 — открытую модель, которая преобразует текст, код, изображения, видео и аудио в единое пространство размерностью 768. Она содержит 740 млн параметров, имеет контекстное окно на 8 тыс. токенов и распространяется по лицензии Apache 2.0. Модель предназначена для поиска на устройствах, классификации и RAG с приоритетом конфиденциальности. В этой статье анализируется и сравнивается, а также демонстрируется место EmbeddingGemma 2 в этой области.
Можно ли развернуть уже сегодня? Да. Веса доступны на Hugging Face и Kaggle, а сборки для Ollama, llama.cpp GGUF и LiteRT уже доступны.
Что делает модель эмбеддингов
Модель эмбеддингов преобразует контент в вектор чисел, отражающий его смысл. Похожие элементы оказываются рядом, поэтому их легко искать и сравнивать. В конвейере RAG эти векторы позволяют LLM извлекать актуальную информацию, на которой она не обучалась. Локальная генерация эмбеддингов сохраняет данные на устройстве, сокращает задержку и работает в автономном режиме.
Единое векторное пространство для всех модальностей
EmbeddingGemma 2 создана на основе архитектуры Gemma 4. Текстовый запрос может найти фотографию. Голосовая заметка может найти видеоклип. Смешанные входные данные, например карточка товара с текстом, изображениями и демонстрационным видео, формируют единый эмбеддинг.
Архитектура модульная. Она состоит из трех частей:
- Основа для текста и кода: 270 млн параметров (130 млн у трансформера и 140 млн у модуля эмбеддингов)
- Визуальный энкодер: 170 млн параметров, опционально
- Аудиоэнкодер: 300 млн параметров, опционально
Разработчики загружают только необходимые компоненты: 270 млн параметров для текста, 440 млн для текста и изображений, 570 млн для текста и аудио или 740 млн для всего набора. Все конфигурации используют общее векторное пространство. Запрос, преобразованный в эмбеддинг с помощью текстовой конфигурации, может сопоставляться с документами, обработанными полной моделью.
Контекстное окно составляет 8 192 токена — в 4 раза больше, чем у первой версии. Этого достаточно примерно для 29 изображений, 58 видеокадров или 5,5 минуты аудио.
Бенчмарки
Исследовательская команда Google сообщает о лидирующих результатах среди мультимодальных моделей эмбеддингов с числом параметров менее 1 млрд в тестах MTEB Code и MAEB. Результаты для полной точности при размерности 768:
| Бенчмарк | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (изображения) | 64.64 | н/д |
| MMEB v2 общий результат | 59.01 | н/д |
| MSEB retrieval (звук) | 69.54 | н/д |
| MAEB (аудио) | 49.39 | н/д |
Источник: карточка модели EmbeddingGemma 2
Результат поиска по коду вырос на 9,92 пункта, то есть примерно на 14%. Качество многоязычного текста остается стабильным. Более крупные модели по-прежнему лидируют в некоторых рейтингах. Qwen3-VL-Embedding-2B показывает результат 73,2 в собственном прогоне MMEB-V2, имея примерно в 2,7 раза больше параметров и не поддерживая аудио.
Для телефонов и ноутбуков
При квантовании на Pixel 11 Pro активное использование оперативной памяти составляет около 191 МБ для текстовых весов. Полной мультимодальной модели требуется около 567 МБ. Обучение с учетом квантования сжимает веса до INT4 и INT8. Команда Google AI Edge измерила 37,3 мс на изображение на графическом процессоре MacBook M5 Pro при бюджете в 70 визуальных токенов.
Matryoshka Representation Learning (MRL) позволяет разработчикам сокращать векторы до 512, 256 или 128 измерений. Переход от 768 к 128 измерениям сокращает объем хранения до 6 раз. При 256 измерениях результат MTEB multilingual снижается лишь с 61,36 до 60,41. При 128 измерениях MMEB падает до 45,65, поэтому Google рекомендует 128-мерные векторы главным образом для текстовых задач.
Интерактивное объяснение
EmbeddingGemma 2 в сравнении с ближайшими конкурентами
| Характеристика | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| Разработчик | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (исследовательская) | |
| Параметры | 740 млн (270 млн только для текста) | 308 млн | 2 млрд | Основа 3 млрд (5 млрд указано на HF) | Не раскрыто |
| Текст / код | Да | Да | Да | Да | Да |
| Изображения | Да | Нет | Да | Да | Да |
| Видео | Да | Нет | Да | Да | Да |
| Аудио | Да | Нет | Нет | Да | Да |
| Выходная размерность (MRL) | 768 (512, 256, 128) | 768 (до 128) | До 2048 (от 64 до 2048) | Не указано | 3072 (от 128 до 3072) |
| Контекст | 8 192 токена | 2 тыс. токенов | 32 тыс. токенов | Не указано | 8 192 токена |
| Языки | 100+ | 100+ | 30+ | Не указано | 100+ |
| Лицензия / доступ | Apache 2.0, открытые веса | Открытые веса (условия Gemma) | Apache 2.0, открытые веса | Apache 2.0, открытые веса | Только платный API |
| Опубликованное потребление оперативной памяти на устройстве | ~191 МБ для текста, ~567 МБ полностью | Менее 200 МБ | Не опубликовано | Не опубликовано | Только облако |
| Источник | Карточка модели | Документация | Карточка на HF | Карточка на HF | Документация API |
Как запустить
Модель работает с sentence-transformers версии 6.1.0 и выше, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Qdrant отвечает за хранение векторов, а Unsloth — за дообучение. Поддержка ML Kit для Android с ускорением NPU появится в течение нескольких недель.
pip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))В Ollama выполните ollama pull embeddinggemma-2. Доступны варианты от 270m (378 МБ) до 740m (1,3 ГБ). Демонстрации доступны в Google AI Edge Gallery. Подробнее см. в руководстве для разработчиков.
Ключевые выводы
- Одна открытая модель с 740 млн параметров преобразует текст, код, изображения, видео и аудио в общее пространство размерностью 768.
- Модульные энкодеры изменяют объем модели от 270 млн параметров (текст) до 740 млн (полная мультимодальность).
- Результат поиска по коду в MTEB Code вырос с 68,76 до 78,68.
- При квантовании модель использует примерно от 191 до 567 МБ оперативной памяти на Pixel 11 Pro.
FAQ
- Можно ли использовать EmbeddingGemma 2 в коммерческих целях? Да. Она выпущена по лицензии Apache 2.0.
- Сколько памяти требуется EmbeddingGemma 2? Google сообщает примерно о 191 МБ активной оперативной памяти для работы только с текстом и 567 МБ для полной мультимодальной версии при квантовании на Pixel 11 Pro.
Ознакомьтесь с весами модели на HF и техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.