Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← К новостям

Google DeepMind выпустила EmbeddingGemma 2 — открытую мультимодальную модель эмбеддингов на 740M, созданную на базе Gemma 4

Google DeepMind выпустила EmbeddingGemma 2 — открытую модель, которая преобразует текст, код, изображения, видео и аудио в единое пространство размерностью 768. Она содержит 740 млн параметров, имеет контекстное окно на 8 тыс. токенов и распространяется по лицензии Apache 2.0. Модель предназначена для поиска на устройствах, классификации и RAG с приоритетом конфиденциальности. В этой статье анализируется и сравнивается, а также демонстрируется место EmbeddingGemma 2 в этой области.

Можно ли развернуть уже сегодня? Да. Веса доступны на Hugging Face и Kaggle, а сборки для Ollama, llama.cpp GGUF и LiteRT уже доступны.

Что делает модель эмбеддингов

Модель эмбеддингов преобразует контент в вектор чисел, отражающий его смысл. Похожие элементы оказываются рядом, поэтому их легко искать и сравнивать. В конвейере RAG эти векторы позволяют LLM извлекать актуальную информацию, на которой она не обучалась. Локальная генерация эмбеддингов сохраняет данные на устройстве, сокращает задержку и работает в автономном режиме.

Единое векторное пространство для всех модальностей

EmbeddingGemma 2 создана на основе архитектуры Gemma 4. Текстовый запрос может найти фотографию. Голосовая заметка может найти видеоклип. Смешанные входные данные, например карточка товара с текстом, изображениями и демонстрационным видео, формируют единый эмбеддинг.

Архитектура модульная. Она состоит из трех частей:

  • Основа для текста и кода: 270 млн параметров (130 млн у трансформера и 140 млн у модуля эмбеддингов)
  • Визуальный энкодер: 170 млн параметров, опционально
  • Аудиоэнкодер: 300 млн параметров, опционально

Разработчики загружают только необходимые компоненты: 270 млн параметров для текста, 440 млн для текста и изображений, 570 млн для текста и аудио или 740 млн для всего набора. Все конфигурации используют общее векторное пространство. Запрос, преобразованный в эмбеддинг с помощью текстовой конфигурации, может сопоставляться с документами, обработанными полной моделью.

Контекстное окно составляет 8 192 токена — в 4 раза больше, чем у первой версии. Этого достаточно примерно для 29 изображений, 58 видеокадров или 5,5 минуты аудио.

Бенчмарки

Исследовательская команда Google сообщает о лидирующих результатах среди мультимодальных моделей эмбеддингов с числом параметров менее 1 млрд в тестах MTEB Code и MAEB. Результаты для полной точности при размерности 768:

БенчмаркEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.3661.15
MTEB Code v178.6868.76
MIEB lite (изображения)64.64н/д
MMEB v2 общий результат59.01н/д
MSEB retrieval (звук)69.54н/д
MAEB (аудио)49.39н/д

Источник: карточка модели EmbeddingGemma 2

Результат поиска по коду вырос на 9,92 пункта, то есть примерно на 14%. Качество многоязычного текста остается стабильным. Более крупные модели по-прежнему лидируют в некоторых рейтингах. Qwen3-VL-Embedding-2B показывает результат 73,2 в собственном прогоне MMEB-V2, имея примерно в 2,7 раза больше параметров и не поддерживая аудио.

Для телефонов и ноутбуков

При квантовании на Pixel 11 Pro активное использование оперативной памяти составляет около 191 МБ для текстовых весов. Полной мультимодальной модели требуется около 567 МБ. Обучение с учетом квантования сжимает веса до INT4 и INT8. Команда Google AI Edge измерила 37,3 мс на изображение на графическом процессоре MacBook M5 Pro при бюджете в 70 визуальных токенов.

Matryoshka Representation Learning (MRL) позволяет разработчикам сокращать векторы до 512, 256 или 128 измерений. Переход от 768 к 128 измерениям сокращает объем хранения до 6 раз. При 256 измерениях результат MTEB multilingual снижается лишь с 61,36 до 60,41. При 128 измерениях MMEB падает до 45,65, поэтому Google рекомендует 128-мерные векторы главным образом для текстовых задач.

Интерактивное объяснение

EmbeddingGemma 2 в сравнении с ближайшими конкурентами

ХарактеристикаEmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
РазработчикGoogle DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (исследовательская)Google
Параметры740 млн (270 млн только для текста)308 млн2 млрдОснова 3 млрд (5 млрд указано на HF)Не раскрыто
Текст / кодДаДаДаДаДа
ИзображенияДаНетДаДаДа
ВидеоДаНетДаДаДа
АудиоДаНетНетДаДа
Выходная размерность (MRL)768 (512, 256, 128)768 (до 128)До 2048 (от 64 до 2048)Не указано3072 (от 128 до 3072)
Контекст8 192 токена2 тыс. токенов32 тыс. токеновНе указано8 192 токена
Языки100+100+30+Не указано100+
Лицензия / доступApache 2.0, открытые весаОткрытые веса (условия Gemma)Apache 2.0, открытые весаApache 2.0, открытые весаТолько платный API
Опубликованное потребление оперативной памяти на устройстве~191 МБ для текста, ~567 МБ полностьюМенее 200 МБНе опубликованоНе опубликованоТолько облако
ИсточникКарточка моделиДокументацияКарточка на HFКарточка на HFДокументация API

Как запустить

Модель работает с sentence-transformers версии 6.1.0 и выше, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Qdrant отвечает за хранение векторов, а Unsloth — за дообучение. Поддержка ML Kit для Android с ускорением NPU появится в течение нескольких недель.

Скопировать кодСкопированоИспользовать другой браузер
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

В Ollama выполните ollama pull embeddinggemma-2. Доступны варианты от 270m (378 МБ) до 740m (1,3 ГБ). Демонстрации доступны в Google AI Edge Gallery. Подробнее см. в руководстве для разработчиков.

Ключевые выводы

  • Одна открытая модель с 740 млн параметров преобразует текст, код, изображения, видео и аудио в общее пространство размерностью 768.
  • Модульные энкодеры изменяют объем модели от 270 млн параметров (текст) до 740 млн (полная мультимодальность).
  • Результат поиска по коду в MTEB Code вырос с 68,76 до 78,68.
  • При квантовании модель использует примерно от 191 до 567 МБ оперативной памяти на Pixel 11 Pro.

FAQ

  • Можно ли использовать EmbeddingGemma 2 в коммерческих целях? Да. Она выпущена по лицензии Apache 2.0.
  • Сколько памяти требуется EmbeddingGemma 2? Google сообщает примерно о 191 МБ активной оперативной памяти для работы только с текстом и 567 МБ для полной мультимодальной версии при квантовании на Pixel 11 Pro.

Ознакомьтесь с весами модели на HF и техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

[Реклама] Веб — это единственный API, которого не хватает большинству агентов. У баз данных, календарей и репозиториев есть API. У открытого веба в основном нет. MCP-сервер TinyFish предоставляет любому MCP-клиенту четыре инструмента: TinySearch, TinyFetch (полные страницы в формате Markdown, включая JavaScript), TinyBrowser для авторизации и заполнения форм и TinyAgent для многоэтапных задач. Search и Fetch бесплатны.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости