Google DeepMind випустила EmbeddingGemma 2 — відкриту мультимодальну модель ембедингів на 740M, створену на базі Gemma 4
Google DeepMind випустила EmbeddingGemma 2 — відкриту модель, яка вбудовує текст, код, зображення, відео та аудіо в єдиний 768-вимірний простір. Вона має 740 млн параметрів, контекстне вікно на 8 тис. токенів і ліцензію Apache 2.0. Модель призначена для пошуку на пристроях, класифікації та RAG із пріоритетом конфіденційності. У цій статті аналізується, порівнюється та демонструється, як EmbeddingGemma 2 вписується в цей простір.
Можна розгорнути вже сьогодні? Так. Ваги доступні на Hugging Face і Kaggle, а збірки для Ollama, llama.cpp GGUF і LiteRT уже доступні.
Що робить модель вбудовування
Модель вбудовування перетворює контент на вектор чисел, який передає його значення. Схожі елементи опиняються поруч, тому їх легко шукати й порівнювати. У конвеєрі RAG ці вектори дають змогу LLM отримувати актуальну інформацію, на якій її не навчали. Генерування вбудовувань локально зберігає дані на пристрої, зменшує затримку та дає змогу працювати офлайн.
Єдиний векторний простір для всіх модальностей
EmbeddingGemma 2 побудована на архітектурі Gemma 4. Текстовий запит може знайти фотографію. Голосова нотатка може знайти відеокліп. Комбіновані вхідні дані, як-от опис товару з текстом, зображеннями та демонстраційним відео, створюють єдине вбудовування.
Архітектура модульна. Вона складається з трьох частин:
- Основа для тексту й коду: 270 млн параметрів (130 млн у трансформері та 140 млн у модулі вбудовування)
- Візуальний енкодер: 170 млн параметрів, опційно
- Аудіоенкодер: 300 млн параметрів, опційно
Розробники завантажують лише потрібні компоненти: 270 млн для тексту, 440 млн для тексту й зображень, 570 млн для тексту й аудіо або 740 млн для всього. Усі конфігурації використовують один векторний простір. Запит, вбудований за допомогою конфігурації лише для тексту, може зіставлятися з документами, вбудованими повною моделлю.
Контекстне вікно становить 8 192 токени — у 4 рази більше, ніж у версії 1. Цього достатньо приблизно для 29 зображень, 58 відеокадрів або 5,5 хвилини аудіо.
Бенчмарки
Дослідницька команда Google повідомляє про провідні результати серед мультимодальних моделей вбудовування з менш ніж 1 млрд параметрів у MTEB Code та MAEB. Результати у повній точності для 768 вимірів:
| Бенчмарк | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (зображення) | 64.64 | н/д |
| MMEB v2 загальний | 59.01 | н/д |
| MSEB retrieval (звук) | 69.54 | н/д |
| MAEB (аудіо) | 49.39 | н/д |
Джерело: картка моделі EmbeddingGemma 2
Пошук коду покращився на 9,92 бала, приблизно на 14%. Якість багатомовного тексту залишається стабільною. Більші моделі все ще лідирують у деяких рейтингах. Qwen3-VL-Embedding-2B повідомляє про результат 73,2 у власному запуску MMEB-V2, маючи приблизно у 2,7 раза більше параметрів і не підтримуючи аудіо.
Створена для телефонів і ноутбуків
У разі квантизації на Pixel 11 Pro активна оперативна пам’ять для ваг лише текстової моделі становить близько 191 МБ. Повній мультимодальній моделі потрібно близько 567 МБ. Навчання з урахуванням квантизації стискає ваги до INT4 та INT8. Команда Google AI Edge виміряла 37,3 мс на зображення на GPU MacBook M5 Pro, використовуючи бюджет у 70 токенів для візуальної модальності.
Matryoshka Representation Learning (MRL) дає змогу розробникам скорочувати вектори до 512, 256 або 128 вимірів. Перехід від 768 до 128 вимірів зменшує обсяг сховища до 6 разів. За 256 вимірів показник MTEB multilingual знижується лише з 61,36 до 60,41. За 128 вимірів MMEB падає до 45,65, тому Google рекомендує 128-вимірний варіант переважно для робочих навантажень лише з текстом.
Інтерактивне пояснення
EmbeddingGemma 2 проти найближчих конкурентів
| Функція | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| Розробник | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (дослідження) | |
| Параметри | 740 млн (270 млн лише для тексту) | 308 млн | 2 млрд | Основа 3 млрд (5 млрд зазначено на HF) | Не розголошено |
| Текст / код | Так | Так | Так | Так | Так |
| Зображення | Так | Ні | Так | Так | Так |
| Відео | Так | Ні | Так | Так | Так |
| Аудіо | Так | Ні | Ні | Так | Так |
| Вихідні виміри (MRL) | 768 (512, 256, 128) | 768 (до 128) | До 2048 (від 64 до 2048) | Не зазначено | 3072 (від 128 до 3072) |
| Контекст | 8 192 токени | 2 тис. токенів | 32 тис. токенів | Не зазначено | 8 192 токени |
| Мови | 100+ | 100+ | 30+ | Не зазначено | 100+ |
| Ліцензія / доступ | Apache 2.0, відкриті ваги | Відкриті ваги (умови Gemma) | Apache 2.0, відкриті ваги | Apache 2.0, відкриті ваги | Лише платний API |
| Опублікований обсяг оперативної пам’яті на пристрої | ~191 МБ для тексту, ~567 МБ для повної моделі | Менше 200 МБ | Не опубліковано | Не опубліковано | Лише хмарне використання |
| Джерело | Картка моделі | Документація | Картка на HF | Картка на HF | Документація API |
Як запустити
Модель працює із sentence-transformers версії 6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT і MediaPipe. Qdrant відповідає за зберігання векторів, а Unsloth — за донавчання. Підтримка ML Kit для Android із прискоренням NPU з’явиться протягом кількох тижнів.
pip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))В Ollama виконайте ollama pull embeddinggemma-2. Доступні теги від 270m (378 МБ) до 740m (1,3 ГБ). Демонстрації доступні в Google AI Edge Gallery. Докладніше дивіться в посібнику для розробників.
Ключові висновки
- Одна відкрита модель на 740 млн параметрів вбудовує текст, код, зображення, відео та аудіо в спільний простір із 768 вимірами.
- Модульні енкодери дають змогу масштабувати обсяг моделі від 270 млн параметрів (текст) до 740 млн (повна мультимодальна модель).
- Пошук коду в MTEB Code покращується з 68,76 до 78,68.
- У разі квантизації модель використовує приблизно від 191 до 567 МБ оперативної пам’яті на Pixel 11 Pro.
FAQ
- Чи можна використовувати EmbeddingGemma 2 у комерційних цілях? Так. Вона випущена за ліцензією Apache 2.0.
- Скільки пам’яті потрібно EmbeddingGemma 2? Google повідомляє про близько 191 МБ активної оперативної пам’яті для використання лише з текстом і 567 МБ для повного мультимодального використання — у квантизованому вигляді на Pixel 11 Pro.
Ознайомтеся з вагами моделі на HF і технічними деталями. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.