Google DeepMind пусна EmbeddingGemma 2 — 740M отворен мултимодален модел за ембединг, изграден върху Gemma 4
Google DeepMind пусна EmbeddingGemma 2, отворен модел, който вгражда текст, код, изображения, видео и аудио в едно 768-мерно пространство. Той има 740 млн. параметъра, контекстен прозорец от 8K токена и лиценз Apache 2.0. Насочен е към търсене на устройството, класификация и RAG с приоритет върху поверителността. Тази статия анализира, сравнява и показва как EmbeddingGemma 2 се вписва в тази област.
Може ли да бъде внедрен днес? Да. Теглата са налични в Hugging Face и Kaggle, а версии за Ollama, llama.cpp GGUF и LiteRT са налични още сега.
Какво прави един модел за вграждане
Моделът за вграждане преобразува съдържанието във вектор от числа, който улавя смисъла. Подобните елементи се оказват близо един до друг, така че лесно могат да бъдат търсени и сравнявани. В RAG конвейер тези вектори позволяват на LLM да извлича актуална информация, върху която не е бил обучен. Генерирането на вграждания локално запазва данните на устройството, намалява латентността и работи офлайн.
Едно векторно пространство за всяка модалност
EmbeddingGemma 2 е изграден върху архитектурата Gemma 4. Текстова заявка може да извлече снимка. Гласова бележка може да извлече видеоклип. Редуващи се входове, като продуктова обява с текст, изображения и демонстрационно видео, генерират едно вграждане.
Дизайнът е модулен. Той има три части:
- Основа за текст и код: 270 млн. параметъра (130 млн. трансформър плюс 140 млн. за вграждане)
- Визуален енкодер: 170 млн. параметъра, по избор
- Аудио енкодер: 300 млн. параметъра, по избор
Разработчиците зареждат само необходимото: 270 млн. за текст, 440 млн. за текст и изображения, 570 млн. за текст и аудио или 740 млн. за всичко. Всички конфигурации споделят едно векторно пространство. Заявка, вградена с конфигурацията само за текст, може да съвпадне с документи, вградени от пълния модел.
Контекстният прозорец е 8192 токена — 4 пъти по-голям от този във версия 1. Това побира около 29 изображения, 58 видео кадъра или 5,5 минути аудио.
Бенчмаркове
Изследователският екип на Google отчита водещи резултати сред мултимодалните модели за вграждане с под 1 млрд. параметъра в MTEB Code и MAEB. Резултати с пълна точност при 768 измерения:
| Бенчмарк | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (изображение) | 64.64 | н/п |
| MMEB v2 общо | 59.01 | н/п |
| MSEB retrieval (звук) | 69.54 | н/п |
| MAEB (аудио) | 49.39 | н/п |
Източник: карта на модела EmbeddingGemma 2
Извличането на код печели 9,92 точки, или приблизително 14%. Качеството на многоезичния текст се запазва стабилно. По-големите модели все още водят в някои класации. Qwen3-VL-Embedding-2B отчита 73,2 при собственото си изпълнение на MMEB-V2, с около 2,7 пъти повече параметри и без поддръжка на аудио.
Създаден за телефони и лаптопи
При квантизация на Pixel 11 Pro активната RAM памет е около 191 MB за теглата само за текст. Пълният мултимодален модел се нуждае от около 567 MB. Обучението с отчитане на квантизацията компресира теглата до INT4 и INT8. Екипът на Google AI Edge измери 37,3 ms на изображение на графичния процесор на MacBook M5 Pro, използвайки бюджет от 70 токена за изображения.
Обучението за матрични представяния (MRL) позволява на разработчиците да съкращават векторите до 512, 256 или 128 измерения. Преминаването от 768 към 128 измерения намалява нуждата от място за съхранение до 6 пъти. При 256 измерения многоезичният MTEB спада само от 61,36 до 60,41. При 128 измерения MMEB пада до 45,65, затова Google препоръчва 128d основно за задачи само с текст.
Интерактивно обяснение
EmbeddingGemma 2 спрямо най-близките конкуренти
| Функция | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| Разработчик | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (изследователски) | |
| Параметри | 740 млн. (270 млн. само за текст) | 308 млн. | 2 млрд. | 3 млрд. основа (5 млрд. посочени в HF) | Не е разкрито |
| Текст / код | Да | Да | Да | Да | Да |
| Изображения | Да | Не | Да | Да | Да |
| Видео | Да | Не | Да | Да | Да |
| Аудио | Да | Не | Не | Да | Да |
| Изходни измерения (MRL) | 768 (512, 256, 128) | 768 (до 128) | До 2048 (64 до 2048) | Не е посочено | 3072 (128 до 3072) |
| Контекст | 8192 токена | 2K токена | 32K токена | Не е посочено | 8192 токена |
| Езици | 100+ | 100+ | 30+ | Не е посочено | 100+ |
| Лиценз / достъп | Apache 2.0, отворени тегла | Отворени тегла (условията на Gemma) | Apache 2.0, отворени тегла | Apache 2.0, отворени тегла | Само платен API |
| Публикувана RAM памет на устройството | ~191 MB за текст, ~567 MB за пълния модел | Под 200 MB | Не е публикувано | Не е публикувано | Само в облака |
| Източник | Карта на модела | Документация | HF карта | HF карта | API документация |
Как да го стартирате
Той работи със sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Qdrant се грижи за съхранението на векторите, а Unsloth — за дообучаването. Поддръжката на ML Kit за Android с ускорение от NPU ще бъде налична в рамките на няколко седмици.
pip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))В Ollama изпълнете ollama pull embeddinggemma-2. Таговете варират от 270m (378 MB) до 740m (1,3 GB). Демонстрации има в Google AI Edge Gallery. За повече информация вижте ръководството за разработчици.
Основни изводи
- Един отворен модел с 740 млн. параметъра вгражда текст, код, изображения, видео и аудио в споделено 768-мерно пространство.
- Модулните енкодери мащабират размера от 270 млн. (текст) до 740 млн. (пълна мултимодалност).
- Извличането на код се повишава от 68,76 до 78,68 в MTEB Code.
- Работи с около 191 до 567 MB RAM на Pixel 11 Pro при квантизация.
Често задавани въпроси
- Може ли EmbeddingGemma 2 да се използва с търговска цел? Да. Той е пуснат под лиценза Apache 2.0.
- От колко памет се нуждае EmbeddingGemma 2? Google посочва около 191 MB активна RAM памет при използване само за текст и 567 MB при пълно мултимодално използване, с квантизация, на Pixel 11 Pro.
Разгледайте теглата на модела в HF и техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? сега можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.