Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← Към новините

Google DeepMind пусна EmbeddingGemma 2 — 740M отворен мултимодален модел за ембединг, изграден върху Gemma 4

Google DeepMind пусна EmbeddingGemma 2, отворен модел, който вгражда текст, код, изображения, видео и аудио в едно 768-мерно пространство. Той има 740 млн. параметъра, контекстен прозорец от 8K токена и лиценз Apache 2.0. Насочен е към търсене на устройството, класификация и RAG с приоритет върху поверителността. Тази статия анализира, сравнява и показва как EmbeddingGemma 2 се вписва в тази област.

Може ли да бъде внедрен днес? Да. Теглата са налични в Hugging Face и Kaggle, а версии за Ollama, llama.cpp GGUF и LiteRT са налични още сега.

Какво прави един модел за вграждане

Моделът за вграждане преобразува съдържанието във вектор от числа, който улавя смисъла. Подобните елементи се оказват близо един до друг, така че лесно могат да бъдат търсени и сравнявани. В RAG конвейер тези вектори позволяват на LLM да извлича актуална информация, върху която не е бил обучен. Генерирането на вграждания локално запазва данните на устройството, намалява латентността и работи офлайн.

Едно векторно пространство за всяка модалност

EmbeddingGemma 2 е изграден върху архитектурата Gemma 4. Текстова заявка може да извлече снимка. Гласова бележка може да извлече видеоклип. Редуващи се входове, като продуктова обява с текст, изображения и демонстрационно видео, генерират едно вграждане.

Дизайнът е модулен. Той има три части:

  • Основа за текст и код: 270 млн. параметъра (130 млн. трансформър плюс 140 млн. за вграждане)
  • Визуален енкодер: 170 млн. параметъра, по избор
  • Аудио енкодер: 300 млн. параметъра, по избор

Разработчиците зареждат само необходимото: 270 млн. за текст, 440 млн. за текст и изображения, 570 млн. за текст и аудио или 740 млн. за всичко. Всички конфигурации споделят едно векторно пространство. Заявка, вградена с конфигурацията само за текст, може да съвпадне с документи, вградени от пълния модел.

Контекстният прозорец е 8192 токена — 4 пъти по-голям от този във версия 1. Това побира около 29 изображения, 58 видео кадъра или 5,5 минути аудио.

Бенчмаркове

Изследователският екип на Google отчита водещи резултати сред мултимодалните модели за вграждане с под 1 млрд. параметъра в MTEB Code и MAEB. Резултати с пълна точност при 768 измерения:

БенчмаркEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.3661.15
MTEB Code v178.6868.76
MIEB lite (изображение)64.64н/п
MMEB v2 общо59.01н/п
MSEB retrieval (звук)69.54н/п
MAEB (аудио)49.39н/п

Източник: карта на модела EmbeddingGemma 2

Извличането на код печели 9,92 точки, или приблизително 14%. Качеството на многоезичния текст се запазва стабилно. По-големите модели все още водят в някои класации. Qwen3-VL-Embedding-2B отчита 73,2 при собственото си изпълнение на MMEB-V2, с около 2,7 пъти повече параметри и без поддръжка на аудио.

Създаден за телефони и лаптопи

При квантизация на Pixel 11 Pro активната RAM памет е около 191 MB за теглата само за текст. Пълният мултимодален модел се нуждае от около 567 MB. Обучението с отчитане на квантизацията компресира теглата до INT4 и INT8. Екипът на Google AI Edge измери 37,3 ms на изображение на графичния процесор на MacBook M5 Pro, използвайки бюджет от 70 токена за изображения.

Обучението за матрични представяния (MRL) позволява на разработчиците да съкращават векторите до 512, 256 или 128 измерения. Преминаването от 768 към 128 измерения намалява нуждата от място за съхранение до 6 пъти. При 256 измерения многоезичният MTEB спада само от 61,36 до 60,41. При 128 измерения MMEB пада до 45,65, затова Google препоръчва 128d основно за задачи само с текст.

Интерактивно обяснение

EmbeddingGemma 2 спрямо най-близките конкуренти

ФункцияEmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
РазработчикGoogle DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (изследователски)Google
Параметри740 млн. (270 млн. само за текст)308 млн.2 млрд.3 млрд. основа (5 млрд. посочени в HF)Не е разкрито
Текст / кодДаДаДаДаДа
ИзображенияДаНеДаДаДа
ВидеоДаНеДаДаДа
АудиоДаНеНеДаДа
Изходни измерения (MRL)768 (512, 256, 128)768 (до 128)До 2048 (64 до 2048)Не е посочено3072 (128 до 3072)
Контекст8192 токена2K токена32K токенаНе е посочено8192 токена
Езици100+100+30+Не е посочено100+
Лиценз / достъпApache 2.0, отворени теглаОтворени тегла (условията на Gemma)Apache 2.0, отворени теглаApache 2.0, отворени теглаСамо платен API
Публикувана RAM памет на устройството~191 MB за текст, ~567 MB за пълния моделПод 200 MBНе е публикуваноНе е публикуваноСамо в облака
ИзточникКарта на моделаДокументацияHF картаHF картаAPI документация

Как да го стартирате

Той работи със sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Qdrant се грижи за съхранението на векторите, а Unsloth — за дообучаването. Поддръжката на ML Kit за Android с ускорение от NPU ще бъде налична в рамките на няколко седмици.

Копиране на кодаКопираноИзползвайте друг браузър
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

В Ollama изпълнете ollama pull embeddinggemma-2. Таговете варират от 270m (378 MB) до 740m (1,3 GB). Демонстрации има в Google AI Edge Gallery. За повече информация вижте ръководството за разработчици.

Основни изводи

  • Един отворен модел с 740 млн. параметъра вгражда текст, код, изображения, видео и аудио в споделено 768-мерно пространство.
  • Модулните енкодери мащабират размера от 270 млн. (текст) до 740 млн. (пълна мултимодалност).
  • Извличането на код се повишава от 68,76 до 78,68 в MTEB Code.
  • Работи с около 191 до 567 MB RAM на Pixel 11 Pro при квантизация.

Често задавани въпроси

  • Може ли EmbeddingGemma 2 да се използва с търговска цел? Да. Той е пуснат под лиценза Apache 2.0.
  • От колко памет се нуждае EmbeddingGemma 2? Google посочва около 191 MB активна RAM памет при използване само за текст и 567 MB при пълно мултимодално използване, с квантизация, на Pixel 11 Pro.

Разгледайте теглата на модела в HF и техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? сега можете да се присъедините към нас и в Telegram.

[Спонсорирано] Уебсайтът е единственият API, който липсва на повечето агенти. Базите данни, календарите и хранилищата имат API. Отвореният уеб обаче до голяма степен няма. TinyFish MCP server дава на всеки MCP клиент четири инструмента: TinySearch, TinyFetch (пълни страници като markdown, включително JavaScript), TinyBrowser за влизания и формуляри и TinyAgent за многостъпкови задачи. Search и Fetch са безплатни.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини