Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← До новин

Google DeepMind випустила EmbeddingGemma 2 — відкриту мультимодальну модель ембедингів на 740M, створену на базі Gemma 4

Google DeepMind випустила EmbeddingGemma 2 — відкриту модель, яка вбудовує текст, код, зображення, відео та аудіо в єдиний 768-вимірний простір. Вона має 740 млн параметрів, контекстне вікно на 8 тис. токенів і ліцензію Apache 2.0. Модель призначена для пошуку на пристроях, класифікації та RAG із пріоритетом конфіденційності. У цій статті аналізується, порівнюється та демонструється, як EmbeddingGemma 2 вписується в цей простір.

Можна розгорнути вже сьогодні? Так. Ваги доступні на Hugging Face і Kaggle, а збірки для Ollama, llama.cpp GGUF і LiteRT уже доступні.

Що робить модель вбудовування

Модель вбудовування перетворює контент на вектор чисел, який передає його значення. Схожі елементи опиняються поруч, тому їх легко шукати й порівнювати. У конвеєрі RAG ці вектори дають змогу LLM отримувати актуальну інформацію, на якій її не навчали. Генерування вбудовувань локально зберігає дані на пристрої, зменшує затримку та дає змогу працювати офлайн.

Єдиний векторний простір для всіх модальностей

EmbeddingGemma 2 побудована на архітектурі Gemma 4. Текстовий запит може знайти фотографію. Голосова нотатка може знайти відеокліп. Комбіновані вхідні дані, як-от опис товару з текстом, зображеннями та демонстраційним відео, створюють єдине вбудовування.

Архітектура модульна. Вона складається з трьох частин:

  • Основа для тексту й коду: 270 млн параметрів (130 млн у трансформері та 140 млн у модулі вбудовування)
  • Візуальний енкодер: 170 млн параметрів, опційно
  • Аудіоенкодер: 300 млн параметрів, опційно

Розробники завантажують лише потрібні компоненти: 270 млн для тексту, 440 млн для тексту й зображень, 570 млн для тексту й аудіо або 740 млн для всього. Усі конфігурації використовують один векторний простір. Запит, вбудований за допомогою конфігурації лише для тексту, може зіставлятися з документами, вбудованими повною моделлю.

Контекстне вікно становить 8 192 токени — у 4 рази більше, ніж у версії 1. Цього достатньо приблизно для 29 зображень, 58 відеокадрів або 5,5 хвилини аудіо.

Бенчмарки

Дослідницька команда Google повідомляє про провідні результати серед мультимодальних моделей вбудовування з менш ніж 1 млрд параметрів у MTEB Code та MAEB. Результати у повній точності для 768 вимірів:

БенчмаркEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.3661.15
MTEB Code v178.6868.76
MIEB lite (зображення)64.64н/д
MMEB v2 загальний59.01н/д
MSEB retrieval (звук)69.54н/д
MAEB (аудіо)49.39н/д

Джерело: картка моделі EmbeddingGemma 2

Пошук коду покращився на 9,92 бала, приблизно на 14%. Якість багатомовного тексту залишається стабільною. Більші моделі все ще лідирують у деяких рейтингах. Qwen3-VL-Embedding-2B повідомляє про результат 73,2 у власному запуску MMEB-V2, маючи приблизно у 2,7 раза більше параметрів і не підтримуючи аудіо.

Створена для телефонів і ноутбуків

У разі квантизації на Pixel 11 Pro активна оперативна пам’ять для ваг лише текстової моделі становить близько 191 МБ. Повній мультимодальній моделі потрібно близько 567 МБ. Навчання з урахуванням квантизації стискає ваги до INT4 та INT8. Команда Google AI Edge виміряла 37,3 мс на зображення на GPU MacBook M5 Pro, використовуючи бюджет у 70 токенів для візуальної модальності.

Matryoshka Representation Learning (MRL) дає змогу розробникам скорочувати вектори до 512, 256 або 128 вимірів. Перехід від 768 до 128 вимірів зменшує обсяг сховища до 6 разів. За 256 вимірів показник MTEB multilingual знижується лише з 61,36 до 60,41. За 128 вимірів MMEB падає до 45,65, тому Google рекомендує 128-вимірний варіант переважно для робочих навантажень лише з текстом.

Інтерактивне пояснення

EmbeddingGemma 2 проти найближчих конкурентів

ФункціяEmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
РозробникGoogle DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (дослідження)Google
Параметри740 млн (270 млн лише для тексту)308 млн2 млрдОснова 3 млрд (5 млрд зазначено на HF)Не розголошено
Текст / кодТакТакТакТакТак
ЗображенняТакНіТакТакТак
ВідеоТакНіТакТакТак
АудіоТакНіНіТакТак
Вихідні виміри (MRL)768 (512, 256, 128)768 (до 128)До 2048 (від 64 до 2048)Не зазначено3072 (від 128 до 3072)
Контекст8 192 токени2 тис. токенів32 тис. токенівНе зазначено8 192 токени
Мови100+100+30+Не зазначено100+
Ліцензія / доступApache 2.0, відкриті вагиВідкриті ваги (умови Gemma)Apache 2.0, відкриті вагиApache 2.0, відкриті вагиЛише платний API
Опублікований обсяг оперативної пам’яті на пристрої~191 МБ для тексту, ~567 МБ для повної моделіМенше 200 МБНе опублікованоНе опублікованоЛише хмарне використання
ДжерелоКартка моделіДокументаціяКартка на HFКартка на HFДокументація API

Як запустити

Модель працює із sentence-transformers версії 6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT і MediaPipe. Qdrant відповідає за зберігання векторів, а Unsloth — за донавчання. Підтримка ML Kit для Android із прискоренням NPU з’явиться протягом кількох тижнів.

Копіювати кодСкопійованоВикористати інший браузер
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

В Ollama виконайте ollama pull embeddinggemma-2. Доступні теги від 270m (378 МБ) до 740m (1,3 ГБ). Демонстрації доступні в Google AI Edge Gallery. Докладніше дивіться в посібнику для розробників.

Ключові висновки

  • Одна відкрита модель на 740 млн параметрів вбудовує текст, код, зображення, відео та аудіо в спільний простір із 768 вимірами.
  • Модульні енкодери дають змогу масштабувати обсяг моделі від 270 млн параметрів (текст) до 740 млн (повна мультимодальна модель).
  • Пошук коду в MTEB Code покращується з 68,76 до 78,68.
  • У разі квантизації модель використовує приблизно від 191 до 567 МБ оперативної пам’яті на Pixel 11 Pro.

FAQ

  • Чи можна використовувати EmbeddingGemma 2 у комерційних цілях? Так. Вона випущена за ліцензією Apache 2.0.
  • Скільки пам’яті потрібно EmbeddingGemma 2? Google повідомляє про близько 191 МБ активної оперативної пам’яті для використання лише з текстом і 567 МБ для повного мультимодального використання — у квантизованому вигляді на Pixel 11 Pro.

Ознайомтеся з вагами моделі на HF і технічними деталями. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

[Реклама] Веб — це єдиний API, якого бракує більшості агентів. Бази даних, календарі та репозиторії мають API. У відкритого вебу його здебільшого немає. MCP-сервер TinyFish надає будь-якому MCP-клієнту чотири інструменти: TinySearch, TinyFetch (повні сторінки у форматі Markdown, включно з JavaScript), TinyBrowser для входу в облікові записи та роботи з формами і TinyAgent для багатокрокових завдань. Search і Fetch безкоштовні.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини