Google выпустила EmbeddingGemma 2, открытую модель, которая преобразует тексты, изображения, видео, аудио и код в числовые векторы, чтобы схожий контент можно было легче находить и сравнивать. По словам Google, модель с 740 миллионами параметров является самой компактной моделью такого рода и превосходит конкурирующие модели размером до вдвое больше на мультимодальных бенчмарках эмбеддингов.
EmbeddingGemma 2 набирает 78,68 балла в Massive Text Embedding Benchmark (Code), почти на 10 баллов больше, чем её предшественница (68,76). Это ставит её на один уровень со значительно более крупными моделями. | Изображение: Google
Модель работает локально без ключа API. Каждый запрос занимает примерно от 20 до 70 миллисекунд при использовании WebGPU в браузере. Ей требуется всего около 191 МБ оперативной памяти, а объём локального хранилища векторной базы данных сокращается до шести раз. Для задач, связанных только с текстом, достаточно версии со 270 миллионами параметров.
В сочетании с небольшими открытыми моделями, такими как Gemma 4, EmbeddingGemma 2 позволяет запускать офлайн-приложения RAG без отправки данных на внешние серверы. Веса доступны на платформах Hugging Face и Kaggle, а также опубликованы руководство для разработчиков и документация.
Новости об ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный доклад о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.