Все статьи
LLM API Comparison & Cost/

Обзор EmbeddingGemma 2: бенчмарки и возможности

Мультимодальный поиск, бенчмарки MTEB, проблемы float16 и оптимизация аппаратных ресурсов.

4 мин чтения

Обзор EmbeddingGemma 2: бенчмарки и возможности — GPUniq
Данные на 2 источника

Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.

TL;DR

EmbeddingGemma 2 - это мультимодальная модель эмбеддингов с открытым исходным кодом от Google DeepMind. Она преобразует текст, код, статические изображения, видео и аудио в единое 768-мерное векторное пространство с контекстным окном 8192 токена. Модель выпущена под лицензией Apache 2.0 и показывает результат 78.68 NDCG@10 в бенчмарке MTEB по поиску кода (против 68.76 у EmbeddingGemma 1). Поддерживается усечение векторов Matryoshka до 128 измерений, хотя при минимальном размере качество визуальных и аудиозадач снижается. Развертывание должно выполняться с использованием точности bfloat16 или float32, так как float16 приводит к скрытым ошибкам вычислений.

Что такое EmbeddingGemma 2?

EmbeddingGemma 2 - это легковесная мультимодальная модель эмбеддингов с открытым исходным кодом, опубликованная под лицензией Apache 2.0. EmbeddingGemma 2 проецирует текст, исходный код, статические изображения, кадры видео и аудио в единое 768-мерное пространство представлений.

Входные данные отображаются в общее пространство эмбеддингов. Вектор текстового запроса можно напрямую сравнивать с сохраненными векторами изображений, аудио или видео с помощью стандартных метрик расстояния.

Тип входных данныхКонвейер обработкиЦелевой результат
Текст и исходный кодОбщий энкодер768-мерное векторное пространство
Изображения и кадры видеоОбщий энкодер768-мерное векторное пространство
АудиоклипыОбщий энкодер768-мерное векторное пространство

Архитектура модели модульная. Разработчики могут загружать только те энкодеры модальностей, которые необходимы для их конвейера, чтобы снизить потребление памяти на устройствах с ограниченными ресурсами. Веса модели доступны на Hugging Face и Kaggle под идентификатором google/embeddinggemma-2 и работают напрямую через библиотеку SentenceTransformers.

Результаты бенчмарков

EmbeddingGemma 2 превосходит свою предшественницу в задачах поиска кода и многоязычных бенчмарках.

БенчмаркРезультат EmbeddingGemma 2Результат EmbeddingGemma 1Целевая метрика
MTEB (код, v1)78.6868.76NDCG@10
MTEB (многоязычный, v2)61.3661.15Mean(Task)
MSEB (поиск)69.54-Mean(Task)
Massive Image Embedding Benchmark (Lite)64.64-Mean-TaskType

Согласно документации Google DeepMind, модель набирает 78.68 NDCG@10 в бенчмарке MTEB (код, v1). Она достигает 61.36 Mean(Task) в MTEB (многоязычный, v2), охватывая более 100 языков. В задачах мультимодальной оценки модель показывает 69.54 Mean(Task) в MSEB Retrieval и 64.64 Mean-TaskType в Massive Image Embedding Benchmark (Lite).

Поддерживаемые типы входных данных

EmbeddingGemma 2 обрабатывает четыре основные категории входных данных:

  • Текст и исходный код
  • Статические изображения
  • Видео
  • Аудиоклипы

Все модальности отображаются непосредственно в одно и то же 768-мерное пространство. Кросс-модальный поиск работает «из коробки». Текстовая строка может соответствовать изображению, а аудиоклип - находить релевантные текстовые документы.

Модель принимает смешанные мультимодальные данные за один проход инференса. Вы можете подать изображение вместе с текстовым промптом. Энкодер обработает комбинированные данные в один вектор для последующего поиска.

Основные технические ограничения

Модель использует контекстное окно на 8192 токена. Все модальности делят этот лимит при одном вызове инференса.

Если вы подаете только один тип данных, лимит в 8192 токена вмещает около 5.5 минут аудио, 29 статических изображений или 58 кадров видео. Смешивание модальностей распределяет этот объем. Если промпт использует 4000 текстовых токенов, у вас остается половина контекстного окна для видеокадров или аудио. Размер визуальных данных - это компромисс между задержкой (latency) и качеством эмбеддингов.

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("google/embeddinggemma-2")

embeddings = model.encode([
    "def calculate_similarity(v1, v2): return np.dot(v1, v2)",
    "file:///path/to/diagram.png"
])

# Усечение вектора с 768 до 256 измерений
truncated_embeddings = embeddings[:, :256]

Усечение векторов приводит к потере качества. EmbeddingGemma 2 поддерживает Matryoshka Representation Learning (MRL), позволяя сокращать выходные векторы с 768 до 512, 256 или 128 измерений. Усечение до 128 измерений вызывает значительную деградацию качества в мультимодальном поиске, особенно сильно затрагивая запросы по изображениям, видео и речи.

Ограничения точности и ошибки float16

Не используйте EmbeddingGemma 2 с точностью float16.

Режим точностиСтатусРезультат
float16Не поддерживаетсяСкрытые ошибки или NaNs
bfloat16ПоддерживаетсяРекомендуемый режим
float32ПоддерживаетсяРекомендуемый режим

В документации Google DeepMind прямо указано, что float16 не поддерживается. Использование float16 приводит к скрытым ошибкам или генерации значений NaN при создании эмбеддингов.

Для развертывания необходимо использовать bfloat16 или float32. Если целевое оборудование не поддерживает bfloat16 нативно, переключитесь на стандартный float32 для обеспечения вычислительной стабильности.

Оборудование и варианты развертывания

EmbeddingGemma 2 работает локально на потребительских CPU, GPU и NPU. Специализированные варианты развертывания включают Google AI Edge, ML Kit, MediaPipe и LiteRT. Веб-приложения могут запускать модель прямо в браузере с помощью transformers.js или WebGPU.

Модель поддерживает квантование INT8 и INT4 для работы с низкой задержкой на устройствах. Тарификация Gemini Embedding 2 осуществляется через сервисы Google Cloud.

Читайте также в блоге GPUniq

Методология

Facts are compiled from the vendor's own announcement and documentation, linked below, at the time of writing; where the vendor hasn't published a number it is marked as such. GPUniq prices, when the model is already available here, come from our live catalog.

Источники

  1. 1.EmbeddingGemma 2 model card — Google AI for Developers (просмотрено )
  2. 2.EmbeddingGemma 2: an open, lightweight multimodal embedding model — Google DeepMind (просмотрено )

Нужны недорогие GPU под ваш проект?

Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.

Ещё в блоге GPUniq