Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.
TL;DR
EmbeddingGemma 2 - это мультимодальная модель эмбеддингов с открытым исходным кодом от Google DeepMind. Она преобразует текст, код, статические изображения, видео и аудио в единое 768-мерное векторное пространство с контекстным окном 8192 токена. Модель выпущена под лицензией Apache 2.0 и показывает результат 78.68 NDCG@10 в бенчмарке MTEB по поиску кода (против 68.76 у EmbeddingGemma 1). Поддерживается усечение векторов Matryoshka до 128 измерений, хотя при минимальном размере качество визуальных и аудиозадач снижается. Развертывание должно выполняться с использованием точности bfloat16 или float32, так как float16 приводит к скрытым ошибкам вычислений.
Что такое EmbeddingGemma 2?
EmbeddingGemma 2 - это легковесная мультимодальная модель эмбеддингов с открытым исходным кодом, опубликованная под лицензией Apache 2.0. EmbeddingGemma 2 проецирует текст, исходный код, статические изображения, кадры видео и аудио в единое 768-мерное пространство представлений.
Входные данные отображаются в общее пространство эмбеддингов. Вектор текстового запроса можно напрямую сравнивать с сохраненными векторами изображений, аудио или видео с помощью стандартных метрик расстояния.
| Тип входных данных | Конвейер обработки | Целевой результат |
|---|---|---|
| Текст и исходный код | Общий энкодер | 768-мерное векторное пространство |
| Изображения и кадры видео | Общий энкодер | 768-мерное векторное пространство |
| Аудиоклипы | Общий энкодер | 768-мерное векторное пространство |
Архитектура модели модульная. Разработчики могут загружать только те энкодеры модальностей, которые необходимы для их конвейера, чтобы снизить потребление памяти на устройствах с ограниченными ресурсами. Веса модели доступны на Hugging Face и Kaggle под идентификатором google/embeddinggemma-2 и работают напрямую через библиотеку SentenceTransformers.
Результаты бенчмарков
EmbeddingGemma 2 превосходит свою предшественницу в задачах поиска кода и многоязычных бенчмарках.
| Бенчмарк | Результат EmbeddingGemma 2 | Результат EmbeddingGemma 1 | Целевая метрика |
|---|---|---|---|
| MTEB (код, v1) | 78.68 | 68.76 | NDCG@10 |
| MTEB (многоязычный, v2) | 61.36 | 61.15 | Mean(Task) |
| MSEB (поиск) | 69.54 | - | Mean(Task) |
| Massive Image Embedding Benchmark (Lite) | 64.64 | - | Mean-TaskType |
Согласно документации Google DeepMind, модель набирает 78.68 NDCG@10 в бенчмарке MTEB (код, v1). Она достигает 61.36 Mean(Task) в MTEB (многоязычный, v2), охватывая более 100 языков. В задачах мультимодальной оценки модель показывает 69.54 Mean(Task) в MSEB Retrieval и 64.64 Mean-TaskType в Massive Image Embedding Benchmark (Lite).
Поддерживаемые типы входных данных
EmbeddingGemma 2 обрабатывает четыре основные категории входных данных:
- Текст и исходный код
- Статические изображения
- Видео
- Аудиоклипы
Все модальности отображаются непосредственно в одно и то же 768-мерное пространство. Кросс-модальный поиск работает «из коробки». Текстовая строка может соответствовать изображению, а аудиоклип - находить релевантные текстовые документы.
Модель принимает смешанные мультимодальные данные за один проход инференса. Вы можете подать изображение вместе с текстовым промптом. Энкодер обработает комбинированные данные в один вектор для последующего поиска.
Основные технические ограничения
Модель использует контекстное окно на 8192 токена. Все модальности делят этот лимит при одном вызове инференса.
Если вы подаете только один тип данных, лимит в 8192 токена вмещает около 5.5 минут аудио, 29 статических изображений или 58 кадров видео. Смешивание модальностей распределяет этот объем. Если промпт использует 4000 текстовых токенов, у вас остается половина контекстного окна для видеокадров или аудио. Размер визуальных данных - это компромисс между задержкой (latency) и качеством эмбеддингов.
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
embeddings = model.encode([
"def calculate_similarity(v1, v2): return np.dot(v1, v2)",
"file:///path/to/diagram.png"
])
# Усечение вектора с 768 до 256 измерений
truncated_embeddings = embeddings[:, :256]
Усечение векторов приводит к потере качества. EmbeddingGemma 2 поддерживает Matryoshka Representation Learning (MRL), позволяя сокращать выходные векторы с 768 до 512, 256 или 128 измерений. Усечение до 128 измерений вызывает значительную деградацию качества в мультимодальном поиске, особенно сильно затрагивая запросы по изображениям, видео и речи.
Ограничения точности и ошибки float16
Не используйте EmbeddingGemma 2 с точностью float16.
| Режим точности | Статус | Результат |
|---|---|---|
| float16 | Не поддерживается | Скрытые ошибки или NaNs |
| bfloat16 | Поддерживается | Рекомендуемый режим |
| float32 | Поддерживается | Рекомендуемый режим |
В документации Google DeepMind прямо указано, что float16 не поддерживается. Использование float16 приводит к скрытым ошибкам или генерации значений NaN при создании эмбеддингов.
Для развертывания необходимо использовать bfloat16 или float32. Если целевое оборудование не поддерживает bfloat16 нативно, переключитесь на стандартный float32 для обеспечения вычислительной стабильности.
Оборудование и варианты развертывания
EmbeddingGemma 2 работает локально на потребительских CPU, GPU и NPU. Специализированные варианты развертывания включают Google AI Edge, ML Kit, MediaPipe и LiteRT. Веб-приложения могут запускать модель прямо в браузере с помощью transformers.js или WebGPU.
Модель поддерживает квантование INT8 и INT4 для работы с низкой задержкой на устройствах. Тарификация Gemini Embedding 2 осуществляется через сервисы Google Cloud.
Читайте также в блоге GPUniq
Методология
Facts are compiled from the vendor's own announcement and documentation, linked below, at the time of writing; where the vendor hasn't published a number it is marked as such. GPUniq prices, when the model is already available here, come from our live catalog.
Источники
- 1.EmbeddingGemma 2 model card — Google AI for Developers (просмотрено )
- 2.EmbeddingGemma 2: an open, lightweight multimodal embedding model — Google DeepMind (просмотрено )
Нужны недорогие GPU под ваш проект?
Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.
