06 окт. 2026 г.
EmbeddingGemma 2 — это самая производительная модель для мультимодальных эмбеддингов на устройстве, которая нативно сопоставляет комбинации текста, изображений, аудио и видео в единое пространство эмбеддингов.
Сахил Дуа (Sahil Dua)
Инженер-исследователь, Google DeepMind
Энрике Шехтер Вера (Henrique Schechter Vera)
Инженер-исследователь, Google DeepMind
Ваш браузер не поддерживает элемент аудио.
Прослушать статью
[[duration]] минут
Этот контент создан с помощью Google AI. Генеративный ИИ является экспериментальным
Мы представили EmbeddingGemma в прошлом году, чтобы предоставить легкое решение для высококачественных текстовых эмбеддингов, помогающее вашим приложениям организовывать, искать и связывать информацию непосредственно на потребительском оборудовании. Реакция разработчиков превзошла все наши ожидания. Имея более 20 миллионов загрузок, разработчики использовали ее для создания более интеллектуальных инструментов поиска на устройстве и конвейеров дополненной генерации (RAG) с приоритетом конфиденциальности.
Сегодня мы выпускаем EmbeddingGemma 2, расширяя возможности за пределы текста, чтобы объединить код, изображения, видео и аудио в общем пространстве эмбеддингов. Созданная на архитектуре Gemma 4 и выпущенная под разрешительной коммерческой лицензией Apache 2.0, модель EmbeddingGemma 2 имеет 740 миллионов параметров, что делает ее оптимальной для инференса на устройстве. Она может помочь найти конкретный видеоклип по голосовой заметке или выполнить поиск по часам аудиозаписей на основе текстового запроса — и все это обрабатывается единой нативно мультимодальной моделью.
Созданная на основе тех же технологий, что и модели Gemini Embedding, EmbeddingGemma 2 обладает следующими характеристиками:
- Лучшая в своем классе для своего размера: демонстрирует ведущие показатели среди мультимодальных эмбеддеров размером менее 1 млрд параметров по таким бенчмаркам, как MTEB (Massive Text Embedding Benchmark) Code и MAEB (Massive Audio Embedding Benchmark), при этом не уступая или превосходя многие более крупные модели в задачах с текстом, визуальным контентом и аудио.
- Модульная конструкция: требует всего от 270 млн параметров для чисто текстовых рабочих нагрузок с опциональными энкодерами для визуальных данных (170 млн) и аудио (300 млн) для полной мультимодальной поддержки.
- Эффективность хранения: благодаря обучению с использованием матрешечных представлений (MRL) разработчики могут динамически сокращать выходные векторы с 768 размерностей до 512, 256 или 128 размерностей. Это обеспечивает сокращение объема памяти до 6 раз для локальных векторных баз данных и экономию памяти.
- Оптимизация для производительности на устройстве: эффективно работает в условиях жестких ограничений ресурсов. Благодаря квантованию на Google Pixel 11 Pro для EmbeddingGemma 2 требуется всего около 191 МБ активной оперативной памяти для весов только текста и около 567 МБ для полной мультимодальной модели.
- Готовность к расширенному контексту: поддерживает окно контекста в 8K токенов (в 4 раза больше, чем EmbeddingGemma 1), позволяя обрабатывать до 5,5 минут аудио, 29 изображений, 58 видеокадров или их чередующиеся комбинации непосредственно на локальном оборудовании.
Достижение высочайшего качества для кода, визуального контента и аудио
EmbeddingGemma 2 соответствует высоким показателям многоязычного текста EmbeddingGemma и при этом обеспечивает значительное улучшение производительности кода на 9,92 балла (в MTEB Code — с 68,76 до 78,68), что делает ее отлично подходящей для индексации локальной кодовой базы, семантического поиска кода и поиска с помощью агентов кодирования. Для изображений, видео, документов и аудио она устанавливает новый стандарт качества на один параметр для моделей размером менее 1B и даже превосходит некоторые специализированные модели, которые вдвое крупнее.
Полные метрики оценки и информацию о моделях можно найти в EmbeddingGemma 2 model card.
Обеспечение семантического поиска, маршрутизации и извлечения данных полностью на устройстве
EmbeddingGemma 2 переносит надежные возможности непосредственно на периферийное оборудование. Генерация эмбеддингов локально помогает обеспечить конфиденциальность данных, снижает задержку конвейера и позволяет разработчикам создавать кросс-модальный поиск и извлечение данных, которые работают полностью в автономном режиме.
В паре с генеративными моделями, такими как Gemma 4, EmbeddingGemma 2 обеспечивает работу RAG-пайплайнов на устройстве, которые понимают сложные мультимодальные данные. Поскольку EmbeddingGemma 2 создана на базе Gemma 4 и использует тот же текстовый токенизатор и аудиоэнкодер, разработчики могут запускать обе модели вместе в едином конвейере с меньшим суммарным объемом используемой памяти.
Чтобы узнать, как создавать поиск на устройстве и RAG-системы с помощью LiteRT, читайте пост в блоге Google AI Edge.
Начало работы с EmbeddingGemma 2
Мы тесно сотрудничали со следующими партнерами, чтобы EmbeddingGemma 2 работала именно там, где вы создаете свои продукты:
- Загрузите модели: веса моделей можно найти на Hugging Face и Kaggle, а в скором времени ожидается их появление в Gemini Enterprise Agent Platform Model Garden. Посетите LiteRT Community на Hugging Face для получения моделей, оптимизированных для работы на устройствах.
- Развертывание на устройстве: разрабатывайте кроссплатформенные приложения с помощью Google AI Edge MediaPipe для готовых задач встраивания, поиска и принятия решений или LiteRT для интеграции пользовательских моделей. Создавайте приложения для браузера с помощью transformers.js или WebGPU.
- Используйте свои любимые инструменты разработки: эффективно обслуживайте модель с помощью transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio. Сохраняйте векторные эмбеддинги с помощью Qdrant.
- Тонкая настройка (Fine-tuning): следуйте инструкциям Unsloth по тонкой настройке EmbeddingGemma 2 для ваших сценариев использования.
Ознакомьтесь с нашим руководством разработчика, documentation, а также руководствами для inference и fine-tuning.











