jina-embeddings-v5-omni — коллекция jinaai
Мультимодальные (текст + изображение + видео + аудио) модели эмбеддингов, согласованные с jina-embeddings-v5-text-*. Два размера, по четыре варианта задач для каждого.
Коллекция jinaai
jina-embeddings-v5-omni: мультимодальные эмбеддинги с сохранением геометрических свойств текста через композицию замороженных башен
В этой работе мы представляем композицию моделей с замороженным энкодером — новый подход к созданию мультимодальных моделей эмбеддингов. Мы опираемся на архитектуру в стиле VLM, в которой нетекстовые энкодеры адаптируются для создания входных данных для языковой модели, которая, в свою очередь, генерирует эмбеддинги для всех типов входных данных. Мы представляем результат: набор jina-embeddings-v5-omni, пару моделей, которые кодируют текст, изображения, аудио и видео в единое семантическое пространство эмбеддингов. Наш метод заключается в расширении двух моделей Jina Embeddings v5 Text для поддержки дополнительных медиаданных путем добавления энкодеров для изображений и аудио. Базовые модели текстовых эмбеддингов и добавленные нетекстовые медиа-энкодеры остаются замороженными. Мы обучали только связующие компоненты, что составляет 0,35% от общего веса объединенной модели. Таким образом, обучение происходит гораздо эффективнее, чем при полной переобучении параметров. Кроме того, языковая модель остается практически неизменной, создавая точно такие же эмбеддинги для текстовых входных данных, как и модели Jina Embeddings v5 Text. Наши оценки показывают, что этот подход дает результаты, конкурентоспособные с современными аналогами, обеспечивая почти равную производительность с более крупными мультимодальными моделями эмбеддингов.
arXiv.org Florian Hönicke
Мы выпускаем jina-embeddings-v5-omni, расширяя наши модели эмбеддингов v5-text до поддержки изображений, аудио и видео. Обе модели используют ту же замороженную текстовую основу, что и v5-text, а это означает, что текстовые эмбеддинги идентичны — переиндексация не требуется. jina-embeddings-v5-omni-small набирает 53,93 балла в среднем по четырем модальностям, что соответствует LCO-7B (54,43) при в 5,7 раза меньшем количестве параметров, в то время как jina-embeddings-v5-omni-nano обеспечивает конкурентоспособный поиск по документам всего при 0,95 млрд параметров.
Архитектура
v5-omni сохраняет основу v5-text полностью замороженной и добавляет предобученные энкодеры зрения и аудио, соединенные через небольшие обучаемые проекторы:
- Зрение: энкодеры зрения Qwen3.5 (адаптированные из SigLIP2) с пространственным объединением 2x2 (сокращение токенов в 4 раза). Мы замораживаем все, кроме финального проекционного слоя (fc_vision_2), который заменяем случайно инициализированным слоем, отображающим данные в скрытую размерность текстовой основы.
- Аудио: энкодер Qwen2.5-Omni (адаптированный из Whisper-large-v3). Один случайно инициализированный слой fc_audio проецирует 1280-мерный выход в текстовую основу.
- Видео: обрабатывается как последовательность визуальных кадров, при необходимости предваряемая извлеченным аудиосегментом.
Модель наследует четыре специфичных для задач LoRA-адаптера от v5-text (поиск, сопоставление текста, классификация, кластеризация) и обучает отдельные веса проекторов для каждого варианта задачи. Архитектура полностью модульная: при развертывании только для текста не загружаются веса зрения или аудио (идентично объему v5-text), при работе только с изображениями пропускается аудио, а полная омни-версия загружает все.
Начало работы
Elasticsearch (Elastic Inference Service)
Если вы уже используете jina-embeddings-v5-text в Elasticsearch, ваши существующие текстовые индексы будут работать с v5-omni «из коробки». Омни-модели создают идентичные эмбеддинги для текстовых входных данных, что и v5-text — тот же вход, тот же вектор, байт в байт. Вам не нужно пересоздавать эмбеддинги или перестраивать какой-либо текстовый индекс. Чтобы начать поиск по изображениям, аудио и видео наряду с существующими текстовыми данными, просто создайте новый индекс с v5-omni и загрузите в него свой мультимодальный контент.
Создайте индекс semantic_text с v5-omni в качестве конечной точки вывода. EIS автоматически выбирает правильный LoRA-адаптер для индексации и поиска:
Загружайте текст, изображения (как base64 data URI), аудио и видео в одно и то же поле, в один и тот же индекс:
Ищите по всем модальностям с помощью одного текстового запроса:
Jina Embedding API
Hugging Face
Обучение
Основная идея — композиция моделей с замороженным энкодером: возьмите мощную модель текстовых эмбеддингов, добавьте предобученные энкодеры зрения и аудио, соедините их небольшими обучаемыми проекторами и заморозьте все, кроме этих проекторов. Обучается только 0,35% от общего веса, что дает нам три свойства: (1) сохранение идентичности текста — основа не модифицируется, тот же вход дает идентичный выход; (2) эффективность обучения — обучение только проекторов в 1,8–3,9 раза быстрее при использовании на 42–64% меньше памяти GPU; (3) модульность — башни можно загружать независимо.
v5-omni наследует поддержку размерности Matryoshka от v5-text. Эмбеддинги изображений и аудио сохраняют большую часть качества при усечении, в то время как видео деградирует сильнее при малых размерностях.
Заключение
Принято считать, что мультимодальные эмбеддинги требуют обучения всей модели целиком. Мы не согласны. v5-omni замораживает текстовую основу, обучает 0,35% весов и соответствует моделям, которые в 5–7 раз больше. Урок: композиция лучше переобучения. Мощный текстовый энкодер — это самая сложная часть; как только он у вас есть, добавление зрения и аудио через легкие проекторы практически бесплатно.
Это важно для производства. Ваши существующие индексы v5-text остаются нетронутыми. Тот же запрос, тот же вектор, байт в байт. Вы просто получили поиск по изображениям, аудио и видео без переиндексации ни одного документа. Это настоящий прорыв: мультимодальный поиск как простое обновление, а не проект по миграции.
jina-embeddings-v5-omni-small — это самая эффективная омни-модель эмбеддингов с открытыми весами среди моделей до 2 млрд параметров. jina-embeddings-v5-omni-nano делает то же самое при 0,9 млрд параметров. Обе доступны прямо сейчас на Hugging Face, через Jina Search Foundation API и в качестве нативной конечной точки вывода в Elasticsearch.
