jina-embeddings-v5-omni — коллекция от jinaai
Мультимодальные (текст + изображение + видео + аудио) модели эмбеддингов, согласованные с jina-embeddings-v5-text-*. Два размера, по четыре варианта задач для каждого.
коллекция от jinaai
jina-embeddings-v5-omni: мультимодальные эмбеддинги с сохранением геометрических свойств текста посредством композиции замороженных башен
В этой работе мы представляем композицию моделей с замороженным энкодером — новый подход к созданию мультимодальных моделей эмбеддингов. Мы опираемся на архитектуру в стиле VLM, в которой нетекстовые энкодеры адаптируются для создания входных данных для языковой модели, которая, в свою очередь, генерирует эмбеддинги для всех типов входных данных. Мы представляем результат: набор моделей jina-embeddings-v5-omni, пару моделей, которые кодируют текст, изображения, аудио и видео в единое семантическое пространство эмбеддингов. Наш метод заключается в расширении двух моделей Jina Embeddings v5 Text для поддержки дополнительных медиаформатов путем добавления энкодеров для изображений и аудио. Основные модели текстовых эмбеддингов и добавленные нетекстовые медиа-энкодеры остаются замороженными. Мы обучили только связующие компоненты, что составляет 0,35% от общего веса совместной модели. Таким образом, обучение происходит гораздо эффективнее, чем при полной переобучении всех параметров. Кроме того, языковая модель остается практически неизменной, создавая точно такие же эмбеддинги для текстовых входных данных, как и модели Jina Embeddings v5 Text. Наши оценки показывают, что этот подход дает результаты, конкурентоспособные с современными аналогами, обеспечивая почти равную производительность с более крупными мультимодальными моделями эмбеддингов.
arXiv.orgFlorian Hönicke
Мы выпускаем jina-embeddings-v5-omni, расширяя наши модели эмбеддингов v5-text для работы с изображениями, аудио и видео. Обе модели используют ту же замороженную текстовую основу, что и v5-text, а это означает, что текстовые эмбеддинги идентичны — переиндексация не требуется. jina-embeddings-v5-omni-small набирает в среднем 53,93 балла по четырем модальностям, что соответствует LCO-7B (54,43) при в 5,7 раза меньшем количестве параметров, в то время как jina-embeddings-v5-omni-nano обеспечивает конкурентоспособный поиск по документам всего при 0,95 млрд параметров.
Архитектура
v5-omni сохраняет основу v5-text полностью замороженной и добавляет предварительно обученные энкодеры зрения и аудио, соединенные через небольшие обучаемые проекторы:
- Зрение: энкодеры зрения Qwen3.5 (адаптированные из SigLIP2) с пространственным объединением 2x2 (сокращение токенов в 4 раза). Мы замораживаем все, кроме финального проекционного слоя (fc_vision_2), который заменяем случайно инициализированным слоем, проецирующим данные в скрытую размерность текстовой основы.
- Аудио: энкодер Qwen2.5-Omni (адаптированный из Whisper-large-v3). Один случайно инициализированный слой fc_audio проецирует 1280-мерный выход в текстовую основу.
- Видео: обрабатывается как последовательность визуальных кадров, при необходимости предваряемая извлеченным аудиосегментом.
Модель наследует четыре специфичных для задач адаптера LoRA от v5-text (поиск, сопоставление текста, классификация, кластеризация) и обучает отдельные веса проекторов для каждого варианта задачи. Архитектура полностью модульная: развертывание только для текста не загружает веса зрения или аудио (идентично объему v5-text), только для изображений — пропускает аудио, полная версия omni — загружает все.
Начало работы
Elasticsearch (Elastic Inference Service)
Если вы уже используете jina-embeddings-v5-text в Elasticsearch, ваши существующие текстовые индексы будут работать с v5-omni «из коробки». Модели omni создают идентичные эмбеддинги для текстовых входных данных, что и v5-text — те же входные данные, тот же вектор, байт в байт. Вам не нужно пересоздавать эмбеддинги или перестраивать какой-либо текстовый индекс. Чтобы начать поиск по изображениям, аудио и видео наряду с существующими текстовыми данными, просто создайте новый индекс с v5-omni и загрузите в него свой мультимодальный контент.
Создайте индекс semantic_text с v5-omni в качестве конечной точки вывода. EIS автоматически выбирает правильный адаптер LoRA для индексации и поиска:
Загружайте текст, изображения (в виде URI данных base64), аудио и видео в одно и то же поле, в один и тот же индекс:
Ищите по всем модальностям с помощью одного текстового запроса:
Jina Embedding API
Hugging Face
Обучение
Основная идея заключается в композиции моделей с замороженным энкодером: возьмите мощную модель текстовых эмбеддингов, добавьте предварительно обученные энкодеры зрения и аудио, соедините их небольшими обучаемыми проекторами и заморозьте все, кроме этих проекторов. Обучается только 0,35% от общего веса, что дает нам три свойства: (1) сохранение идентичности текста — основа не модифицируется, те же входные данные дают идентичный выход; (2) эффективность обучения — обучение только проекторов в 1,8–3,9 раза быстрее при использовании на 42–64% меньше памяти GPU; (3) модульность — башни можно загружать независимо.
v5-omni наследует поддержку размерности Matryoshka от v5-text. Эмбеддинги изображений и аудио сохраняют большую часть качества при усечении, в то время как видео деградирует сильнее при малых размерностях.
Заключение
Принято считать, что мультимодальные эмбеддинги требуют обучения всей модели целиком. Мы не согласны. v5-omni замораживает текстовую основу, обучает 0,35% весов и соответствует моделям, которые в 5–7 раз больше. Урок: композиция лучше переобучения. Мощный текстовый энкодер — это самая сложная часть; как только он у вас есть, добавление зрения и аудио через легкие проекторы практически ничего не стоит.
Это важно для производства. Ваши существующие индексы v5-text остаются нетронутыми. Тот же запрос, тот же вектор, байт в байт. Вы просто получили поиск по изображениям, аудио и видео без необходимости повторного создания эмбеддингов для единого документа. Это настоящий прорыв — мультимодальный поиск как простое обновление, а не проект по миграции.
jina-embeddings-v5-omni-small — это самая эффективная модель эмбеддингов с открытыми весами omni с количеством параметров менее 2 млрд. jina-embeddings-v5-omni-nano делает это при 0,9 млрд. Обе доступны сейчас на Hugging Face, Jina Search Foundation API и в качестве встроенной конечной точки вывода в Elasticsearch.








