Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Jina embeddings v5 omni embeddingi dlya teksta izobrazheniy audio i video 2
Dev48

© 2026 · All rights reserved.

jina-embeddings-v5-omni: эмбеддинги для текста, изображений, аудио и видео

Источник: Jina AI

jina-embeddings-v5-omni: эмбеддинги для текста, изображений, аудио и видео

Источник: Jina AI

Одна модель, четыре модальности: текст, изображение, аудио, видео. Лучшие в своем классе омни-эмбеддинги с 1,6 млрд и 0,9 млрд параметров.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

jina-embeddings-v5-omni — коллекция от jinaai

Мультимодальные (текст + изображение + видео + аудио) модели эмбеддингов, согласованные с jina-embeddings-v5-text-*. Два размера, по четыре варианта задач для каждого.

коллекция от jinaai

jina-embeddings-v5-omni: мультимодальные эмбеддинги с сохранением геометрических свойств текста посредством композиции замороженных башен

В этой работе мы представляем композицию моделей с замороженным энкодером — новый подход к созданию мультимодальных моделей эмбеддингов. Мы опираемся на архитектуру в стиле VLM, в которой нетекстовые энкодеры адаптируются для создания входных данных для языковой модели, которая, в свою очередь, генерирует эмбеддинги для всех типов входных данных. Мы представляем результат: набор моделей jina-embeddings-v5-omni, пару моделей, которые кодируют текст, изображения, аудио и видео в единое семантическое пространство эмбеддингов. Наш метод заключается в расширении двух моделей Jina Embeddings v5 Text для поддержки дополнительных медиаформатов путем добавления энкодеров для изображений и аудио. Основные модели текстовых эмбеддингов и добавленные нетекстовые медиа-энкодеры остаются замороженными. Мы обучили только связующие компоненты, что составляет 0,35% от общего веса совместной модели. Таким образом, обучение происходит гораздо эффективнее, чем при полной переобучении всех параметров. Кроме того, языковая модель остается практически неизменной, создавая точно такие же эмбеддинги для текстовых входных данных, как и модели Jina Embeddings v5 Text. Наши оценки показывают, что этот подход дает результаты, конкурентоспособные с современными аналогами, обеспечивая почти равную производительность с более крупными мультимодальными моделями эмбеддингов.

arXiv.orgFlorian Hönicke

Мы выпускаем jina-embeddings-v5-omni, расширяя наши модели эмбеддингов v5-text для работы с изображениями, аудио и видео. Обе модели используют ту же замороженную текстовую основу, что и v5-text, а это означает, что текстовые эмбеддинги идентичны — переиндексация не требуется. jina-embeddings-v5-omni-small набирает в среднем 53,93 балла по четырем модальностям, что соответствует LCO-7B (54,43) при в 5,7 раза меньшем количестве параметров, в то время как jina-embeddings-v5-omni-nano обеспечивает конкурентоспособный поиск по документам всего при 0,95 млрд параметров.

Архитектура

v5-omni сохраняет основу v5-text полностью замороженной и добавляет предварительно обученные энкодеры зрения и аудио, соединенные через небольшие обучаемые проекторы:

  • Зрение: энкодеры зрения Qwen3.5 (адаптированные из SigLIP2) с пространственным объединением 2x2 (сокращение токенов в 4 раза). Мы замораживаем все, кроме финального проекционного слоя (fc_vision_2), который заменяем случайно инициализированным слоем, проецирующим данные в скрытую размерность текстовой основы.
  • Аудио: энкодер Qwen2.5-Omni (адаптированный из Whisper-large-v3). Один случайно инициализированный слой fc_audio проецирует 1280-мерный выход в текстовую основу.
  • Видео: обрабатывается как последовательность визуальных кадров, при необходимости предваряемая извлеченным аудиосегментом.

Модель наследует четыре специфичных для задач адаптера LoRA от v5-text (поиск, сопоставление текста, классификация, кластеризация) и обучает отдельные веса проекторов для каждого варианта задачи. Архитектура полностью модульная: развертывание только для текста не загружает веса зрения или аудио (идентично объему v5-text), только для изображений — пропускает аудио, полная версия omni — загружает все.

Начало работы

Elasticsearch (Elastic Inference Service)

Если вы уже используете jina-embeddings-v5-text в Elasticsearch, ваши существующие текстовые индексы будут работать с v5-omni «из коробки». Модели omni создают идентичные эмбеддинги для текстовых входных данных, что и v5-text — те же входные данные, тот же вектор, байт в байт. Вам не нужно пересоздавать эмбеддинги или перестраивать какой-либо текстовый индекс. Чтобы начать поиск по изображениям, аудио и видео наряду с существующими текстовыми данными, просто создайте новый индекс с v5-omni и загрузите в него свой мультимодальный контент.

Создайте индекс semantic_text с v5-omni в качестве конечной точки вывода. EIS автоматически выбирает правильный адаптер LoRA для индексации и поиска:

Загружайте текст, изображения (в виде URI данных base64), аудио и видео в одно и то же поле, в один и тот же индекс:

Ищите по всем модальностям с помощью одного текстового запроса:

Jina Embedding API

Hugging Face

Обучение

Основная идея заключается в композиции моделей с замороженным энкодером: возьмите мощную модель текстовых эмбеддингов, добавьте предварительно обученные энкодеры зрения и аудио, соедините их небольшими обучаемыми проекторами и заморозьте все, кроме этих проекторов. Обучается только 0,35% от общего веса, что дает нам три свойства: (1) сохранение идентичности текста — основа не модифицируется, те же входные данные дают идентичный выход; (2) эффективность обучения — обучение только проекторов в 1,8–3,9 раза быстрее при использовании на 42–64% меньше памяти GPU; (3) модульность — башни можно загружать независимо.

v5-omni наследует поддержку размерности Matryoshka от v5-text. Эмбеддинги изображений и аудио сохраняют большую часть качества при усечении, в то время как видео деградирует сильнее при малых размерностях.

Заключение

Принято считать, что мультимодальные эмбеддинги требуют обучения всей модели целиком. Мы не согласны. v5-omni замораживает текстовую основу, обучает 0,35% весов и соответствует моделям, которые в 5–7 раз больше. Урок: композиция лучше переобучения. Мощный текстовый энкодер — это самая сложная часть; как только он у вас есть, добавление зрения и аудио через легкие проекторы практически ничего не стоит.

Это важно для производства. Ваши существующие индексы v5-text остаются нетронутыми. Тот же запрос, тот же вектор, байт в байт. Вы просто получили поиск по изображениям, аудио и видео без необходимости повторного создания эмбеддингов для единого документа. Это настоящий прорыв — мультимодальный поиск как простое обновление, а не проект по миграции.

jina-embeddings-v5-omni-small — это самая эффективная модель эмбеддингов с открытыми весами omni с количеством параметров менее 2 млрд. jina-embeddings-v5-omni-nano делает это при 0,9 млрд. Обе доступны сейчас на Hugging Face, Jina Search Foundation API и в качестве встроенной конечной точки вывода в Elasticsearch.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссовПресса
Momentum

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссов

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Компании выбирают САПР от PTC для разработки и проектирования продуктов
PTC

Компании выбирают САПР от PTC для разработки и проектирования продуктов

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста
PTC

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства
PTC

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства

Ещё от Jina AI

jina-ocr-v1: более быстрое распознавание документов на бюджетных GPU
Jina AI

jina-ocr-v1: более быстрое распознавание документов на бюджетных GPU

jina-reranker-v3.5: более быстрый списочный переранжировщик с гибридным вниманием и самодистилляцией
Jina AI

jina-reranker-v3.5: более быстрый списочный переранжировщик с гибридным вниманием и самодистилляцией

Создание аудиоэмбеддингов на основе мультимодальных LLM
Jina AI

Создание аудиоэмбеддингов на основе мультимодальных LLM

Идентификация моделей эмбеддингов по необработанным числовым значениям
Jina AI

Идентификация моделей эмбеддингов по необработанным числовым значениям