Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Jina reranker v35 bolee bystryy spisochnyy pereranzhirovschik s gibridnym vniman
Dev48

© 2026 · All rights reserved.

jina-reranker-v3.5: более быстрый списочный переранжировщик с гибридным вниманием и самодистилляцией

Фото: Brett Jordan (Unsplash) — https://unsplash.com/photos/a-close-up-of-a-book-with-writing-on-it-PB6DwmcAGts?utm_source=dev48&utm_medium=referral

jina-reranker-v3.5: более быстрый списочный переранжировщик с гибридным вниманием и самодистилляцией

Источник: Jina AI

Списочный переранжировщик с 0,6 млрд параметров, который превосходит Qwen3-Reranker-4B на BEIR, работает до 1,56 раза быстрее, чем v3, и дает прирост 9,6 nDCG@10 на полуструктурированном поиске.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

jinaai/jina-reranker-v3.5 · Hugging Face

Мы стремимся развивать и демократизировать искусственный интеллект с помощью открытого исходного кода и открытой науки.

jina-reranker-v3.5: эффективный списочный переранжировщик с гибридным вниманием и самодистилляцией

Списочные переранжировщики (listwise rerankers) являются дискриминативным ядром конвейеров агентного поиска, однако их внедрение в производство требует одновременной эффективности, доменной устойчивости и беглости при работе с полуструктурированными данными. Мы представляем jina-reranker-v3.5, списочный переранжировщик с 0,6 млрд параметров, который отвечает этим требованиям, не жертвуя сравнением между документами, которое делает его предшественник jina-reranker-v3 эффективным. jina-reranker-v3.5 сохраняет механизм взаимодействия «последний-но-не-поздний» (LBNL) из jina-reranker-v3 и перерабатывает его по трем направлениям. Он заменяет равномерное глобальное внимание гибридным расписанием из трех слоев со скользящим окном, за которыми следуют два глобальных слоя, закрепляя терминальный слой как глобальный, что необходимо для считывания LBNL. Модель обучается на тщательно отобранной многодоменной смеси, охватывающей юридический, медицинский, финансовый, многоязычный и структурированный поиск. Она передает качество через трехэтапный рецепт самодистилляции, в котором учитель с полным вниманием устанавливает верхнюю границу, которую ученик с разреженным вниманием затем восстанавливает в рамках протокола поэтапной адаптации. jina-reranker-v3.5 достигает 63,20 nDCG@10 на BEIR, сравниваясь с моделью 4B при примерно в 7 раз меньшем количестве параметров, а также превосходит jina-reranker-v3 на MIRACL и RTEB. Наибольший прирост достигается в полуструктурированном поиске, где он повышает nDCG@10 на 9,6 пункта по сравнению с jina-reranker-v3 и лидирует среди всех переранжировщиков сопоставимого размера. Гибридное расписание дополнительно сокращает задержку списочного вывода до 1,56 раза. Мы выпускаем веса модели на Hugging Face по некоммерческой лицензии.

arXiv.orgChristina Nasika

Сегодня мы выпускаем jina-reranker-v3.5, списочный переранжировщик с 0,6 млрд параметров, который сохраняет взаимодействие «последний-но-не-поздний» из jina-reranker-v3, делая его быстрее и значительно эффективнее на данных, которые реально ищут предприятия. Он достигает 63,20 nDCG@10 на BEIR, опережая Qwen3-Reranker-4B при примерно в 7 раз меньшем количестве параметров, и переранжирует до 1,56 раза быстрее, чем v3 на длинных документах. Самый большой скачок наблюдается в полуструктурированном поиске: +9,6 nDCG@10 по сравнению с v3 на записях с ограничениями по полям.

Этого удалось достичь благодаря трем изменениям. Гибридное расписание внимания, которое заменяет большинство глобальных слоев скользящими окнами, закрепляя терминальный слой как глобальный. Обучающая смесь, составленная на основе сценариев сбоев в юридическом, медицинском, финансовом, многоязычном и структурированном поиске. И трехэтапный рецепт самодистилляции, где учитель и ученик имеют одинаковый размер и различаются только паттерном внимания.

Качество относительно количества параметров в четырех бенчмарках. jina-reranker-v3.5 находится на фронте Парето во всех четырех: ни одна из оцененных нами моделей не является одновременно меньше и лучше.

Архитектура

Списочное переранжирование оценивает каждого кандидата за один прямой проход, поэтому полное самовнимание по списку из 100 документов растет квадратично и увеличивает KV-кэш. Очевидное решение — внимание со скользящим окном. При взаимодействии LBNL это очевидное решение ломает модель.

В LBNL запрос и все кандидаты образуют одну причинно-следственную последовательность, а токен эмбеддинга запроса находится в самом конце. Он должен «видеть» весь путь назад к первому кандидату, чтобы построить представление, учитывающее контекст между документами. Конечное окно разрывает эту зависимость. Поэтому мы всегда закрепляем последний слой как глобальный, чтобы токены эмбеддинга запроса и документа наблюдали весь контекст кандидатов в момент извлечения. Замена этого единственного слоя на скользящее окно серьезно ухудшает списочное ранжирование; сохранение только его в качестве глобального позволяет поддерживать совместное кодирование без полностью глобального стека.

Для оставшихся 27 слоев мы протестировали расписания 1L1G, 1L2G, 3L2G и 5L1G. Победило 3L2G: три слоя со скользящим окном, за которыми следуют два глобальных слоя, повторяющиеся, что дает 17 локальных и 11 глобальных слоев с окном в 1024 токена. Локальные слои снижают стоимость внимания с O(L²) до O(L·w), в то время как глобальные слои каждые три шага обновляют долгосрочный сигнал между кандидатами на каждой глубине. Более плотные расписания не дали прироста пропускной способности; более агрессивное 5L1G показало худшие результаты в сложных многодокументных задачах.

Самодистилляция через разрыв внимания

Дистилляция здесь необычна. Мы не сжимаем большую модель в маленькую. Учитель и ученик имеют размер 0,6 млрд и различаются только паттерном внимания. Учитель использует полное внимание с квадратичными затратами; ученик использует 3L2G.

Принуждение ученика переключать маски внимания и одновременно соответствовать выходным данным учителя приводит к неудаче в обоих случаях, поэтому рецепт разделяет эти два давления:

  • Этап I — учитель с полным вниманием. Начиная с публичного чекпоинта jina-reranker-v3, мы полностью дообучаем учителя без ограничений скользящего окна на полной смеси v3.5. Это устанавливает потолок качества при данном бюджете параметров.
  • Этап II — адаптация с разреженным вниманием. Ученик инициализируется весами Этапа I и активирует 3L2G. Сначала мы обучаем только проекции внимания, замораживая все остальное, обучая разреженные маски направлять информацию, не нарушая представления, изученные при полном внимании. Затем мы размораживаем все, чтобы ученик перестроился под новую геометрию внимания. Ученик уже готов к развертыванию и работает быстрее на этом этапе, но на BEIR, RTEB-legal и MIRACL сохраняется стабильный разрыв с учителем.
  • Этап III — дистилляция под руководством учителя. При замороженном учителе мы выравниваем ученика по четырем уровням одновременно: списочный KL по распределениям оценок, нормализованным softmax, MSE по абсолютным оценкам, MSE по скрытым состояниям последнего слоя и косинусное расстояние по спроецированным эмбеддингам, плюс регуляризаторы контекстной схожести и дисперсии.

Порядок имеет значение. Один только Этап II оставляет заметный разрыв, потому что ученик должен изменить свою маршрутизацию под более слабой маской, прежде чем сможет безопасно имитировать оценки и состояния учителя. Этап III затем восстанавливает большую часть этого разрыва, что говорит о том, что емкость полного внимания действительно передается разреженному ученику после адаптации геометрии. Рецепт написан для 3L2G, но схема обобщается на другие несоответствия в расписании внимания.

Обучающие данные

Смесь v3 хорошо покрывала общий поиск, но плохо справлялась со специализированными доменами. Вместо добавления большего количества данных мы провели анализ ошибок на наборах разработки RTEB и STARK и создали каждый новый шардинг, чтобы покрыть именно те паттерны поиска, на которых ошибаются общие модели. Сложные негативные примеры поступают от нескольких поисковиков одновременно (BM25, Jina, BGE, GTE, E5, ColBERT), поэтому модель не может выучить «короткие пути» одного конкретного поисковика.

Юридический шардинг объединяет EUR-Lex multilingual, CLERC, AILA, канадское прецедентное право, швейцарскую суммаризацию дел и EuroVoc, с избыточной выборкой, поскольку юридический текст плотен на цитаты и длинный. Медицинский шардинг нацелен на клиническую формулировку и пассажи, насыщенные сущностями. Финансовый шардинг отдает приоритет числовым утверждениям, регуляторному языку и табличным данным. Многоязычное покрытие выходит за рамки MIRACL и mMARCO благодаря WebFAQ на 50+ языках, кросс-язычным негативным примерам SWIM-IR и японским парам Ruri-v3.

Структурированные данные получили наибольший вес при выборке, поскольку они находятся вне распределения свободного текста, которое предполагают стандартные бенчмарки. Релевантность записей и таблиц зависит от равенства, числовых и временных границ, принадлежности к списку и логических комбинаций между полями, а не от лексического совпадения. Первые запуски показали здесь наихудшие результаты, поэтому мы напрямую синтезировали пары с жесткими ограничениями.

Результаты экспериментов

Все показатели переранжируют топ-100 кандидатов из jina-embeddings-v5-text-small в рамках единого конвейера MTEB v2, поэтому они могут незначительно отличаться от цифр, заявленных поставщиком. Полные таблицы по каждому набору данных и языку приведены в статье.

Версия v3.5 превосходит v3 во всех семействах бенчмарков при том же количестве параметров, причем наибольший прирост наблюдается в полуструктурированном поиске.

Прирост в RTEB сосредоточен там, где была направлена смесь: AILA-Statute улучшился на 14,0 пунктов, а AILA-Case — на 11,7 по сравнению с v3, а FinQA достигла 86,91, что является лучшим результатом среди всех протестированных моделей. В STARK версия v3.5 превосходит v3 по всем трем официальным метрикам и показывает лучший результат Hit@5 в целом.

Одно примечание к протоколу Struct-IR. Бенчмарк индексирует миллионы объектов по каждой схеме, и показатель Recall@5 на первом этапе внутри схемы составляет около 0,04, поэтому сквозной процесс «поиск-затем-переранжирование» почти полностью ограничен полнотой поиска и плохо разделяет модели переранжирования. Вместо этого мы добавляем все эталонные документы вместе с 30 самыми сложными дистракторами первого этапа, что позволяет изолировать дискриминацию с ограничениями по полям от охвата поиска. Цифры в этой группе не сопоставимы с таблицей лидеров поиска SSRB.

Эффективность

Измерено на одном NVIDIA A100, размер пакета 1, списочные входные данные топ-100, FlashAttention-2.

Поскольку в промышленном списочном переранжировании преобладает однократное предварительное заполнение для нового набора кандидатов, эти сокращения напрямую трансформируются в более длинные списки кандидатов и более крупные документы при фиксированном бюджете обслуживания.

Начало работы

Через API Jina Search Foundation

Через службу Elastic Inference Service

Модель jina-reranker-v3.5 доступна в Elastic Inference Service (EIS) начиная со стека 9.3, поэтому вы можете выполнять переранжирование на управляемых GPU, не размещая модель самостоятельно. Создайте конечную точку вывода, которая ссылается на модель, а затем вызывайте ее, как любую другую задачу переранжирования.

Ответ возвращает массив переранжирования, упорядоченный по релевантности, где каждая запись содержит исходный индекс кандидата и его оценку. Поскольку это стандартная конечная точка вывода, на inference_id можно ссылаться напрямую из ретривера text_similarity_reranker в поисковом запросе.

Через transformers

Заключение

Практическое утверждение jina-reranker-v3.5 узкое и проверяемое: при 0,6 млрд параметров целенаправленное обучение закрывает большую часть разрыва до 4-миллиардной модели общего назначения, а в BEIR — полностью, при этом работая быстрее, чем модель, которую она заменяет. Для корпоративного поиска это аргумент в пользу инвестиций в сфокусированное обучение на компактной базе, а не в использование самой большой доступной модели.

Стоит четко обозначить два ограничения. Списочные переранжировщики по-прежнему имеют входные ограничения, которых избегают поточечные модели и модели с поздним взаимодействием, в частности, фиксированные верхние границы количества кандидатов и их общей длины. Кроме того, сохраняются значительные отставания от 4-миллиардной модели Qwen в юридических и медицинских задачах RTEB, Struct-IR с контролируемым пулом и языках MIRACL с ограниченными ресурсами. Это сложные случаи, и мы называем их, а не скрываем за средними показателями.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссовПресса
Momentum

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссов

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Компании выбирают САПР от PTC для разработки и проектирования продуктов
PTC

Компании выбирают САПР от PTC для разработки и проектирования продуктов

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста
PTC

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства
PTC

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства

Ещё от Jina AI

jina-ocr-v1: более быстрое распознавание документов на бюджетных GPU
Jina AI

jina-ocr-v1: более быстрое распознавание документов на бюджетных GPU

jina-embeddings-v5-omni: эмбеддинги для текста, изображений, аудио и видео
Jina AI

jina-embeddings-v5-omni: эмбеддинги для текста, изображений, аудио и видео

Создание аудиоэмбеддингов на основе мультимодальных LLM
Jina AI

Создание аудиоэмбеддингов на основе мультимодальных LLM

Идентификация моделей эмбеддингов по необработанным числовым значениям
Jina AI

Идентификация моделей эмбеддингов по необработанным числовым значениям