jinaai/jina-reranker-v3.5 · Hugging Face
Мы стремимся развивать и демократизировать искусственный интеллект с помощью открытого исходного кода и открытой науки.
jina-reranker-v3.5: эффективный списочный переранжировщик с гибридным вниманием и самодистилляцией
Списочные переранжировщики (listwise rerankers) являются дискриминативным ядром агентных конвейеров поиска, однако их внедрение в производство требует одновременной эффективности, устойчивости к доменам и высокой точности на полуструктурированных данных. Мы представляем jina-reranker-v3.5 — списочный переранжировщик с 0,6 млрд параметров, который отвечает этим требованиям, не жертвуя качеством сравнения документов, которое делало его предшественника jina-reranker-v3 эффективным. jina-reranker-v3.5 сохраняет механизм взаимодействия «последний-но-не-поздний» (LBNL) из jina-reranker-v3 и перерабатывает его по трем направлениям. Мы заменили равномерное глобальное внимание на гибридное расписание из трех слоев со скользящим окном, за которыми следуют два глобальных слоя, при этом терминальный слой остается глобальным, как того требует считывание LBNL. Модель обучалась на тщательно отобранной многодоменной смеси, охватывающей юридический, медицинский, финансовый, мультиязычный и структурированный поиск. Качество передается через трехэтапный рецепт самодистилляции, в котором учитель с полным вниманием задает верхнюю границу, которую ученик с разреженным вниманием восстанавливает в рамках поэтапного протокола адаптации. jina-reranker-v3.5 достигает 63,20 nDCG@10 в BEIR, соответствуя модели с 4 млрд параметров при примерно в 7 раз меньшем количестве параметров, а также превосходит jina-reranker-v3 в MIRACL и RTEB. Наибольший прирост наблюдается в полуструктурированном поиске, где модель повышает nDCG@10 на 9,6 пункта по сравнению с jina-reranker-v3, опережая все переранжировщики сопоставимого размера. Гибридное расписание дополнительно сокращает задержку списочного вывода до 1,56 раза. Мы выпускаем веса модели на Hugging Face по некоммерческой лицензии.
arXiv.orgChristina Nasika
Сегодня мы выпускаем jina-reranker-v3.5, списочный переранжировщик с 0,6 млрд параметров, который сохраняет взаимодействие «последний-но-не-поздний» из jina-reranker-v3, делая его быстрее и значительно эффективнее на данных, которые реально ищут предприятия. Модель достигает 63,20 nDCG@10 в BEIR, опережая Qwen3-Reranker-4B при примерно в 7 раз меньшем количестве параметров, и выполняет переранжирование до 1,56 раза быстрее, чем v3, на длинных документах. Самый большой скачок наблюдается в полуструктурированном поиске: +9,6 nDCG@10 по сравнению с v3 на записях с ограничениями по полям.
Этого удалось достичь благодаря трем изменениям. Гибридное расписание внимания, которое заменяет большинство глобальных слоев скользящими окнами, сохраняя терминальный слой глобальным. Смесь для обучения, составленная на основе сценариев сбоев в юридическом, медицинском, финансовом, мультиязычном и структурированном поиске. И трехэтапный рецепт самодистилляции, где учитель и ученик имеют одинаковый размер и различаются только паттерном внимания.
Качество относительно количества параметров в четырех режимах бенчмарка. jina-reranker-v3.5 находится на границе Парето во всех четырех: ни одна из протестированных нами моделей не является одновременно меньше и лучше.
Архитектура
Списочное переранжирование оценивает каждого кандидата за один прямой проход, поэтому полное self-attention по списку из 100 документов растет квадратично и увеличивает KV-кэш. Очевидное решение — внимание со скользящим окном. Однако при взаимодействии LBNL это решение нарушает работу модели.
В LBNL запрос и все кандидаты образуют одну причинно-следственную последовательность, а токен эмбеддинга запроса находится в самом конце. Он должен обращать внимание на все элементы вплоть до первого кандидата, чтобы построить представление, учитывающее кросс-документные связи. Конечное окно разрывает эту зависимость. Поэтому мы всегда закрепляем последний слой как глобальный, чтобы токены запроса и эмбеддинга документа видели весь контекст кандидатов в момент извлечения. Замена этого слоя на скользящее окно серьезно ухудшает списочное ранжирование; сохранение только его в качестве глобального позволяет поддерживать совместное кодирование без использования полностью глобального стека.
Для оставшихся 27 слоев мы протестировали расписания 1L1G, 1L2G, 3L2G и 5L1G. Победило 3L2G: три слоя со скользящим окном, за которыми следуют два глобальных слоя, повторяющиеся в цикле, что дает 17 локальных и 11 глобальных слоев с окном в 1024 токена. Локальные слои снижают стоимость внимания с O(L²) до O(L·w), в то время как глобальные слои каждые три шага обновляют долгосрочный кросс-кандидатный сигнал на каждой глубине. Более плотные расписания не дали прироста пропускной способности; более агрессивное 5L1G показало худшие результаты в сложных многодокументных задачах.
Самодистилляция через разрыв внимания
Дистилляция здесь необычна. Мы не сжимаем большую модель в маленькую. Учитель и ученик имеют размер 0,6 млрд и различаются только паттерном внимания. Учитель использует полное внимание с квадратичными затратами; ученик использует 3L2G.
Принуждение ученика переключать маски внимания и одновременно соответствовать выходным данным учителя приводит к неудаче в обоих аспектах, поэтому рецепт разделяет эти два давления:
- Этап I — учитель с полным вниманием. Начиная с публичного чекпоинта jina-reranker-v3, мы полностью дообучаем учителя без ограничений скользящего окна на полной смеси v3.5. Это устанавливает потолок качества для данного бюджета параметров.
- Этап II — адаптация разреженного внимания. Ученик инициализируется весами Этапа I и активирует 3L2G. Сначала мы обучаем только проекции внимания, замораживая все остальное, обучая разреженные маски направлять информацию, не нарушая представления, изученные при полном внимании. Затем мы размораживаем все, чтобы ученик перестроился под новую геометрию внимания. Ученик уже готов к развертыванию и работает быстрее, но на BEIR, RTEB-legal и MIRACL сохраняется стабильный разрыв по сравнению с учителем.
- Этап III — дистилляция под руководством учителя. При замороженном учителе мы выравниваем ученика по четырем уровням одновременно: списочная KL-дивергенция по распределениям оценок, нормализованным через softmax, MSE по абсолютным оценкам, MSE по скрытым состояниям последнего слоя и косинусное расстояние по спроецированным эмбеддингам, плюс регуляризаторы контекстной схожести и дисперсии.
Порядок имеет значение. Один только Этап II оставляет заметный разрыв, потому что ученик должен изменить свою маршрутизацию под более слабой маской, прежде чем сможет безопасно имитировать оценки и состояния учителя. Этап III затем восстанавливает большую часть этого разрыва, что говорит о том, что емкость полного внимания действительно передается разреженному ученику после адаптации геометрии. Рецепт написан для 3L2G, но схема обобщается и на другие несоответствия в расписании внимания.
Данные для обучения
Смесь v3 хорошо покрывала общий поиск, но плохо справлялась со специализированными доменами. Вместо добавления большего количества данных мы провели анализ ошибок на наборах разработки RTEB и STARK и создали каждый новый шардинг данных так, чтобы он покрывал именно те паттерны поиска, на которых ошибаются общие модели. Сложные негативные примеры поступают от нескольких поисковых систем одновременно (BM25, Jina, BGE, GTE, E5, ColBERT), чтобы модель не могла выучить «короткие пути» какой-то одной системы.
Юридический шардинг объединяет EUR-Lex (мультиязычный), CLERC, AILA, канадское прецедентное право, швейцарские резюме судебных дел и EuroVoc, с избыточной выборкой, поскольку юридические тексты плотно насыщены цитатами и длинны. Медицинский шардинг нацелен на клиническую терминологию и фрагменты, насыщенные сущностями. Финансовый шардинг отдает приоритет числовым утверждениям, регуляторному языку и фрагментам, содержащим таблицы. Мультиязычное покрытие расширяет возможности за пределы MIRACL и mMARCO благодаря WebFAQ на более чем 50 языках, кросс-языковым негативным примерам SWIM-IR и японским парам Ruri-v3.
Структурированные данные получили наибольший вес при выборке, поскольку они находятся вне распределения свободного текста, которое предполагают стандартные бенчмарки. Релевантность записей и таблиц зависит от равенства, числовых и временных границ, принадлежности к списку и логических комбинаций между полями, а не от лексического совпадения. Первые запуски показали здесь наихудшие результаты, поэтому мы напрямую синтезировали пары с жесткими ограничениями.
Результаты экспериментов
Все показатели представляют собой переранжирование топ-100 кандидатов из jina-embeddings-v5-text-small в рамках единого конвейера MTEB v2, поэтому они могут незначительно отличаться от цифр, заявленных поставщиком. Полные таблицы по каждому набору данных и языку приведены в статье.
Версия v3.5 превосходит v3 во всех семействах бенчмарков при том же количестве параметров, причем наибольший прирост наблюдается в полуструктурированном поиске.
Прирост в RTEB сосредоточен там, где была направлена смесь: AILA-Statute улучшился на 14,0 пунктов, а AILA-Case — на 11,7 по сравнению с v3, а FinQA достигла 86,91, что является лучшим результатом среди всех протестированных моделей. В STARK v3.5 превосходит v3 по всем трем официальным метрикам и занимает первое место по показателю Hit@5.
Одно примечание по протоколу Struct-IR. Бенчмарк индексирует миллионы объектов по каждой схеме, и Recall@5 на первом этапе внутри схемы составляет около 0,04, поэтому сквозной поиск с последующим переранжированием почти полностью ограничен полнотой (recall) и плохо разделяет модели переранжирования. Вместо этого мы внедряем все эталонные документы вместе с 30 самыми сложными дистракторами первого этапа, что позволяет изолировать дискриминацию с ограничениями по полям от охвата поиска. Цифры в этой группе не сопоставимы с таблицей лидеров SSRB.
Эффективность
Измерено на одном NVIDIA A100, размер пакета 1, списочные входные данные топ-100, FlashAttention-2.
Поскольку в промышленном списочном переранжировании доминирует однократное предварительное заполнение (prefill) для нового набора кандидатов, эти сокращения напрямую трансформируются в более длинные списки кандидатов и более крупные документы при фиксированном бюджете обслуживания.
Начало работы
Через Jina Search Foundation API
Через Elastic Inference Service
jina-reranker-v3.5 доступен в Elastic Inference Service (EIS) начиная со стека 9.3, поэтому вы можете выполнять переранжирование на управляемых GPU, не размещая модель самостоятельно. Создайте конечную точку вывода, которая ссылается на модель, а затем вызывайте ее, как любую другую задачу переранжирования.
Ответ возвращает массив переранжирования, упорядоченный по релевантности, где каждая запись содержит исходный индекс кандидата и его оценку. Поскольку это стандартная конечная точка вывода, inference_id можно напрямую использовать в retriever типа text_similarity_reranker в поисковом запросе.
Через transformers
Заключение
Практическое преимущество jina-reranker-v3.5 узкое и проверяемое: при 0,6 млрд параметров целенаправленное обучение закрывает большую часть разрыва до 4-миллиардной универсальной модели переранжирования, а в BEIR — полностью, при этом работая быстрее, чем модель, которую она заменяет. Для корпоративного поиска это аргумент в пользу инвестиций в сфокусированное обучение на компактной базе, а не в пользу выбора самой большой доступной модели.
Стоит прямо указать на два ограничения. Списочные переранжировщики по-прежнему имеют входные ограничения, которых избегают точечные модели и модели с поздним взаимодействием, в частности, фиксированные верхние границы количества кандидатов и их общей длины. Кроме того, остаются значительные отставания от 4-миллиардной модели Qwen в юридических и медицинских задачах RTEB, контролируемом пуле Struct-IR и языках MIRACL с низкими ресурсами. Это сложные случаи, и мы называем их, а не скрываем за средним значением.