Контекстные эмбеддинги за пределами «золотого фрагмента»

Источник: Perplexity AI

Контекстные эмбеддинги за пределами «золотого фрагмента»

Источник: Perplexity AI

Новый метод обучения, модель и бенчмарк для поиска ответов и их вспомогательного контекста.

•Обновлено: 1 октября 2026 г.

Введение

Контекстуальные эмбеддинги позволяют уловить смысл каждого фрагмента или части текста в контексте всего документа. Их обучение и оценка обычно предполагают наличие одного релевантного фрагмента на запрос, известного как «золотой фрагмент» (gold passage). Однако на практике одного золотого фрагмента часто бывает недостаточно. Он может содержать ответ, но при этом ему не хватает вспомогательного контекста, необходимого для понимания или проверки, из-за чего он остается неоднозначным в отрыве от остального текста.

Мы представляем pplx-embed-v2-context-9b-preview, нашу новую модель контекстуальных эмбеддингов. Модель обучена с использованием инновационного подхода, в котором в качестве учителя выступает модель сжатия контекста от Perplexity. Мы агрегируем ее предсказания на уровне токенов в оценки релевантности на уровне фрагментов, обучая модель эмбеддингов извлекать как фрагменты с ответами, так и вспомогательный контекст, а не только один «золотой» фрагмент. Модель создает один эмбеддинг для каждого фрагмента без дополнительных затрат на инференс и поддерживает 1024-мерные и int8 эмбеддинги.

Она демонстрирует передовые результаты на context-bench, новом бенчмарке для контекстно-зависимого поиска, созданном и закрыто поддерживаемом turbopuffer, а также на ConTEB, широко используемом публичном бенчмарке. Наша модель была разработана независимо от context-bench и оценивалась как «слепая» выборка.

Context-bench состоит из 2099 запросов к 38 894 длинным документам в 21 домене и оценивает три возможности контекстуальных эмбеддингов: разрешение неоднозначности между почти дублирующимися документами, поиск золотых фрагментов, смысл которых зависит от отдаленного контекста, и полноту извлечения вспомогательных данных, необходимых для проверки ответа.

Предварительная версия модели доступна публично на Hugging Face. Бенчмарк поддерживается компанией turbopuffer в закрытом доступе, чтобы снизить риск загрязнения обучающих данных и сохранить его ценность для измерения прогресса. Чтобы запросить оценку, пожалуйста, свяжитесь с turbopuffer по адресу contextbench@turbopuffer.com.

Почему контекст важен для поиска

Поисковые системы обычно делят длинные документы на более мелкие фрагменты, которые можно индексировать и искать независимо. Разбиение на фрагменты удобно на практике, но оно удаляет контекст, в котором изначально находился каждый фрагмент, создавая компромисс между гранулярностью сжатия информации и контекстом, используемым при кодировании. Фрагмент может ссылаться на сущность, представленную ранее, наследовать смысл из заголовка раздела или опираться на определения, расположенные в другом месте документа. После извлечения он может уже не содержать достаточно информации для надежного сопоставления с запросом. Кодирование всего документа как единого вектора не решает эту проблему, поскольку одно объединенное представление не может точно отразить каждый аспект длинного документа.

Модели контекстуальных эмбеддингов решают это ограничение, представляя каждый фрагмент в контексте окружающего его контента, чаще всего с помощью late chunking: документ кодируется за один проход, а представления фрагментов объединяются (pooling) после этого, так что каждый вектор фрагмента вычисляется с учетом всего документа. Предыдущие работы, такие как ConTEB и наша собственная pplx-embed-context-v1, показали, что контекстуализированные представления фрагментов существенно улучшают поиск по сравнению с независимо закодированными фрагментами, особенно в длинных документах.

Ограничения обучения на основе «золотых фрагментов»

Обучение моделей контекстуальных эмбеддингов требует контроля, который определяет, какие части документа релевантны данному запросу. Распространенным подходом является аннотирование «золотых фрагментов»: для каждого запроса аннотатор, обычно большая языковая модель (LLM), определяет фрагмент документа, который содержит ответ.

Обучение обычно сочетает две контрастирующие функции потерь: междокументную функцию потерь, которая противопоставляет золотой фрагмент фрагментам из других документов, и внутридокументную функцию потерь, которая противопоставляет его другим фрагментам в том же документе.

Этот подход имеет несколько ограничений:

  • Релевантен только один фрагмент. Он рассматривает каждый другой фрагмент в документе как негативный пример, включая те, что содержат полезную вспомогательную информацию. Контроль на уровне документа работает в другой крайности. Он определяет документ как релевантный, не уточняя, какие именно фрагменты в нем важны. На практике релевантность часто находится между этими крайностями. Фрагмент с ответом может зависеть от нескольких вспомогательных фрагментов, которые вводят сущность, разрешают ссылку или предоставляют дополнительный факт, в то время как остальная часть документа нерелевантна. Поэтому модель должна научиться правильному уровню избирательности: более широкому, чем один золотой фрагмент, но более сфокусированному, чем документ в целом.
  • Грубое супервизорство. Поскольку каждая аннотация идентифицирует только один золотой фрагмент, а не фиксирует степень релевантности по всему документу, она предоставляет ограниченные обучающие сигналы для объема вычислений, затраченных на ее создание.
  • Дороговизна масштабирования. Каждая пара для обучения требует, чтобы LLM прочитала документ и выбрала релевантный фрагмент, поэтому стоимость аннотирования растет линейно с размером обучающего набора и ограничивает объем и разнообразие обучающих данных.
  • Чувствительность к границам фрагментов. Метки также привязаны к границам фрагментов, используемым при аннотировании. Золотая метка, присвоенная окну фиксированного размера в токенах, не указывает, какие более короткие предложения или более длинные абзацы являются релевантными. Изменение стратегии разбиения на фрагменты или обучение на нескольких вариантах разбиения для повышения устойчивости к тому, как документы разделяются при индексации, может потребовать повторного аннотирования корпуса.

Инновационный подход к контекстуальному обучению

Мы решаем ограничения обучения на основе «золотых фрагментов» путем дистилляции суждений о релевантности из модели сжатия контекста, учитывающей запрос. Эта модель выступает в роли учителя: она читает запрос и документ совместно и присваивает каждому токену документа оценку релевантности. Ее предсказания дают несколько преимуществ для обучения контекстуальных эмбеддингов:

  • Гибкие границы фрагментов. Оценки релевантности на уровне токенов могут быть агрегированы по любым выбранным границам фрагментов, что позволяет использовать одни и те же предсказания учителя для контроля разного разбиения без повторного аннотирования.
  • Непрерывная релевантность. В отличие от бинарных меток «золотых фрагментов», учитель предоставляет непрерывные оценки, которые фиксируют степени релевантности, естественно различающие фрагменты с ответами, вспомогательный контекст и нерелевантный контент.
  • Более низкая стоимость аннотирования. Учитель компактен и специализируется на оценке релевантности, что делает его гораздо более дешевым для масштабируемого контроля, чем LLM общего назначения.

Мы обучаем нашу модель с помощью взвешенной суммы контрастирующей функции потерь на уровне документа и функции потерь дистилляции на уровне фрагментов по пакетам пар «запрос-документ». Для каждого запроса парный документ служит положительным примером, а остальные документы в том же пакете — отрицательными.

Для каждого пакета мы случайным образом выбираем стратегию разбиения на фрагменты, соответствующим образом разделяем документы и вставляем разделительные токены между фрагментами. Затем мы обрабатываем каждый документ за один прямой проход и усредняем представления токенов внутри каждого фрагмента, чтобы получить контекстуальные эмбеддинги фрагментов. Запросы кодируются отдельно с усреднением их представлений токенов. Наконец, мы вычисляем косинусное сходство между каждым эмбеддингом запроса и каждым эмбеддингом фрагмента в пакете.

Функция потерь

Контрастивная функция потерь на уровне документов

Хотя наша модель эмбеддингов выдает сходства только на уровне чанков, мы можем естественным образом получить из них сходства на уровне документов. Мы считаем документ d столь же релевантным запросу q, сколь и его наиболее релевантный чанк. Это правило оценки вдохновлено операцией MaxSim из работы ColBERT, которая здесь применяется к чанкам, а не к токенам.

В частности, учитывая запрос q с эмбеддингом q и документ d как упорядоченный список чанков c с эмбеддингами c, мы определяем сходство на уровне документов как:

s(q,d):=max⁡c∈dq⊤c.s(q,d):=\max_{c\in d}\mathbf{q}^{\top}\mathbf{c}.

Учитывая такие сходства на уровне документов, мы можем сформулировать целевую функцию InfoNCE на уровне документов по внутрибатчевым негативам.

Для запроса q обозначим через d⁺ его релевантный документ, а через 𝒟 — документы в батче. Контрастивная потеря выглядит следующим образом (температуры опущены для удобочитаемости):

Ldoc(q,d+)=−log⁡exp⁡(s(q,d+))∑d∈Dexp⁡(s(q,d))\mathcal{L}_{\mathrm{doc}}(q,d^{+})=-\log\frac{\exp(s(q,d^{+}))}{\sum_{d\in\mathcal{D}}\exp(s(q,d))}

Функция потерь дистилляции на уровне чанков

Контрастивная потеря обучает модель тому, какой документ релевантен запросу. Потеря дистилляции учит ее тому, где именно в этом документе сосредоточена релевантность, что критически важно для контекстной модели.

Во время обучения мы передаем каждую позитивную пару «запрос — документ» нашей модели сжатия контекста, которая назначает оценку релевантности каждому токену в документе. Как и в случае с оценкой на уровне документов, мы выводим релевантность каждого чанка из его наиболее релевантного содержимого. Чтобы уменьшить чувствительность к выбросам токенов, включая таковые на границах чанков, мы определяем релевантность на уровне чанка как среднее арифметическое n лучших оценок токенов внутри этого чанка.

Для каждого запроса мы применяем масштабированную по температуре функцию softmax к оценкам релевантности чанков, полученным от учителя в рамках позитивного документа, чтобы получить целевое распределение. Чанки в других документах батча получают нулевую целевую вероятность. Мы обучаем модель эмбеддингов соответствовать этой цели путем минимизации прямой дивергенции Кульбака — Лейблера между целевым распределением и предсказанным распределением по всем чанкам в батче:

Ldist(q,d+)=KL ⁣(pT∥pS)\mathcal{L}_{\mathrm{dist}}(q,d^{+})=\mathrm{KL}\!\left(p^{\mathrm{T}}\parallel p^{\mathrm{S}}\right)

pT(cj)=exp⁡(rj)∑ck∈d+exp⁡(rk)p^{\mathrm{T}}(c_j)=\frac{\exp(r_j)}{\sum_{c_k\in d^{+}}\exp(r_k)}

pS(c)=exp⁡(q⊤c)∑d∈D∑ck∈dexp⁡(q⊤ck)p^{\mathrm{S}}(c)=\frac{\exp(\mathbf{q}^{\top}\mathbf{c})}{\sum_{d\in\mathcal{D}}\sum_{c_k\in d}\exp(\mathbf{q}^{\top}\mathbf{c}_k)}

Здесь верхние индексы T и S обозначают учителя и ученика, а rⱼ — оценку релевантности учителя для чанка cⱼ в позитивном документе d⁺. Целевое распределение учителя присваивает нулевую вероятность чанкам во всех остальных документах батча.

В отличие от единичной метки золотого стандарта для чанка, эта цель отражает степени релевантности. Поддерживающие чанки получают вес в соответствии с оценками учителя, а не рассматриваются как негативы, что учит модель извлекать как поддерживающий контекст, так и сам ответ.

Комбинированная функция потерь

Наша комбинированная целевая функция обучения представляет собой взвешенную сумму контрастивной потери на уровне документов и потери дистилляции на уровне чанков. Мы усредняем эту взвешенную потерю по батчу пар «запрос — документ».

На рисунке 2 проиллюстрирован наш подход к обучению. Компрессор контекста выполняет роль учителя только во время обучения. На этапе инференса модель эмбеддингов выдает один контекстуальный эмбеддинг на чанк без каких-либо дополнительных этапов сжатия или переранжирования. Такой подход улучшает качество обучения контекстуальных эмбеддингов без увеличения объема хранения индексов или добавления задержки модели-учителя во время поиска.

Обучающие данные

Обучающие данные состоят примерно из 430 публичных и внутренних наборов данных пар «запрос — документ», охватывающих более 50 языков.

Мы создаем внутренние наборы пар из производственных данных, отфильтрованных от персональных данных (PII), а также путем синтеза релевантных запросов по длинным документам. Для каждого прямого прохода мы выбираем один набор данных и семплируем из него целый батч, чтобы повысить сложность внутрибатчевых негативов и избежать поверхностного обучения (shortcut learning). Ни один из наших обучающих наборов данных не содержит аннотаций на уровне чанков: весь надзор внутри документов исходит от модели сжатия, а данные ConTEB не используются для обучения. Более того, данные context-bench были недоступны во время разработки модели.

Настройка обучения

Модель берет за основу внутреннюю модель извлечения ColBERT с 9 миллиардами параметров и выдает эмбеддинги размерностью 2048 через линейный проекционный слой. Мы размечаем границы чанков с помощью обученного токена <|chunk_sep|> и формируем эмбеддинг каждого чанка путем усреднения эмбеддингов его токенов. Запросы кодируются той же моделью, причем эмбеддинги их токенов усредняются в единый вектор.

Мы используем обучение по методу Матрёшки (Matryoshka training) для поддержки эмбеддингов размерностью 1024 и 2048, а также обучение с учетом квантования для поддержки . Во время обучения мы постепенно увеличиваем скорость обучения, поддерживаем ее постоянной, а затем снижаем.

Выпущенная модель представляет собой модельный суп (model soup), объединяющий веса нескольких чекпоинтов из одного и того же прогона обучения.

Новый бенчмарк для поиска на уровне чанков

Публичные бенчмарки контекстуального поиска, такие как ConTEB, разделяют предположение, лежащее в основе разметки золотых чанков: у каждого запроса есть один релевантный чанк, и модель получает награду только за вывод этого чанка на первое место. Они также наследуют его ограничения.

Во-первых, ConTEB тестирует поиск на задачах, где чанк является неоднозначным без окружающего его контекста. В таких задачах контекстуальные модели превосходят модели, кодирующие каждый чанк независимо. Однако он не проверяет, выводит ли модель на поверхность и другие части документа, которые делают этот чанк понятным.

Во-вторых, он систематически не проверяет, можно ли найти правильный документ, когда почти идентичные документы в том же корпусе различаются только контекстом, окружающим в остальном идентичное предложение.

Обе возможности важны, когда поисковый агент или пользователь должен понять и проверить ответ по нескольким извлеченным предложениям, а не по всему документу. Поэтому мы создали context-bench — контролируемый бенчмарк для поиска по длинным документам, призванный отделить использование контекста документа от общего качества поиска. Он проверяет, используют ли контекстуальные эмбеддинги информацию из других частей документа для реализации трех возможностей:

  • Дисамбигуация документов: идентификация правильного документа среди практически идентичных альтернатив.
  • Извлечение ответов: извлечение содержащих ответ чанков, смысл которых зависит от деталей в других частях документа.
  • Извлечение доказательств: извлечение поддерживающих чанков, которые проясняют или обосновывают ответ.

Context-bench содержит 2099 запросов и 38 894 документа. Используются чанки размером с предложение, в результате чего получается в общей сложности 2 458 072 чанка. Запросы охватывают 21 домен, включая корпоративную отчетность, клинические исследования, путешествия, развлечения, образование, государственные материалы, юридические контракты и документацию по программному обеспечению.

Каждый запрос разработан для проверки одной из двенадцати контекстных возможностей. Основные целевые документы намеренно сделаны длинными: 1061 из 1197 отдельных основных целевых документов содержат не менее 200 предложений, при этом медианная длина составляет примерно 6100 токенов. У каждого запроса есть ровно один правильный ответ в корпусе. Если один и тот же факт указан в эталонном документе более одного раза, например, в сводном предложении и в строке таблицы, любое из этих предложений принимается в качестве ответа.

Маршрут ответа — это одна допустимая комбинация фрагмента ответа и подтверждающих доказательств, необходимых для его интерпретации или проверки. Из 2099 запросов маршрут ответа по основному целевому документу имеет одну группу доказательств для 964 запросов, две — для 735, три или более — для 332 и ни одной — для 68. Альтернативные допустимые маршруты ответа могут требовать использования других групп доказательств.

Таблица 1: Статистика бенчмарка.

Статистика

Значение

Запросы

2 099

Документы

38 894

Фрагменты предложений

2 458 072

Медианная длина основного целевого документа

6 100 токенов

Домены

Группы доказательств на запрос (маршрут ответа по основному целевому документу)

1: 964; 2: 735; 3+: 332; нет: 68

Таблица 2: Двенадцать контекстных возможностей, проверяемых с помощью context-bench, с наглядными примерами.

Возможность

Пример запроса

Фрагмент ответа

Необходимый контекст документа

1. Идентификация сущности

Сколько Northlake потратила на обратный выкуп акций?

Компания выкупила акций на 12,8 млрд долларов.

Во введении Northlake идентифицируется как «компания». Аналогичный отчет Southlake не является релевантным.

2. Период или версия

Какой картридж подходит для M40 версии B?

Установите картридж KC-42.

В разделе применимости указано, что эти инструкции относятся к версии B, а не к версии C.

3. Определения и псевдонимы

Каков был уровень выбывания в группе 15 мг?

У Zeta уровень выбывания составил 12,7%.

В отчете Zeta определяется как группа 15 мг. Без этого определения фрагмент не идентифицирует запрашиваемую группу.

4. Структура таблицы

Какова емкость аккумулятора модели Max?

Типичная емкость: 4 250 | 4 700 | 5 150.

Заголовок таблицы устанавливает Mini | Base | Max, измеренные в мАч. Следовательно, ответ — 5 150 мАч.

5. Условия и исключения

Как долго действует гарантия на аккумулятор при коммерческом использовании?

Гарантия на аккумулятор действует 18 месяцев.

Во введении к разделу это покрытие ограничивается коммерческими установками; для бытовых установок действует другая гарантия.

6. Ссылки и местоимения

Когда Мара стала заместителем мэра?

Она вступила в должность в 2021 году.

В предыдущем повествовании установлено, что «она» относится к Маре, а не к Элин, которая также упоминается.

7. Порядок и позиция в списке

Какая песня открывала выход на бис?

14. Lantern Road.

В примечании в другом месте сказано, что песни 14–16 составляли выход на бис. Следовательно, трек 14 — это открывающая песня.

8. Область действия раздела

Какой объектив использовался для операторской работы в фильме?

Повсеместно использовался фикс-объектив 35 мм.

Этот отрывок относится к «Основным съемкам», а не к отдельному разделу о рекламных фотографиях.

9. Атрибуция спикера

Какую дату открытия пообещал мэр?

Мы откроемся 12 июня.

В стенограмме указано, что спикером является мэр. Те же слова от подрядчика не подтверждали бы обещание мэра.

10. Изменения с течением времени

Какой срок уведомления применялся после майской поправки?

Срок уведомления теперь составляет 45 дней.

История поправок устанавливает, что это изменение вступило в силу в мае, заменив предыдущее правило 30 дней.

11. Причинно-следственные связи

Почему остановился западный насос?

Эта неисправность вызвала остановку.

В ходе расследования «эта неисправность» идентифицируется как заклинивший подшипник в западном насосе, и это отличие проводится от несвязанного засорения впускного отверстия.

12. Фигуральное или межъязыковое значение

Фигуральное:

Что символизирует «зимняя комната» в стихотворении?

Межъязыковое:

Какой компонент французская инструкция предписывает технику снять?

Фигуральное:

Это олицетворяет изгнание, а не физическую комнату.

Межъязыковое:

Retirez le capot. (Снимите крышку.)

Фигуральное:

В комментариях «это» идентифицируется как повторяющийся образ «зимней комнаты» в стихотворении.

Межъязыковое:

В глоссарии руководства указано, что «capot» означает защитный кожух двигателя, а не транспортировочную крышку.

Документы и запросы

Запросы, документы и тестируемые возможности вдохновлены беседами с клиентами turbopuffer.

В качестве примера рассмотрим потребности в поиске фирмы по управлению недвижимостью. У таких фирм сотни, иногда тысячи договоров аренды, которые отличаются только именами арендаторов, датами и несколькими другими ключевыми деталями. Типичный запрос для этого набора данных может звучать так: «когда заканчивается аренда 5 park avenue и какова текущая арендная плата?». Договоры аренды также могут быть длинными, а критически важные компоненты для уточнения, подтверждающие, что вы получили нужный документ (например, дата, адрес, имя арендатора и т. д.), часто могут находиться очень далеко от ключевого предложения с ответом, содержащего сумму ежемесячной арендной платы. На практике идентичные предложения, такие как «Ежемесячная арендная плата составляет $X,XXX.», могут встречаться во многих документах корпуса.

Хорошая модель контекстного эмбеддинга должна использовать контекст из всего документа, чтобы идентифицировать правильный документ и извлечь как ответ, так и подтверждающие его предложения. Это позволяет пользователю или поисковому агенту быстро проверить ответ и подтвердить, что он получен из нужного документа.

Метки ответов и доказательств

Для каждого запроса мы помечаем предложения с «ответом» и «доказательствами» в целевом документе. Модель проходит наш тест на «достаточность для читателя», если она извлекает предложение с ответом вместе с хотя бы одним предложением из каждой группы доказательств. Вместе эти предложения предоставляют достаточно контекста для того, чтобы читатель мог проверить ответ с помощью подтверждающих доказательств.

Когда модели контекстного эмбеддинга справляются с этим хорошо, они могут значительно сократить количество токенов, которые поисковым агентам необходимо просматривать, а также значительно упростить человеку задачу быстрого подтверждения того, что он нашел правильный ответ на свой исходный запрос, не читая весь документ целиком.

Каждая группа доказательств должна быть восстановлена, но любой из альтернатив группы достаточно для ее восстановления. Часто можно увидеть один и тот же факт, изложенный в нескольких местах в этих длинных документах. Извлечение хотя бы одного предложения из каждой группы доказательств соответствует критериям достаточности для читателя и, таким образом, будет принято как идеальное извлечение доказательств.

Метрики

Каждый документ разбивается на предложения, и для всех моделей используются одни и те же границы. Для моделей без контекстного эмбеддинга тестируются два условия: одно, где каждое предложение эмбеддится независимо, и другое, где весь документ эмбеддится как единый фрагмент.

Мы используем условие на уровне предложений для измерения полноты ответов и полноты доказательств. Оно проверяет, может ли модель без контекста идентифицировать правильный ответ и подтверждающие доказательства, когда каждое предложение эмбеддится без доступа к окружающему документу. Это намеренно сложная задача. Во многих запросах само предложение с ответом не содержит деталей, необходимых для того, чтобы отличить его от похожих предложений в других частях корпуса.

Мы используем условие на уровне документа в качестве базовой линии для полноты поиска по документам. Оно проверяет, обеспечивают ли мелкозернистые эмбеддинги предложений достаточное преимущество при поиске, чтобы оправдать дополнительные затраты на хранение по сравнению с хранением одного вектора на документ. Индекс на уровне предложений создает значительно больше векторов, чем индекс на уровне документов, поэтому он должен превосходить базовую линию «один вектор на документ», чтобы оправдать эти затраты.

Все оценки используют исчерпывающее ранжирование по всем 2 458 072 фрагментам. Таким образом, различия между моделями отражают представления, а не конфигурацию индекса. Мы фокусируемся на трех ключевых метриках:

Document@K определяется как:

Document@K=1[rank⁡(d∗)≤K]\text{Document@K}=1[\operatorname{rank}(d^{*})\le K]

где d∗d^{*} — документ с наивысшим рангом в DqD_q.

Answer@K определяется как:

Answer@K=1[Aq∩CK(q)≠∅]\text{Answer@K}=1[A_q\cap C_K(q)\ne\varnothing]

где CK(q)C_K(q) — это топ KK фрагментов по всему корпусу, а AqA_{q} — набор принятых фрагментов с ответами.

Evidence Recall@K измеряется внутри d∗d^{*} следующим образом: ранжируйте предложения d∗d^{*} по сходству, удалите предложение с ответом, имеющее наивысший ранг, и пусть RK(q)R_K(q) будет топ KK оставшихся предложений. Для групп доказательств Gq={g1,…,gm}G_q=\{g_1,\ldots,g_m\}, группа gjg_j считается восстановленной, если некоторая альтернатива E∈gjE\in g_j удовлетворяет условию E⊆RK(q)E\subseteq R_K(q), и

EvidenceRecall@K=1[rank⁡(d∗)≤10]⋅1m∑j=1m1[gj recovered].\text{EvidenceRecall@K}=1[\operatorname{rank}(d^{*})\le10]\cdot\frac{1}{m}\sum_{j=1}^{m}1[g_j\ \text{recovered}].

Document@K проверяет, позволяет ли контекстуализация нужному документу превзойти похожие документы и дистракторы, которые имеют общий с ним словарный запас.

Answer@K проверяет, входит ли само предложение с ответом в число топ фрагментов.

Evidence Recall@K проверяет, какая часть подтверждающего контекста восстанавливается среди топ K фрагментов правильного документа после исключения фрагмента с ответом, имеющего наивысший ранг. Удаление ответа предотвращает двойной учет доказательств, которые уже измеряются метрикой Answer@K, и оставляет все KK слотов для подтверждающего контекста. Требование того, чтобы целевой документ находился в топ-10 извлеченных документов, означает, что модель не получает кредит за доказательства для документа, который она бы не вывела. Мы также сообщаем All-Evidence@K — долю запросов, для которых восстановлена каждая группа.

В совокупности эти метрики позволяют разложить проблемы, с которыми сталкиваются модели контекстных эмбеддингов: найти правильный документ, найти правильный ответ и восстановить минимальный контекст, который показывает, почему ответ является верным.

На рисунке 3 проиллюстрированы метрики на примере управления недвижимостью.

Результаты оценки

Мы оцениваем нашу модель в сравнении с контекстными и неконтекстными моделями эмбеддингов по четырем направлениям.

Наши контекстные базовые линии — это pplx-embed-context-v1-4B и voyage-context-4. Наши неконтекстные базовые линии — это voyage-4-large и Nemotron-3-Embed-8B-BF16 от NVIDIA, которые кодируют фрагменты независимо. Набор базовых линий варьируется в зависимости от эксперимента, как указано на каждом рисунке.

Мы начинаем с context-bench, который напрямую проверяет возможности, мотивирующие эту работу, а затем сообщаем результаты по ConTEB, стандартному общедоступному бенчмарку для контекстных эмбеддингов. Чтобы убедиться, что эти улучшения не достигаются за счет общего качества поиска, мы также оцениваем специализированные бенчмарки поиска документов и фрагментов, которые мы создали на основе общедоступных наборов данных. Наконец, мы рассматриваем два практических свойства для развертывания: качество поиска в сравнении с затратами на хранение на вектор и чувствительность к размеру фрагмента, используемому при индексации. Все оценки кодируют документы объемом до 32 768 токенов за один проход.

ConTEB

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от Perplexity