Снижение уровня галлюцинаций в корпоративном поиске

Источник: Algolia•

Снижение уровня галлюцинаций в корпоративном поиске

Корпоративный поиск оценивается по его способности обеспечивать адекватную поддержку, эффективную прослеживаемость и удовлетворительную точность в реальных условиях эксплуатации. Крупные языковые модели способны генерировать правдоподобный текст, связные резюме и ответы...

Корпоративный поиск оценивается по его способности обеспечивать адекватную поддержку, эффективную прослеживаемость и удовлетворительную точность в реальных условиях эксплуатации. Модели сложного языка могут создавать правдоподобный текст, плавные резюме и надежные ответы. Тем не менее, даже при выдаче плавного текста корпоративный поиск может превзойти ожидаемые возможности. Проблема становится очевидной, как только поисковая система переходит от этапа демонстрации к промышленной эксплуатации.

Общедоступные бенчмарки и открытые веб-задачи позволяют модели опираться на общие статистические тенденции из обучающих данных. Внутренние источники, напротив, устроены иначе: они неполны, гетерогенно структурированы, подчиняются контролю доступа и многочисленным ограничениям внутренней политики . Один отдел может иметь доступ к дополнительному соглашению к договору, к которому у другого доступа нет. Один индекс актуален, в то время как другой отстает на три недели. Новая страница политики заменяет более старую версию, даже если обе остаются доступными для просмотра. Владение языком может придать системе видимость уверенности еще до того, как она приобретет какую-либо известность.

В корпоративном поиске галлюцинации принимают несколько воспроизводимых форм.

  • Вымышленный факт: Система упоминает деталь, которой нет ни в одном из утвержденных источников.
  • Неподтвержденный синтез: Ответ смешивает фрагменты из нескольких документов, чтобы прийти к выводу, который на самом деле не подтверждается ни одним источником.
  • Генерация устаревших ответов: система извлекает информацию из просроченных документов и представляет ее как актуальную правду.
  • Выход за рамки ответа: модель отвечает на вопрос, на который имеющийся корпус данных ответить не может.
  • Контент, не соответствующий правилам: Содержание может казаться фактологически правдоподобным, но оно выходит за рамки ограничений доступа, конфиденциальности или соответствия требованиям.

Фальсифицированные факты — это ошибки, которые проще всего заметить и труднее всего контролировать после передачи ответа. Модель может выдумать дату продления, пороговое значение политики, зависимость продукта или новый пункт. Неподтвержденный синтез более тонкий и часто более опасный. Ответ может ссылаться на реальные документы, объединяя их в интерпретацию, которую не одобрил бы ни один рецензент. Устаревшие ответы создают другой тип риска. Система извлекает доказательства, относящиеся к старому процессу, просроченному контракту или устаревшему справочному документу. Ответы вне зоны действия терпят неудачу на границе корпуса. Модель отвечает, потому что запрос требует ответа, даже если доступный корпус не содержит достаточного количества подтверждающих элементов. Несоответствующие политике результаты добавляют еще один уровень. Ответ может раскрывать конфиденциальную информацию, объединять контент за пределами ограничений безопасности или раскрывать детали, которые должны были быть отфильтрованы до генерации. Корпоративный поиск должен рассматривать все эти случаи как сбои с оперативными последствиями.

В технической поддержке неверный шаг по устранению неполадок может ввести клиента в заблуждение и создать дополнительные обращения. В финансах неверный ответ относительно порогов утверждения, правил ценообразования или логики отчетности может негативно повлиять на следующее решение. В юридических и комплаенс-процессах неподтвержденный ответ может показаться достаточно достоверным для распространения до валидации. В здравоохранении и других регулируемых областях устаревшие или не подкрепленные источниками рекомендации могут порождать немедленные риски. Поиск по внутренней базе знаний следует тому же принципу. Сотрудники используют результаты поиска для принятия процедурных решений, маршрутизации проблем, разрешения инцидентов и интерпретации политик. Ответ низкого качества может быстро привести к перегрузке работой.

В автоматизированных рабочих процессах ошибочный ответ может повлечь за собой немедленные действия. Фальсифицированный статус поставщика может направить досье в неправильный процесс, неверная интерпретация политики может отнести его не к той команде, а ложное утверждение о состоянии или правах заказа может инициировать вызов API, возврат средств, изменение статуса или неуместное общение с клиентом. В классическом поисковом интерфейсе у пользователя все еще есть возможность заметить ошибку до совершения действий. В автоматизированном рабочем процессе ошибочный ответ может напрямую повлиять на поведение программного обеспечения и бизнес-операции. Ошибка тогда становится проблемой контроля.

Промптинг может сократить некоторые видимые схемы ошибок. Достаточность доказательств, свежесть документов и правила доступа определяются дизайном системы. Противоречия между источниками требуют элементов поиска, валидации и контроля исключения. Хорошо сформулированная инструкция опирается на надежные доказательства, применимый контекст и соответствующие документы. Проблема предприятия начинается до внедрения и продолжается после него: поиск, отбор доказательств, подотчетность, атрибуция и применение политик — все это определяет, является ли окончательный ответ обоснованным.

Корпоративным командам нужны проверяемые ответы в момент принятия решений. Продуктивная система должна предоставлять ответы на основе утвержденных данных, соответствующих правилам доступа, подкрепленных актуальными доказательствами и обладающих достаточной прослеживаемостью для проведения аудитов. Команды должны знать, какой документ лег в основу ответа, существует ли более свежий источник, был ли у пользователя допуск к просмотренным доказательствам и должен ли был ответ быть заблокирован. Таблица ниже резюмирует точки сбоя систем корпоративного поиска во время их выполнения и уровень контроля, призванный предотвратить каждый сбой.

Именно в ответе проблема проявляется во всей красе. Первопричина может крыться в индексации, метаданных, объеме поиска, ранжировании, политике актуальности данных, охвате корпуса или элементах контроля вывода. Ответ, который кажется категоричным, может маскировать нехватку документации, неразрешенный конфликт или элементы, которые никогда не должны были отображаться.

Извлечение как основа истины

Фаза извлечения представляет собой первый этап контроля, поскольку la qualité et l'étendue des preuves déterminent la pertinence de la réponse. ошибочные, устаревшие, неполные или неавторизованные фрагменты текста подрывают процесс генерации. Тем не менее модель может выдать связный ответ, даже если текущие доказательства его не подтверждают. Фаза извлечения определяет, какие именно элементы передаются для генерации.

Расширенное контекстное окно изменяет объем данных, которые модель способна обработать, однако выбор доказательств по-прежнему имеет решающее значение для релевантности ответа. Слишком длинный текст может создавать шум, дубликаты, противоречия и отвлекать внимание от ключевых фрагментов. Слишком длинные запросы способны замаскировать ошибки ранжирования, поскольку полезные и бесполезные элементы поступают одновременно. Эффективный поиск всегда опирается на тщательный отбор кандидатов, точное определение их сферы применения и эффективное сжатие.

Релевантности недостаточно. Документ может соответствовать запросу, но при этом не быть значимым доказательством. Он может относиться к другому операционному подразделению, отражать предыдущую версию политики или содержать общую информацию, не подтверждающую спорный момент. Отбор доказательств должен позволять отличать релевантные документы от практически применимых элементов.

Гибридный поиск минимизирует два типа ошибок. Плотный поиск превосходно справляется с семантическим сходством, обработкой перефраз и сопоставлением понятий, однако он может смещаться в сторону фрагментов, которые кажутся релевантными, но точно не определяют термин, идентификатор или утверждение, лежащие в основе ответа. Поиск по ключевым словам, в свою очередь, эффективен для буквального соответствия, имен собственных, наименований продуктов, кодов политик и структурированных идентификаторов, но он может неверно истолковать намерение пользователя, если запрос сформулирован нечетко или в нем используется лексика, отличная от словаря исходного документа. Гибридный подход снижает вероятность ошибок обоих типов за счет объединения лексической точности и семантического охвата с последующим ранжированием всех результатов.

Переранжирование — это следующий шаг. Первичный поиск позволяет охватить широкий спектр возможностей, а переранжирование превращает этот набор кандидатов в корпус пригодных для использования доказательств. Без переранжирования запрос может содержать фрагменты, которые выглядят правдоподобно по отдельности, но нерелевантны в совокупности. Система переранжирования способна более точно взвешивать релевантность между запросом и документом, выводить на передний план фрагменты, прямо подтверждающие ответ, и отодвигать на второй план те, которые разделяют лишь общие тематические элементы. Генерация крайне чувствительна к порядку и значимости, причем доказательства, находящиеся вверху рейтинга, привлекают больше внимания. Недостаточное переранжирование приводит к возникновению логической предвзятости. Релевантный документ может присутствовать где-то в запросе, но модель опирается на менее точный фрагмент и строит ответ на его основе.

Метаданные фильтров имеют не меньшее значение, чем семантическое соответствие. Уровень доступа, бизнес-подразделение, регион, линейка продуктов, тип документа, статус политики, язык, юрисдикция и актуальность информации влияют на то, насколько фрагмент релевантен для конкретного пользователя и вопроса. Фильтрация выступает механизмом применения этих ограничений до начала генерации. Отсутствие строгости в отношении метаданных может создать иллюзию релевантности результата, даже если он находится вне контекста. Процесс генерации не всегда автоматически исправляет эту ошибку. В результате система может извлечь находящуюся в разработке политику вместо утвержденной, глобальную политику вместо регионального правила или документ, к которому у пользователя не должно быть доступа. Качество поиска зависит от строгости метаданных, поскольку документ должен быть релевантен в своем контексте.

Проверки на актуальность должны быть встроены в сам процесс поиска. Многие корпоративные ошибки проистекают из предоставления действительных, но устаревших доказательств. Выведенный из эксплуатации рабочий процесс, устаревшая политика льгот или потерявший актуальность технический справочник все еще могут занимать высокие позиции в рейтинге, если текст написан четко и хорошо структурирован. Сам по себе язык редко выдает устаревание документов. Поисковому уровню необходима явная логика актуальности, предпочтение версий и правила жизненного цикла документов, чтобы устаревший контент терял свою авторитетность до того, как будет показан пользователю. Некоторые вопросы по умолчанию требуют получения самого свежего ответа. Другие требуют применения политики, действовавшей на конкретную дату. Проектирование поиска должно учитывать это различие, иначе система станет рассматривать все соответствующие документы как одинаково достоверные, что на практике случается редко.

Стратегия сегментации влияет на качество поиска глубже, чем многие команды предполагают. Границы сегментов определяют, какая информация может быть извлечена вместе, какие доказательства остаются привязанными к своему контексту и какая часть исходной структуры документа сохраняется в совокупности потенциальных результатов. Сегменты на уровне предложений могут повысить точность очень специфических утверждений, но они часто отсекают квалификаторы, оговорки об области применения и исключения, необходимые для правильной интерпретации. Более крупные сегменты на уровне абзацев или разделов сохраняют больше контекста, но могут заглушить релевантную информацию шумом и снизить точность ранжирования. Сегментация с учетом разделов часто оказывается более эффективной, так как она уважает структуру документа, включая заголовки, списки, таблицы и подразделы.

Разбиение на сегменты должно сохранять семантическую единицу доказательства, которая действительно требуется для получения ответа.

Неправильное разделение на сегменты порождает предсказуемые ошибки. Сегмент предложения может содержать пороговое значение политики и при этом скрывать исключение, следующее двумя строками ниже; сегмент абзаца может включать в себя как текущее, так и устаревшее правило, если исходный документ был плохо отредактирован; разрыв на строке таблицы может отделить значение от заголовка, который придает ему смысл; а сегмент раздела может стать настолько объемным, что для системы переупорядочивания останется заметной лишь общая тематическая схожесть. В каждом случае модель получает данные, которые кажутся пригодными к использованию, но лишены структурной согласованности доказательств. Генерация, опирающаяся на реальные данные, опирается на единицы поиска, которые сохраняют достаточно локального контекста для обеспечения интерпретации.

Структурированные и неструктурированные данные должны сходиться в рамках единого поискового процесса. Корпоративная истина часто распределена между несколькими типами данных. Ответ службы поддержки может потребовать абзаца из политики, атрибута продукта, поля статуса и записи о разрешениях. Исключительно документный конвейер может упустить информацию, присутствующую в структурированных системах. И наоборот, исключительно структурированный конвейер может проигнорировать пояснения или обработку исключений, присущие документам. Проектирование поиска должно поддерживать оба формата и согласовывать их при ранжировании. В противном случае система опирается лишь на часть реальности и прибегает к генерации, чтобы угадать недостающие элементы. Это допущение является одним из главных источников неподтвержденного синтеза.

Гигиена данных — это основополагающая, но часто упускаемая из виду зависимость. Качество поиска быстро ухудшается, если корпус загроможден дубликатами файлов, ошибочным синтаксическим анализом, отсутствующими метаданными, сбоями оптического распознавания символов (OCR), неточной прослеживаемостью версий или несогласованной структурой документов. Некачественное поступление данных создает наборы плохих кандидатов задолго до того, как в дело вступает модель. Поисковая система может располагать эффективным корпусом эмбеддингов, быстрой инфраструктурой и результативной системой переупорядочивания, и тем не менее выдавать ошибочные результаты, потому что проиндексированный корпус не сохраняет релевантные доказательства в пригодном для использования виде. Команды часто диагностируют эту проблему слишком поздно. Они изучают промпты и поведение модели, тогда как реальная проблема кроется в подготовке документов, свежести индекса, маппинге полей или метаданных доступа. Гигиена корпуса помогает снизить вероятность таких ошибочных результатов, поскольку качество доказательств закладывается еще на этапе поступления данных. В таблице ниже показаны поисковые решения, влияющие на риск появления ошибочных результатов еще до начала генерации.

Процесс поиска документов требует четкой последовательности. Корпус разбивается на пригодные для использования единицы. Метаданные содержат информацию о доступе, свежести и типе источника. Первичный поиск объединяет лексические и семантические сигналы. Переупорядочивание отдает приоритет прямой поддержке, а не размытому сходству. Группировка доказательств сохраняет фрагменты, наиболее способные подтвердить точный ответ. Более надежная генерация текста не исправит неэффективный поиск. Нижеприведенный фрагмент кода использует актуальный стиль клиента Python для Algolia Search 4.x. Предполагается, что индекс, индексируемые атрибуты, фильтруемые атрибуты, конфигурация NeuralSearch и пользовательские фильтры области видимости уже существуют. Ограниченный доступ пользователей управляется отдельно с помощью защищенных ключей API.

Обоснование как ограничение ответа

Привязка к данным гарантирует, что ответ опирается на конкретные доказательства. Корпоративные системы должны отвечать на основе утвержденных, актуальных, ограниченных и проверяемых документов. Документы, включенные в промпт, не накладывают ограничения на ответ. Модель может импровизировать, чтобы сгладить неясные отрывки, объединить противоречивые источники, опереться на параметрическую память или дополнить ответ даже при недостатке доказательств. Привязка к данным начинается тогда, когда путь ответа ограничен с помощью

Извлеченный контекст часто путают с доказательством, даже когда ответ выходит за рамки того, что позволяют подтвердить элементы доказательств. Прикрепление документов к вопросу может создать иллюзию того, что проблема надежности решена. Контекстуализированные документы представляют собой лишь отправную точку. Ограничение вступает в силу позже, посредством правил, которые определяют, какие отрывки являются допустимыми, как разрешать противоречия, как блокировать неподтвержденные утверждения и что модели разрешено говорить, когда доказательств недостаточно. Валидация рассуждений обеспечивается только в том случае, если эти правила применяются.

Параметрические знания могут облегчить обработку языка и структурирование данных, однако корпоративные ответы по-прежнему зависят от актуальных, утвержденных и ограниченных доказательств выполнения, связанных с происхождением документов. Ответ, касающийся исключения по тарифам, правила хранения, процедуры поддержки или юридического пункта, должен оставаться привязанным к текущему корпусу. В этом заключается операционный смысл привязки в корпоративном поиске. Ответ остается ограниченным рамками поддержки, определяемыми извлеченными доказательствами и утвержденными действующей политикой источниками.

Отсутствие обоснованности обычно проявляется в самом ответе, даже если первопричина кроется на более раннем этапе. Недостаточность доказательств, противоречивые отрывки, устаревшие документы, слишком громоздкие досье доказательств и неверный выбор доказательств могут привести к одному и тому же результату: ответ выглядит подкрепленным, хотя собранные материалы не позволяют обосновать его в полной мере.

Фаза поиска предоставляет потенциальные доказательства. Проверка происходит между поиском и выдачей. Она определяет, могут ли доказательства подтвердить ответ в соответствии с правилами, которые система должна применять. Доказательство должно быть прямым, локальный контекст должен сохранять его, противоречия должны быть разрешены, а неопределенность должна быть достаточно низкой, чтобы ответ был признан допустимым. Ниже приведен упрощенный пример проверки ответа на практике.

Промпт играет ограниченную роль. Инструкции в промпте предписывают модели оставаться в рамках предоставленных источников, избегать не подтвержденных фактами дополнений, цитировать доказательства и отклонять неподтвержденные вопросы. Эти инструкции работают только тогда, когда поиск уже выдал набор применимых доказательств, а контроли выполнения обеспечивают соблюдение ограничений. Недостаточная поддержка, устаревшие документы, чрезмерно широкий контекст и неразрешенные противоречия остаются проблемами качества и контроля поиска. Промпт может выражать контракт ответа. Контроль качества и выполнения поиска определяет, соблюдается ли этот контракт.

Анализ места использует несколько точных средств контроля, а не одну глобальную инструкцию. Система ограничивает генерацию ответов выбранными фрагментами, извлекает элементы доказательств до генерации ответов и связывает каждый сегмент ответа с соответствующим фрагментом. Частичная поддержка сужает круг допустимых аргументов, а ограниченная полнота охвата ограничивает форму ответа. Эти средства контроля снижают риск того, что неподтвержденные элементы выйдут за рамки ответа.

Общие резюме оставляют больше пространства для неподтвержденного синтеза, чем ограниченные ответы. Краткий и структурированный ответ легче контролировать, чем длинный объяснительный текст, построенный из разнородных доказательств. Ответ должен соответствовать профилю релевантности доказательств. Специфические доказательства должны давать специфический ответ. Если доказательства охватывают только одну часть многоаспектного вопроса, система должна ответить на эту часть и пометить остальные как неподтвержденные. Надежное обоснование проявляется в контролируемой неполноте. Основные дефекты обоснования при корпоративном поиске суммированы в таблице.

Обоснование (анкоринг) не позволяет извлеченным элементам служить декоративным контекстом для неподтвержденного ответа. Оно определяет, остается ли ответ в пределах доказательств в таких условиях выполнения, как устаревший контент, противоречивые фрагменты, недостаточная поддержка и стремление завершить работу быстрее .

Обнаружение ответственности и логика воздержания от ответа

Обоснование помогает ограничить ответ релевантными доказательствами, но системе требуется отдельный контроль для определения того, следует ли вообще давать ответ. Извлеченные доказательства могут быть реальными, актуальными и соответствовать политикам безопасности, но при этом быть недостаточными для ответа на исходный вопрос . Система может демонстрировать частичное соответствие, устаревший фрагмент, пару противоречащих друг другу фрагментов или отвечать только на одну часть более широкого запроса. Тем не менее модель может выдать связный ответ . Обнаружение релевантности ответа прерывает его, когда доказательства неполны.

Воздержание от ответа — это условное решение управления, связанное с достаточностью доказательств. Ответ модели «Я не знаю» полезен только тогда, когда этот поверхностный ответ соответствует реальному ограничению при выполнении. Как только уровень доступной поддержки падает ниже порогового значения, ответ должен быть опущен, даже если модель все еще может выдать плавный или осторожный ответ. Система должна уметь указывать, какие доказательства были собраны, какой сигнал достаточности не сработал и почему путь ответа был закрыт.

Критерии достаточности доказательств должны быть явными. Система должна проверять прямую релевантность элементов, подтверждающих запрос , их достаточный охват для ответа без домысков, непротиворечивость подтверждающих фрагментов, их актуальность и применимость к локальному контексту. Достаточность также может зависеть от авторитетности источника. Критерий, приемлемый для внутреннего FAQ, может не подойти для стратегического решения, регулируемого процесса или ответа, предназначенного для клиента. Воздержание от сгенерированного ответа должно оставаться политически регламентированным решением в отношении качества доказательств.

Ссылки

О чём эта статья

Ещё в разделе «Ретейл и e-commerce»

Все →

Ещё от Algolia