Корпоративный поиск оценивается на основе поддержки, прозрачности и точности в реальных условиях эксплуатации. Большие языковые языковые модели способны выдавать правдоподобные тексты, плавные обобщения и убедительные ответы. Однако избыточная плавность ответов может выходить за рамки поддержки, ожидаемой от корпоративной поисковой системы. Эта проблема становится заметной сразу после перехода поисковой системы из фазы демонстрации в промышленную эксплуатацию.
Публичные бенчмарки и задачи на основе открытого интернета позволяют модели опираться на широкие статистические закономерности из тренировочных данных. Внутренние источники отличаются от них тем, что они являются неполными, неоднородно структурированными, имеют ограниченный доступ и изобилуют ограничениями, продиктованными регламентами. В одном отделе есть дополнительное соглашение к договору, которое недоступно другому отделу. Один индекс актуален, а другой отстает на три недели. Одна страница политик заменяет более старую, хотя обе остаются доступными для поиска.Лингвистическая беглость может придать системе уверенный вид до того, как у нее появится надежная основа.
В корпоративном поиске галлюцинации проявляются в различных повторяющихся формах.
- Вымышленный факт: система воспроизводит сведения, которые отсутствуют в каком-либо признанном источнике.
- Необоснованный вывод: ответ объединяет фрагменты из нескольких документов в вывод, который фактически не подтверждается ни одним из источников.
- Формирование устаревших ответов: система обращается к информации из устаревших материалов и представляет ее в качестве актуальных фактов.
- Поведение при ответах вне пределов области применения: модель отвечает на вопрос, для которого в доступном корпусе данных нет оснований.
- Вывод с нарушением политик: содержимое может звучать фактологически правдоподобно, но при этом нарушает границы в отношении доступа, конфиденциальности или комплаенса.
Вымышленные факты проще всего упустить из виду и труднее всего контролировать, как только ответ уже пересек границу интерфейса. Модель может выдумать дату продления срока действия, пороговое значение для политики, зависимость продукта или пункт, который никогда не был написан. Необоснованный синтез действует тоньше и зачастую опаснее. Ответ может цитировать подлинные документы, но при этом объединять их в интерпретацию, которую не одобрил бы ни один аудитор. Устаревшие ответы несут в себе иной тип риска. Система извлекает доказательства, относящиеся к более старому процессу, устаревшему договору или утратившему силу руководству. Ответы вне пределов области применения терпят неудачу на границе корпуса данных. Модель дает ответ, поскольку подсказка требует завершения, хотя доступный корпус не содержит достаточной поддержки. Выводы, нарушающие политики, представляют собой еще один уровень проблемы. Ответ может раскрывать конфиденциальную информацию, объединять содержимое через границы безопасности или обнародовать детали, которые должны были быть отфильтрованы до генерации. Корпоративный поиск должен рассматривать все это как сбои с оперативными последствиями.
В службе поддержки вымышленный шаг по устранению неполадок может сбить клиента с толку и привести к увеличению числа обращений. В финансовой сфере неверный ответ о порогах утверждения, правилах ценообразования или логике отчетности может направить следующее решение по ложному пути. В юридических процессах и процессах комплаенс необоснованный ответ может выглядеть настолько авторитетным, что его распространят дальше до проведения проверки. В здравоохранении и других регулируемых отраслях устаревшие или не подтвержденные руководящие принципы могут создавать прямые риски. В поиске по внутренним знаниям наблюдается та же закономерность. Сотрудники используют результаты поиска для принятия процедурных решений, эскалации проблем, устранения инцидентов и интерпретации политик. Ответ низкого качества может быстро привести к увеличению объема работы.
В агентских рабочих процессах неверный ответ может напрямую привести к действию. Вымышленный статус поставщика может направить дело по неверному процессу, неверная интерпретация политик может передать дело не той команде, а неверные сведения о статусе заказа или претензиях могут привести к вызову API, возврату средств, изменению статуса или коммуникации с клиентом, которых никогда не должно было происходить. В традиционном поисковом интерфейсе у человека все еще есть возможность заметить ошибку до совершения действия. В рабочем процессе на базе агентов неверный ответ может напрямую повлиять на поведение программного обеспечения и бизнес-процессы. Галюцинации превращаются в проблему контроля.
Использование средств ввода позволяет сократить количество некоторых заметных паттернов ошибок. Достаточность доказательств, актуальность документов и дисциплина доступа определяются архитектурой системы. Противоречия между источниками требуют контроля в отношении поиска, проверки и удержания. Четко сформулированная инструкция зависит от достоверных доказательств, применимого контекста и правильных документов. Общекорпоративная проблема начинается еще до генерации и продолжается после нее, причем поиск, выбор доказательств, возможность ответа, указание источников и соблюдение политик — все это определяет, является ли окончательный ответ обоснованным.
Командам внутри компаний нужны ответы, которые они могут проверить в момент принятия решения. Производственная система должна отвечать на основе утвержденных данных, с соблюдением правил доступа, с актуальными доказательствами и достаточной прослеживаемостью для целей аудита. Командам необходимо знать, какой документ лег в основу ответа, существовал ли более свежий источник, имел ли пользователь право просматривать эти доказательства и следовало ли заблокировать ответ. В следующей таблице суммировано, где именно корпоративные поисковые системы дают сбой во время выполнения и какой уровень контроля служит для предотвращения соответствующей ошибки.
Ответ — это то место, где ошибка становится заметной. Первопричина может крыться в индексировании, метаданных, широте результатов поиска, ранжировании, политиках актуальности, объеме корпуса или элементах контроля вывода. Ответ, который звучит уверенно, может скрывать отсутствие доказательств, неразрешенные конфликты или подсказки, которые никогда не должны были попасть в поисковый запрос.
Извлечение как основа истины
Сбор данных является первым уровнем контроля, так какdie Qualität und der Umfang des Evidenzpakets darüber entscheiden, wie aussagekräftig die Antwort sein kann.неправильные, устаревшие, неполные или неавторизованные фрагменты ухудшают генерацию. Тем не менее, модель способна выдать связный ответ, который не подкреплен актуальными фактическими данными. Сбор данных определяет то, что именно поступает на вход для генерации.
Хотя обширное контекстное окно влияет на объем материала, который может обработать модель, выбор подтверждающих документов по-прежнему определяет обоснованность ответа. Больший объем текста может приводить к избыточности шума, дублированию контента, противоречиям и отвлечению внимания от действительно релевантных фрагментов. Обширные подсказки могут маскировать ошибки ранжирования, поскольку полезный и бесполезный материал доставляется вместе. Надежный сбор информации по-прежнему зависит от дисциплинированного отбора кандидатов, четкого определения области исследования и компрессии.
Релевантности самой по себе недостаточно. Документ может соответствовать поисковому запросу, но при этом быть непригодным в качестве доказательства для аргументации. Он может относиться к другому бизнес-подразделению, отражать устаревшую версию политики или содержать общую фоновую информацию, не подтверждая спорный момент. При выборе доказательств необходимо проводить различие между связанным материалом и пригодными к использованию свидетельствами.
Гибридный поиск снижает количество ошибок двух различных типов. Плотный поиск эффективен при работе с семантической близостью, обработке парафраз и сопоставлении понятий, однако он может отдавать предпочтение фрагментам, которые кажутся тематически релевантными, но в которых отсутствуют конкретный термин, идентификатор или часть предложения, на которых строится ответ. Ключевой поиск эффективен при точной выдаче по совпадению, работе с именами собственными, названиями продуктов, кодами политик и структурированными идентификаторами, однако он может не учесть намерения пользователя, если запрос сформулирован расплывчато или в нем используется иная лексика по сравнению с исходным материалом. Гибридный подход снижает оба типа ошибок, объединяя лексическую точность с семантическим охватом с последующей сортировкой списка результатов с помощью ранжирования.
Ранжирование — это следующий шаг. На этапе первоначального поиска создается широкий охват, а ранжирование превращает этот широкий набор кандидатов в пригодный к использованию пакет доказательств. Без ранжирования на вход могут поступать фрагменты, которые выглядят правдоподобно по отдельности, но оказываются слабыми в совокупности. Инструмент ранжирования позволяет с более высоким разрешением оценивать соответствие между запросом и документом, выделять фрагменты с прямой поддержкой ответа и понижать в выдаче те пассажи, которые содержат лишь тематически связанные формулировки. Процесс генерации крайне чувствителен к порядку и релевантности элементов, причем доказательства в начале пакета получают больше внимания. Некачественное ранжирование ведет к возникновению скрытого «пути галлюцинаций». Нужный документ может присутствовать где-то во входных данных, но модель опирается на менее точный фрагмент и строит ответ, отталкиваясь от него.
Метаданные фильтрации имеют такое же значение, как и семантическое сопоставление. Уровень доступа, бизнес-подразделение, регион, линейка продуктов, тип документа, статус политики, язык, юрисдикция и статус актуальности — всё это влияет на то, является ли тот или иной фрагмент допустимым обоснованием для конкретного пользователя и заданного вопроса. Фильтрация представляет собой механизм, применяющий данные ограничения до начала генерации. Ненадлежащее управление метаданными может привести к тому, что список результатов будет выглядеть убедительно, несмотря на выход за рамки допустимой области применения. Процесс генерации не способен надежно исправить эту ошибку. Система может извлечь проект политики вместо утвержденной версии, глобальную политику вместо регионального правила или документ, к которому у пользователя нет прав доступа. Качество результатов поиска напрямую зависит от управления метаданными, поскольку поддержка в каждом конкретном контексте должна быть корректной.
Проверки на актуальность выполняются непосредственно в рамках процесса извлечения. Множество ошибок в корпоративной среде возникает из-за предоставления допустимой, но устаревшей информации. Устаревший рабочий процесс, замененная политика льгот или потерявший актуальность технический регламент (runbook) могут по-прежнему занимать высокие позиции в выдаче, если текст написан без ошибок и изобилует ссылками. Сама по себе формулировка редко указывает на то, что контент устарел. На уровне извлечения требуется логика проверки актуальности, учет приоритета версий и правил жизненного цикла документов, чтобы потерявший актуальность контент утрачивал свой авторитет до того, как попадет в подсказку. Для некоторых вопросов стандартом является получение самого свежего ответа. Для других требуется политика, действовавшая на определенную дату. Проект процесса извлечения должен учитывать это различие, иначе система будет трактовать все подходящие документы как одинаково действующие, что в продакшн-среде случается редко.
Стратегия разбиения на фрагменты (чанкинг) влияет на качество результатов поиска на более глубоком уровне, чем предполагают многие команды. Границы фрагментов определяют, какая именно информация может быть извлечена совместно, какие доказательства остаются связанными с окружающим их контекстом и какая часть исходной структуры документа сохраняется в наборе кандидатов. Фрагменты на уровне предложений могут повысить точность при работе с очень специфическими утверждениями, однако они часто упускают ограничения, оговорки и исключения, важные для правильной интерпретации. Крупные фрагменты на уровне абзацев или разделов сохраняют больше контекста, но могут скрывать релевантные доказательства среди второстепенной информации и снижать точность ранжирования. Стратегия разбиения, ориентированная на разделы, зачастую работает эффективнее, так как она учитывает структуру документа, такую как заголовки, списки, таблицы и подразделы политик.
При чанкинге необходимо сохранять семантическое единство фрагмента с доказательством, которое действительно необходимо для формирования ответа.
Неправильное разделение на чанки приводит к предсказуемым «путям галлюцинаций». Чанк в одно предложение может уловить ориентир, но при этом упустить исключение, идущее двумя строками ниже; чанк абзаца может содержать как текущее, так и отмененное правило, если исходный документ был плохо отредактирован; разделение по строке таблицы может отделить значение от заголовка, который придает этому значению смысл; а чанк раздела может стать настолько большим, что для реранкера останется различимым лишь общее тематическое сходство. В любом случае модель получает материал, который кажется пригодным, но лишен структурной целостности доказательств. Обоснованная генерация зависит оттого, чтобы сохранять достаточно локального контекста для обеспечения интерпретации.
Структурированные и неструктурированные данные должны быть объединены в рамках одного пути поиска. «Корпоративная истина» часто распределена по нескольким форматам данных. Ответ службы поддержки может потребовать абзаца из правил, атрибута продукта, поля состояния и записи о разрешениях. Пайплайн, основанный исключительно на документах, может упускать состояния, существующие в структурированных системах. Пайплайн, основанный исключительно на структурированных данных, может упускать пояснения или правила обработки исключений, присутствующие только в документах. Проектирование поиска должно поддерживать обе формы и соотносить их при ранжировании. В противном случае система опирается лишь на часть реальности, а затем использует методы генерации, чтобы угадать недостающие части. Такое угадывание является одной из главных причин необоснованного синтеза.
Гигиена данных — это скрытый фундамент, на котором все держится. Качество результатов поиска стремительно падает, если корпус перегружен дубликатами файлов, ошибками парсинга, отсутствующими метаданными, плохим OCR, нечеткой историей версий или несогласованной структурой документов. Некачественный сбор данных приводит к плохим наборам кандидатов задолго до того, как в дело вступает модель. Поисковая система может обладать мощными эмбеддингами, быстрой инфраструктурой и производительным реранкером и все равно порождать галлюцинации, потому что индексированный корпус не содержит нужной информации в доступной для поиска форме. Команды часто осознают эту ошибку слишком поздно. Они изучают промпты и поведение модели, в то время как истинная проблема кроется в подготовке документов, актуальности индекса, маппинге полей или метаданных доступа. Гигиена корпуса является частью снижения риска галлюцинаций, поскольку качество информации закладывается еще на этапе сбора данных. В следующей таблице показаны поисковые решения, влияющие на риск галлюцинаций до начала генерации.
Поисковый путь для производственных данных требует четкой последовательности. Корпус разбивается на доступные для поиска единицы. Метаданные содержат информацию о доступе, актуальности и типе источника. При первом поиске комбинируются лексические и семантические сигналы. Перевзвешивание отдает предпочтение точному совпадению, а не размытому сходству. Упаковка доказательств («Evidence Packing») сохраняет отрывки, наиболее способные подтвердить ограниченный ответ. Более мощная генерация текста не способна компенсировать слабый запрос. В следующем фрагменте используется современный стиль клиента поиска Algolia 4.x для Python. Предполагается, что индекс, атрибуты с возможностью поиска, атрибуты с возможностью фильтрации, конфигурация NeuralSearch и фильтры, специфичные для пользователя, уже настроены. Принудительный доступ с ограничением по пользователю обрабатывается отдельно с помощью защищенных ключей API.
Обоснование (Grounding) как ограничение ответов
Заземление удерживает ответ в рамках доказательной базы во время выполнения. От корпоративных систем ожидается выдача ответов на основе утвержденного материала, который является актуальным, ограниченным по контексту и проверяемым. Документы внутри промпта не ограничивают ответ сами по себе. Модель может импровизировать на основе слабых отрывков, объединять противоречивые источники, полагаться на параметрическую память или дополнять ответ без достаточных оснований. Обоснование вступает в силу, когда путь ответа ограничивается с помощью отрывков, за которые система может ручаться.
Извлеченный контекст ошибочно принимается за доказательство даже тогда, когда ответ выходит за рамки того, что доказательства способны подтвердить. Добавление документов в промпт может создать ложное впечатление, что проблема надежности решена. Документы в контексте — это лишь отправная точка. Ограничение применяется позже с помощью правил, определяющих, какие отрывки считаются пригодными доказательствами, как разрешаются противоречия, как блокируются необоснованные утверждения и что модель имеет право сказать, если доказательная база скудна. Надежное основание существует только тогда, когда эти правила соблюдаются.
Параметрические знания могут упростить язык и обеспечить структуру, однако корпоративные ответы по-прежнему зависят от актуальных, утвержденных и ограниченных по контексту доказательств времени выполнения, связанных с иерархией документов. Ответ, касающийся ценового исключения, правила хранения, процедуры техподдержки или юридического пункта, должен всегда оставаться связанным с актуальным корпусом. В этом заключается оперативное значение «обоснования» в корпоративном поиске. Ответ остается в пределах границ поддержки, определяемых извлеченными доказательствами и источниками, соответствующими регламенту.
Как правило, недостаток обоснованности проявляется в самом ответе, даже если его первопричина кроется на уровень выше. Слабые доказательства, противоречивые отрывки, устаревшие документы, избыточно громоздкие пакеты доказательств и некачественный отбор свидетельств могутпривести к одному и тому же результату. Ответ звучит убедительно, но привлеченного материала недостаточно для его оправдания.
Поиск предоставляет потенциальные доказательства. Обоснование происходит между поиском и выдачей. На этом этапе принимается решение о том, могут ли доказательства подтвердить ответ в соответствии с правилами, принудительное применение которых предусмотрено системой. Подтверждение должно быть прямым, локальный контекст должен сохраняться, противоречия должны быть разрешены, а неопределенность должна быть достаточно мала, чтобы ответ мог быть опубликован. Ниже приведен упрощенный пример границы ответа на практике.
Промптинг играет лишь ограниченную роль. С помощью инструкций в промпте можно указать модели придерживаться заданных источников, избегать неподтвержденных дополнений, приводить доказательства и отклонять неподтвержденные вопросы. Эти инструкции работают только тогда, когда извлечение информации уже предоставило применимый пакет доказательств, а проверки во время выполнения обеспечивают соблюдение границ. Слабые доказательства, устаревшие документы, чрезмерно большой контекст и неразрешенные противоречия остаются проблемами качества извлечения информации и контроля. Промптинг может задать контракт на ответ. Качество извлечения информации и управление во время выполнения определяют, будет ли этот контракт выполнен.
В методе «Grounding» вместо единой всеобъемлющей инструкции используется несколько небольших механизмов управления. Система ограничивает генерацию выбранными текстовыми фрагментами, извлекает релевантные разделы текста до генерации ответа и сопоставляет каждый сегмент ответа с поддерживающим текстовым пассажем. Благодаря частичной поддержке сужается допустимая область действия утверждения, а благодаря ограниченной полноте ограничивается форма ответа. Эти механизмы управления снижают вероятность того, что формулировки, не подтвержденные текстом, выйдут за границы ответа.
Общие резюме оставляют больше пространства для необоснованного синтеза, чем узкоспециализированные ответы. Компактный ответ, ограниченный утверждениями, легче контролировать, чем пространную, объяснительную прозу, основанную на смешанных доказательствах. Ответ должен соответствовать профилю доказательств. Ограничивающие доказательства должны давать ограничивающий ответ. Если доказательства охватывают лишь часть многочастного вопроса, система должна ответить на эту часть, а остальное пометить как неподтвержденное. Сильное обоснование проявляется в виде дисциплинированной неполноты. Основные недостатки обоснования в корпоративном поиске суммированы в таблице.
Надежная основа предотвращает превращение извлеченного материала в чисто декоративную рамку для необоснованного ответа. Она определяет, остается ли ответ в условиях выполнения, таких как устаревший контент, противоречивые пассаги, слабое обоснование и dem Druck durch die Eingabeaufforderung, die Antwort abzuschließen, в рамках доказательной базы.
Определение подотчетности и логика воздержания от ответа
Благодаря привязке ответ остается в рамках имеющихся доказательств, но системе по-прежнему требуется отдельный контроль над тем, следует ли вообще генерировать ответ. Извлеченные места с доказательствами могут быть реальными, актуальными и соответствующими правилам, но при этом не отвечать на сам вопрос . Система может иметь частичное совпадение, устаревший фрагмент, пару противоречащих друг другу пассажей или поддержку только для подраздела более широкого запроса. Модель все же может сгенерировать связный ответ . Обнаружение возможности ответа останавливает генерацию, если поддержка является неполной.
Воздержание от ответа — это привязанное к пороговому значению решение по управлению, которое зависит от достаточности доказательств. Модель, которая говорит «Я не знаю», полезна только тогда, когда этот поверхностный ответ отражает реальный сигнал во время выполнения. Как только доступные доказательства падают ниже порогового значения, ответ должен быть задержан, даже если модель все еще могла бы сгенерировать связный или осторожно звучащий ответ. Система должна иметь возможность показать, какие доказательства были извлечены, какой сигнал достаточности не сработал и почему путь ответа был закрыт.
«Retrieval» собирает доказательную базу. «Grounding» ограничивает то, что генератор может использовать. «Answerability» решает, достаточно ли оставшегося обоснования для ответа, более ограниченного ответа, эскалации или воздержания от ответа. «Generation» может продолжать создавать формулировки даже в условиях неопределенности. Однако этот компонент менее надежен при принятии решения о том, должна ли эта неопределенность предотвратить ответ.
