Atténuation des hallucinations dans la recherche d'entreprise

Source: Algolia•

Atténuation des hallucinations dans la recherche d'entreprise

La recherche en entreprise est évaluée selon sa capacité à fournir un support adéquat, une traçabilité efficace et une exactitude satisfaisante dans des conditions d'utilisation réelles. Les modèles de langage complexes peuvent produire un langage plausible, des résumés fluides et des réponses…

La recherche en entreprise est évaluée selon sa capacité à fournir un support adéquat, une traçabilité efficace et une exactitude satisfaisante dans des conditions d'utilisation réelles. Les modèles de langage complexes peuvent produire un langage plausible, des résumés fluides et des réponses fiables. Cependant, même avec une sortie fluide, la recherche en entreprise peut dépasser les capacités attendues. Le problème devient évident dès qu'un système de recherche passe de la phase de démonstration à la production.

Les benchmarks publics et les tâches web ouvertes permettent à un modèle de s'appuyer sur des tendances statistiques générales issues des données d'entraînement. Les sources internes, quant à elles, sont différentes : incomplètes, structurées de manière hétérogène, soumises à des contrôles d'accès et soumises à de nombreuses restrictions de politiques internes . Un service peut avoir accès à un avenant au contrat auquel un autre n'a pas accès. Un index est à jour tandis qu'un autre accuse un retard de trois semaines. Une page de politique remplace une version plus ancienne, même si les deux restent consultables. Une maîtrise du langage peut donner au système une apparence de certitude avant même qu'il n'ait acquis une certaine notoriété.

Dans la recherche d'entreprise, l'hallucination revêt plusieurs formes reproductibles.

  • Fait inventé : Le système mentionne un détail qui ne figure dans aucune source approuvée.
  • Synthèse non étayée : La réponse mélange des fragments de plusieurs documents pour aboutir à une conclusion qu’aucune source ne soutient réellement.
  • Génération de réponses obsolètes : le système récupère des informations issues de documents périmés et les présente comme des vérités actuelles.
  • Comportement de réponse hors champ : le modèle répond à une question à laquelle le corpus disponible ne peut pas répondre.
  • Contenu non conforme aux règles : Le contenu peut sembler factuellement plausible, mais il dépasse les limites d'accès, de confidentialité ou de conformité.

Les faits falsifiés sont les erreurs les plus faciles à repérer et les plus difficiles à contrôler une fois la réponse transmise. Un modèle peut inventer une date de renouvellement, un seuil de politique, une dépendance produit ou une clause inédite. La synthèse non étayée est plus subtile et souvent plus dangereuse. La réponse peut citer des documents réels tout en les combinant en une interprétation qu'aucun relecteur n'approuverait. Les réponses obsolètes créent un autre type de risque. Le système récupère des éléments de preuve appartenant à un processus ancien, un contrat périmé ou un document de référence obsolète. Les réponses hors champ échouent à la limite du corpus. Le modèle répond car l'invite sollicite une réponse, même si le corpus disponible ne contient pas suffisamment d'éléments justificatifs. Les résultats non conformes aux politiques ajoutent une couche supplémentaire. La réponse peut exposer des informations confidentielles, fusionner du contenu au-delà des limites de sécurité ou révéler des détails qui auraient dû être filtrés avant génération. La recherche d'entreprise doit traiter tous ces cas comme des défaillances ayant des conséquences opérationnelles.

Dans le support technique, une étape de dépannage erronée peut induire un client en erreur et générer davantage de tickets. En finance, une réponse incorrecte concernant les seuils d'approbation, les règles de tarification ou la logique de reporting peut influencer négativement la décision suivante. Dans les processus juridiques et de conformité, une réponse non étayée peut paraître suffisamment crédible pour être diffusée avant validation. Dans le secteur de la santé et d'autres domaines réglementés, des directives obsolètes ou non sourcées peuvent engendrer des risques immédiats. La recherche de connaissances internes suit le même principe. Les employés utilisent les résultats de recherche pour prendre des décisions procédurales, acheminer les problèmes, résoudre les incidents et interpréter les politiques. Une réponse de mauvaise qualité peut rapidement engendrer une surcharge de travail.

Dans les flux de travail automatisés , une réponse erronée peut entraîner des actions immédiates. Un statut fournisseur falsifié peut orienter un dossier vers le mauvais processus, une interprétation erronée d'une politique peut l'attribuer à la mauvaise équipe, et une fausse déclaration concernant l'état ou les droits d'une commande peut déclencher un appel API, un remboursement, une modification de statut ou une communication client inappropriée. Dans une interface de recherche classique, l'utilisateur a encore la possibilité de repérer l'erreur avant d'agir. Dans un flux de travail automatisé, la réponse erronée peut impacter directement le comportement du logiciel et les opérations commerciales. L'erreur devient alors un problème de contrôle.

L'incitation peut réduire certains schémas d'erreurs visibles. La suffisance des preuves, la fraîcheur des documents et les règles d'accès sont définies par la conception du système. Les contradictions entre les sources nécessitent des contrôles de recherche, de validation et d'exclusion. Une instruction bien formulée repose sur des preuves solides, un contexte exploitable et les documents appropriés. Le problème de l'entreprise commence avant la production et se poursuit après, la recherche, la sélection des preuves, la responsabilisation, l'attribution et l'application des politiques étant autant d'éléments qui déterminent si la réponse finale est justifiable.

Les équipes en entreprise ont besoin de réponses vérifiables au moment de la prise de décision. Un système de production doit fournir des réponses basées sur des données approuvées, conformes aux règles d'accès, étayées par des preuves à jour et offrant une traçabilité suffisante pour permettre les contrôles. Les équipes doivent savoir quel document a étayé la réponse, s'il existe une source plus récente, si l'utilisateur était autorisé à consulter ces preuves et si la réponse aurait dû être bloquée. Le tableau ci-dessous récapitule les points de défaillance des systèmes de recherche d'entreprise lors de leur exécution et la couche de contrôle censée prévenir chaque défaillance.

C’est dans la réponse que le problème se révèle. La cause profonde peut résider dans l’indexation, les métadonnées, l’étendue de la recherche, le classement, la politique de fraîcheur des données, la portée du corpus ou les contrôles de sortie. Une réponse qui paraît péremptoire peut masquer un manque de documentation, un conflit non résolu ou des éléments qui n’auraient jamais dû être présentés.

La récupération comme fondement de la vérité

La phase de récupération constitue la première étape de contrôle, car la qualité et l'étendue des preuves déterminent la pertinence de la réponse. Des passages erronés, obsolètes, incomplets ou non autorisés compromettent la génération. Le modèle peut néanmoins produire une réponse cohérente, même si les preuves actuelles ne la confirment pas. La phase de récupération détermine les éléments qui sont transmis à la génération.

Une fenêtre de contexte étendue modifie la quantité de données qu'un modèle peut traiter, mais la sélection des preuves reste déterminante pour la pertinence de la réponse. Un texte trop long peut engendrer du bruit, des doublons, des contradictions et détourner l'attention des passages essentiels. Des requêtes trop longues peuvent masquer des erreurs de classement, car des éléments utiles et inutiles arrivent simultanément. Une recherche performante repose toujours sur une sélection rigoureuse des candidats, une définition précise de leur portée et une compression efficace.

La pertinence ne suffit pas. Un document peut correspondre à la requête sans pour autant constituer un élément de preuve pertinent. Il peut appartenir à une autre unité opérationnelle, refléter une version de politique antérieure ou fournir des informations générales sans étayer le point litigieux. La sélection des preuves doit permettre de distinguer les documents pertinents des éléments exploitables.

La recherche hybride réduit deux types d'erreurs. La recherche dense excelle dans la similarité sémantique, la gestion des paraphrases et la correspondance conceptuelle, mais elle peut s'orienter vers des passages qui semblent pertinents sans pour autant identifier précisément le terme, l'identifiant ou la proposition qui fonde la réponse. La recherche par mots-clés, quant à elle, est performante pour la correspondance littérale, les noms propres, les noms de produits, les codes de politique et les identifiants structurés, mais elle peut mal interpréter l'intention lorsque les utilisateurs formulent leur requête de manière imprécise ou emploient un vocabulaire différent de celui du document source. Une approche hybride réduit ces deux types d'erreurs en combinant précision lexicale et étendue sémantique, puis en utilisant un système de classement pour trier l'ensemble des résultats.

Le réordonnancement est l'étape suivante. La recherche initiale permet de couvrir un large éventail de possibilités, et le réordonnancement transforme cet ensemble de candidats en un corpus de preuves exploitables. Sans réordonnancement, la requête peut contenir des passages individuellement plausibles, mais collectivement peu pertinents. Un système de réordonnancement peut pondérer la pertinence entre la requête et le document avec une plus grande précision, mettre en avant les passages apportant un soutien direct à la réponse et reléguer au second plan ceux qui ne partagent que des éléments thématiques. La génération est très sensible à l'ordre et à la saillance, les preuves situées en haut du classement recevant davantage d'attention. Un réordonnancement insuffisant crée donc un biais de raisonnement. Le document pertinent peut être présent quelque part dans la requête, mais le modèle s'appuie sur un passage moins précis et construit la réponse à partir de là.

Les filtres de métadonnées sont tout aussi importants que la correspondance sémantique. Le niveau d'accès, l'unité commerciale, la région, la gamme de produits, le type de document, l'état de la politique, la langue, la juridiction et la mise à jour des informations influencent la pertinence d'un passage pour un utilisateur et une question donnés. Le filtrage est le mécanisme qui applique ces contraintes avant la génération. Un manque de rigueur dans les métadonnées peut donner l'illusion d'un résultat pertinent, même s'il est hors contexte. La génération ne corrige pas systématiquement cette erreur. Un système peut ainsi récupérer une politique en cours d'élaboration au lieu d'une politique approuvée, une politique globale au lieu d'une règle régionale, ou un document auquel l'utilisateur ne devrait pas avoir accès. La qualité de la recherche dépend de la rigueur des métadonnées, car le document doit être pertinent dans son contexte.

Les contrôles de fraîcheur doivent être intégrés au processus de recherche lui-même. De nombreuses erreurs en entreprise proviennent de la fourniture de preuves valides mais obsolètes. Un flux de travail mis hors service, une politique de prestations obsolète ou un manuel technique périmé peuvent encore figurer en bonne place dans le classement si le texte reste clair et bien structuré. Le langage seul révèle rarement l'obsolescence des documents. La couche de recherche a besoin d'une logique de fraîcheur explicite, d'une préférence de version et de règles de cycle de vie des documents afin que les contenus obsolètes perdent leur autorité avant d'être affichés. Certaines questions exigent par défaut la réponse la plus récente. D'autres exigent la politique en vigueur à une date précise. La conception de la recherche doit intégrer cette distinction, sinon le système traitera tous les documents correspondants comme également valides, ce qui est rarement le cas en production.

La stratégie de segmentation influence la qualité de la recherche de manière plus profonde que beaucoup d'équipes ne le pensent. Les limites des segments déterminent quelles informations peuvent être extraites ensemble, quelles preuves restent rattachées à leur contexte et quelle part de la structure originale du document est conservée dans l'ensemble des résultats potentiels. Les segments au niveau de la phrase peuvent améliorer la précision des affirmations très spécifiques, mais ils suppriment souvent les qualificatifs, les clauses de portée et les exceptions essentiels à une interprétation correcte. Les segments de paragraphe ou de section plus larges préservent davantage le contexte, mais peuvent noyer les informations pertinentes dans le bruit et réduire la pertinence du classement. La segmentation prenant en compte les sections est souvent plus efficace car elle respecte la structure du document, notamment les titres, les listes à puces, les tableaux et les sous-sections.

Le découpage en segments doit préserver l'unité sémantique de preuve que la réponse exige réellement.

Un mauvais découpage en segments engendre des erreurs prévisibles. Un segment de phrase peut contenir un seuil de politique tout en occultant l'exception qui suit deux lignes plus loin ; un segment de paragraphe peut inclure à la fois la règle actuelle et la règle obsolète si le document source a été mal édité ; une coupure sur une ligne de tableau peut séparer une valeur de l'en-tête qui lui donne son sens ; et un segment de section peut devenir si volumineux que seule une similarité thématique générique reste visible pour le système de réorganisation. Dans chaque cas, le modèle reçoit des données qui semblent utilisables, mais qui manquent de la cohérence structurelle des preuves. La génération ancrée dans la réalité repose sur des unités de recherche qui préservent suffisamment de contexte local pour permettre l'interprétation.

Les données structurées et non structurées doivent converger au sein d'un même processus de recherche. La vérité de l'entreprise se répartit souvent entre plusieurs types de données. Une réponse au support peut nécessiter un paragraphe de politique, un attribut de produit, un champ de statut et un enregistrement d'autorisations. Un pipeline purement documentaire peut passer à côté d'informations présentes dans les systèmes structurés. Inversement, un pipeline purement structuré peut ignorer les explications ou la gestion des exceptions propres aux documents. La conception de la recherche doit prendre en charge les deux formats et les concilier lors du classement. Autrement, le système ne se base que sur une partie de la réalité et recourt à la génération pour deviner les éléments manquants. Cette supposition est l'une des principales sources de synthèse non prise en charge.

L'hygiène des données est la dépendance sous-jacente, souvent négligée. La qualité de la recherche se dégrade rapidement si le corpus est encombré de fichiers dupliqués, d'analyses syntaxiques erronées, de métadonnées manquantes, d'une reconnaissance optique de caractères (OCR) défaillante, d'une traçabilité des versions imprécise ou d'une structure documentaire incohérente. Une mauvaise ingestion produit des ensembles de candidats de mauvaise qualité bien avant l'entrée en jeu du modèle. Un système de recherche peut disposer d'un corpus d'embeddings performant, d'une infrastructure rapide et d'un système de réordonnancement efficace, et pourtant présenter des résultats erronés car le corpus indexé ne conserve pas les preuves pertinentes sous une forme exploitable. Les équipes diagnostiquent souvent ce problème trop tard. Elles examinent les invites et le comportement du modèle alors que le véritable problème réside dans la préparation des documents, la fraîcheur de l'index, le mappage des champs ou les métadonnées d'accès. L'hygiène du corpus contribue à atténuer ces résultats erronés, car la qualité des preuves commence dès l'ingestion. Le tableau ci-dessous illustre les décisions de recherche qui influencent le risque de résultats erronés avant même le début de la génération.

Un processus de recherche documentaire nécessite une séquence claire. Le corpus est divisé en unités exploitables. Les métadonnées contiennent des informations sur l'accès, la fraîcheur et le type de source. La recherche initiale combine des signaux lexicaux et sémantiques. Le réordonnancement privilégie le soutien direct à la similarité diffuse. Le regroupement des preuves préserve les passages les plus susceptibles d'appuyer une réponse précise. Une génération de prose plus robuste ne corrige pas une recherche inefficace. L'extrait de code ci-dessous utilise le style actuel du client Python d'Algolia Search 4.x. Il suppose que l'index, les attributs indexables, les attributs filtrables, la configuration NeuralSearch et les filtres de portée utilisateur existent déjà. L'accès restreint aux utilisateurs est géré séparément à l'aide de clés API sécurisées.

Mise à la terre comme contrainte de réponse

L'ancrage des données garantit que la réponse repose sur des preuves concrètes. Les systèmes d'entreprise doivent répondre à partir de documents approuvés, à jour, circonscrits et vérifiables. Les documents inclus dans une invite ne contraignent pas la réponse. Un modèle peut improviser pour pallier les passages peu clairs, fusionner des sources contradictoires, s'appuyer sur la mémoire paramétrique ou compléter une réponse même sans preuves suffisantes. L'ancrage des données commence lorsque le chemin de réponse est contraint par

Le contexte récupéré est souvent confondu avec une preuve, même lorsque la réponse dépasse ce que les éléments de preuve permettent d'étayer. Joindre des documents à la question peut donner l'illusion que le problème de fiabilité est résolu. Les documents contextualisés ne constituent qu'un point de départ. La contrainte intervient ultérieurement, par le biais de règles qui déterminent quels passages sont recevables, comment gérer les contradictions, comment bloquer les affirmations non étayées et ce que le modèle est autorisé à dire lorsque les preuves sont insuffisantes. La validité du raisonnement n'est assurée que si ces règles sont appliquées.

Les connaissances paramétriques peuvent faciliter le traitement du langage et la structuration des données, mais les réponses d'entreprise restent tributaires de preuves d'exécution actuelles, approuvées et circonscrites, liées à la provenance des documents. Une réponse concernant une exception tarifaire, une règle de conservation, une procédure de support ou une clause juridique doit demeurer ancrée dans le corpus actuel. C'est le sens opérationnel de l'ancrage dans la recherche d'entreprise. La réponse reste circonscrite au périmètre de support défini par les preuves extraites et les sources approuvées par les politiques en vigueur.

Le manque de fondement se manifeste généralement dans la réponse, même lorsque la cause profonde se situe à un niveau antérieur. Des preuves insuffisantes, des passages contradictoires, des documents obsolètes, des dossiers de preuves trop volumineux et une mauvaise sélection des preuves peuvent aboutir au même résultat : la réponse semble étayée alors que les éléments recueillis ne permettent pas de la justifier pleinement.

La phase de recherche fournit des éléments de preuve potentiels. La validation intervient entre la recherche et la diffusion. Elle détermine si les éléments de preuve peuvent étayer la réponse conformément aux règles que le système est censé appliquer. L'élément de preuve doit être direct, le contexte local doit le préserver, les contradictions doivent être résolues et l'incertitude doit être suffisamment faible pour que la réponse soit recevable. Vous trouverez ci-dessous un exemple simplifié de la validation de la réponse en pratique.

L'invite a un rôle limité. Les instructions d'invite indiquent au modèle de rester dans les sources fournies, d'éviter les complétions non étayées, de citer les preuves et de refuser les questions non étayées. Ces instructions ne fonctionnent que si la recherche a déjà produit un ensemble de preuves exploitables et que les contrôles d'exécution garantissent le respect des limites. Un support insuffisant, des documents obsolètes, un contexte trop étendu et des contradictions non résolues constituent toujours des problèmes de qualité et de contrôle de la recherche. L'invite peut exprimer le contrat de réponse. Les contrôles de qualité et d'exécution de la recherche déterminent si ce contrat est respecté.

L'analyse de la place utilise plusieurs contrôles précis plutôt qu'une seule instruction globale. Le système limite la génération de réponses à des passages sélectionnés, extrait les éléments de preuve avant de générer les réponses et associe chaque segment de réponse à un passage pertinent. Un soutien partiel restreint le champ des arguments autorisés et une couverture limitée restreint la forme de la réponse. Ces contrôles réduisent le risque que des éléments non étayés dépassent les limites de la réponse.

Les résumés généraux laissent davantage de place à la synthèse non étayée que les réponses circonscrites. Une réponse concise et structurée est plus facile à contrôler qu'un long texte explicatif construit à partir d'éléments de preuve hétérogènes. La réponse doit correspondre au profil de pertinence des éléments de preuve. Des éléments de preuve spécifiques doivent produire une réponse spécifique. Si les éléments de preuve ne couvrent qu'une seule partie d'une question à plusieurs volets, le système doit répondre à cette partie et signaler les autres comme non étayées. Une justification solide se manifeste par une incomplétude maîtrisée. Les principaux défauts de justification dans la recherche d'entreprise sont résumés dans le tableau.

L'ancrage empêche les éléments récupérés de servir de contexte décoratif à une réponse non étayée. Il détermine si la réponse reste dans les limites des preuves en cas de conditions d'exécution telles que des contenus obsolètes, des passages contradictoires, un soutien insuffisant et une pression pour terminer rapidement .

Détection de la responsabilité et logique de l'abstention

L'ancrage permet de limiter la réponse aux éléments de preuve pertinents, mais le système nécessite un contrôle distinct pour déterminer si une réponse doit être produite. Les éléments de preuve récupérés peuvent être réels, à jour et conformes aux politiques de sécurité, tout en étant insuffisants pour répondre à la question initiale . Le système peut présenter une correspondance partielle, un fragment obsolète, une paire de passages contradictoires ou ne répondre qu'à une seule partie d'une requête plus large. Le modèle peut néanmoins produire une réponse cohérente . La détection de la pertinence de la réponse interrompt celle-ci lorsque les éléments de preuve sont incomplets.

L'abstention est une décision de contrôle conditionnelle liée à la suffisance des preuves. Un modèle répondant « Je ne sais pas » n'est utile que si cette réponse superficielle correspond à une véritable limitation d'exécution. Dès que le niveau de support disponible passe sous le seuil, la réponse doit être omise, même si le modèle pourrait encore fournir une réponse fluide ou prudente. Le système doit pouvoir indiquer quelles preuves ont été recueillies, quel signal de suffisance a échoué et pourquoi la voie de réponse a été fermée.

Les critères de suffisance des preuves doivent être explicites. Le système doit vérifier la pertinence directe des éléments étayant la demande , leur couverture suffisante pour répondre sans conjecture, la cohérence des passages justificatifs, leur actualité et leur applicabilité au contexte local. La suffisance peut également dépendre de l'autorité de la source. Un critère acceptable pour une FAQ interne peut ne pas l'être pour une décision stratégique, un processus réglementé ou une réponse destinée à un client. L'abstention doit rester une décision encadrée par une politique, en matière de qualité des preuves.

Références

What this article says