Dans cet article
L’essentiel
Si le bon passage n’arrive jamais au modèle, modifier le prompt résout rarement le problème. Évaluez la recherche séparément : termes exacts, proximité sémantique, structure documentaire et classement traitent des erreurs différentes.
Distinguer les questions qui se ressemblent
« Comment réinitialiser cet appareil ? » et « Que signifie l’erreur AX-204 ? » ressemblent toutes deux à des questions de support. La première peut bénéficier d’une correspondance sémantique si le manuel utilise d’autres mots. La seconde exige de préserver un identifiant exact. Constituez un jeu de recherche incluant ces deux styles, des sigles, plusieurs langues et des questions portant sur plusieurs documents.
Pour chaque question, un spécialiste métier doit identifier les passages attendus. Examinez les résultats de recherche avant de demander au modèle de rédiger. Sinon, une réponse fluide peut masquer la sélection du mauvais manuel. Conservez une référence lexicale simple : la complexité mérite sa place lorsqu’elle corrige un échec précisément identifié.
Combiner précision lexicale et couverture sémantique
La recherche hybride combine recherche textuelle et vectorielle. Azure AI Search documente une implémentation qui fusionne des listes obtenues en parallèle avec la méthode reciprocal rank fusion. L’intérêt général est de conserver les correspondances exactes tout en retrouvant des formulations différentes. C’est une piste à évaluer, pas une preuve que toute configuration hybride dépasse toute recherche vectorielle.
Dans notre exemple, appliquez les mêmes filtres de produit et de droits aux deux recherches. Examinez l’origine de chaque résultat utile et vérifiez que des copies du même document ne prennent pas la place d’autres preuves. Comparez avec la référence sur les mêmes questions et versions documentaires. Une meilleure moyenne peut masquer une régression sur les codes d’erreur les plus utilisés par le support.
Deux façons de retrouver une preuve
Questions de support illustratives. Comparer les deux approches sur vos documents.
Termes exacts
« AX-204 » → préserver le code d’erreur, le produit et les identifiants.
Sens de la question
« L’appareil ne redémarre pas » → retrouver une procédure formulée autrement.
Preuves réunies
Fusionner les candidats, retirer les doublons et évaluer le classement.
Rendre chaque passage compréhensible seul
Un chunk est l’unité de texte utilisée par la recherche. Nous recommandons de partir de la structure : une section avec son titre, une procédure complète ou un tableau accompagné de ses intitulés. Une découpe systématique au même nombre de caractères peut séparer une exception de la règle concernée. Un chevauchement excessif crée des doublons et consomme du contexte.
Nous ne prescririons pas de taille universelle avant d’avoir vu les documents. Testez plusieurs découpages sur des contenus représentatifs, dont des PDF numérisés et des tableaux longs. Conservez le lien vers l’emplacement original et le contexte nécessaire pour comprendre « les conditions suivantes ». Si l’extraction a perdu l’en-tête d’un tableau, un modèle plus coûteux ne peut pas le reconstituer de manière fiable.
Ajouter le reranking avec un bénéfice mesurable
Le reranking est un second classement des candidats retrouvés, avant la sélection du contexte final. Nous proposons de garder le moteur de recherche identique et de comparer les preuves retenues avec et sans cette étape. Mesurez les passages pertinents en tête, les preuves manquantes, la latence et le coût. Un reranker ne récupère pas une source exclue par un filtre erroné.
Gardez un pipeline modulaire afin d’inspecter séparément préparation de la requête, recherche et assemblage du contexte. La documentation RAG de Spring AI illustre cette approche avec ses API d’advisors. Avant d’ajouter une étape, décrivez le défaut constaté et le progrès attendu. Retenez la configuration la plus simple si l’étape supplémentaire n’améliore pas les questions importantes.
Diagnostiquer une référence exacte et une question courante
Prenez deux requêtes fictives : « erreur E-417 sur contrôleur X2 » et « le contrôleur s’arrête quand la pièce chauffe ». La première dépend d’un identifiant exact ; la seconde peut nécessiter une recherche par sens si le manuel parle de « coupure thermique ». Un jeu d’évaluation doit contenir les deux, pas uniquement des questions bien formulées.
Inspectez les passages candidats avant la réponse finale. Si le bon manuel n’entre jamais dans la sélection, le reclassement ne peut pas le retrouver. Vérifiez d’abord traitement des identifiants, filtres, langue et couverture. Si le bon passage est présent mais enfoui, le classement devient une piste. Cela évite de modifier trois étapes simultanément sans savoir expliquer l’amélioration.
Utiliser une matrice d’échecs plutôt qu’un score unique
Regroupez les questions par difficulté : code exact, reformulation, source absente, produit ambigu et révision contradictoire. Comparez les configurations sur les mêmes groupes en conservant les passages. Une moyenne unique peut masquer une régression sur les références que le support utilise quotidiennement.
Mesurez délai, pertinence et quantité de contexte envoyée à la génération. Ajouter des passages peut augmenter coût et contradictions sans améliorer la réponse. Choisissez limite de candidats et reclassement à partir des cas observés, puis rejouez l’évaluation après changement documentaire ou d’embeddings. Le résultat utile est une décision traçable, pas l’affirmation que la recherche hybride serait toujours supérieure.
Trouver l’étape qui a perdu la preuve
Cas de diagnostic illustratifs, sans scores de performance implicites.
Faites défiler horizontalement pour lire le tableau →
| Symptôme | À inspecter | Prochaine expérience |
|---|---|---|
| Code exact introuvable | Indexation, traitement des mots, filtres | Requête par identifiant exact |
| La reformulation manque le manuel | Candidats sémantiques et couverture | Comparer résultats lexicaux et sémantiques |
| Passage pertinent enfoui | Ordre des candidats et doublons | Évaluer le reclassement sur les mêmes cas |
| Bon passage, mauvaise réponse | Génération et contexte contradictoire | Vérifier les affirmations face aux preuves |
Sources et lectures complémentaires
Documentation consultée le .
FAQ / DÉCISIONS
Questions fréquentes
Une base vectorielle suffit-elle pour un RAG ?+
Elle peut soutenir une première recherche, mais extraction, droits, classement et évaluation des réponses restent à concevoir. Testez les identifiants exacts autant que les questions en langage naturel.
Faut-il toujours utiliser un reranker ?+
Non. Ajoutez-en un lorsque la comparaison sur vos propres questions montre que le meilleur contexte justifie la latence et le coût supplémentaires.