Tous les articles

Publié le 9 min de lecture

Un RAG ne range pas le cabinet : structurer ses données d'abord

Avant de connecter un RAG aux documents du cabinet : océrisation, versions, dates, périmètre. Les quatre chantiers qui décident de la qualité des réponses.

Frédéric Dechamps

  • rag
  • données
  • documents
Vue plongeante d'une table de chêne : à gauche une pile de dossiers anciens sanglés de ruban rouge, à droite une pile de documents remise en ordre près d'un scanner à plat ouvert

Un cabinet d'avocats importe l'intégralité de son Drive dans un assistant IA, pose sa première question, et lit : « je ne trouve pas ce document ». Le document est pourtant là. Il a été scanné en 2021, il dort dans un sous-dossier de dossier clos, et l'assistant ne le voit pas.

Ce genre de déconvenue n'est pas un défaut de l'outil. C'est ce qui arrive quand on branche un RAG sur une base documentaire que personne n'a jamais préparée pour être lue par une machine. RAG, pour retrieval augmented generation : au lieu de répondre de mémoire, le système cherche d'abord des passages dans vos documents, puis rédige à partir de ces passages en citant leur origine. Tout repose sur la première étape. Un passage que la recherche ne retrouve pas n'existe pas pour le modèle qui rédige.

Structurer ses données avant de connecter un RAG ne veut pas dire refondre le classement du cabinet pendant six mois. Quatre chantiers portent l'essentiel du résultat, et aucun ne demande de compétence technique.

Prérequis : ce qu'il faut réunir avant de connecter le premier dossier

Trois décisions et un inventaire suffisent pour démarrer. Aucun budget logiciel n'est nécessaire à ce stade : un copieur capable d'océrisation et le temps de deux personnes couvrent le chantier.

  • Savoir où vivent les documents : serveur local, Drive ou SharePoint, boîtes mail, et souvent encore des dossiers papier. Un cabinet a rarement un seul emplacement.
  • Estimer la part de documents scannés dans le fonds. C'est la variable qui détermine la taille du reste du travail.
  • Trancher le périmètre : quels dossiers entrent, lesquels restent dehors, et qui arbitre les cas limites.
  • Désigner une personne qui répond aux questions d'arbitrage. Un associé, pas un prestataire externe : les questions qui se posent sont déontologiques avant d'être techniques.
  • Savoir ce que le cabinet s'autorise déjà en matière d'IA. Si aucune règle interne n'existe, la poser avant le premier import plutôt qu'après le premier incident.

Ce qu'un RAG lit vraiment dans les documents du cabinet

Un RAG ne lit pas des dossiers, il lit des morceaux de texte. Le détail compte, parce que la plupart des mauvaises surprises viennent de là.

Le parcours d'un document tient en cinq étapes. Le système extrait le texte brut du fichier. Il découpe ce texte en passages de quelques centaines de mots. Il indexe chaque passage de manière à le retrouver par le sens, pas seulement par les mots exacts. À la question posée, il remonte les passages les plus proches. Le modèle rédige enfin sa réponse à partir de ces seuls passages, et cite leur origine.

flowchart TD
    D["Document du cabinet"] --> E{"Le fichier contient-il du texte ?"}
    E -->|"Non : PDF image, photo"| X1["Invisible pour l'assistant"]
    E -->|"Oui"| C["Découpage en passages"]
    C --> I["Indexation des passages"]
    Q["Question de l'avocat"] --> R["Recherche des passages proches"]
    I --> R
    R --> V{"Plusieurs versions du même texte ?"}
    V -->|"Aucune date, aucun statut"| X2["Version périmée citée comme actuelle"]
    V -->|"Une version fait foi"| G["Rédaction à partir des passages"]
    G --> S["Sources citées, vérifiables par l'avocat"]

Deux conséquences pratiques. Un document sans couche texte ne ralentit pas le système : il en disparaît, sans message d'erreur. Et un document que rien ne date ne sera pas écarté parce qu'il est périmé : il sera remonté comme les autres.

Ces points de rupture ne sont pas théoriques. Le RegLab de Stanford a testé trois outils de recherche juridique construits sur du RAG, sur plus de 200 questions ouvertes, dans une étude publiée en 2025 au Journal of Empirical Legal Studies : ils produisent des réponses fausses ou mal étayées dans 17 % à 33 % des cas selon l'outil. Ces produits travaillent pourtant sur des bases éditoriales entretenues par des équipes dédiées. Un corpus de cabinet laissé en l'état ne part pas avec cet avantage.

de réponses fausses ou mal étayées mesurées sur trois outils de recherche juridique construits sur du RAG
17 % à 33 %
Stanford RegLab, Journal of Empirical Legal Studies (2025)
longueur maximale recommandée pour un nom de fichier, pour rester lisible par tout logiciel
30 caractères
Archives de l'État en Belgique
profondeur maximale recommandée pour un plan de classement
5 niveaux
Archives de l'État en Belgique

Le piège concret : le jugement scanné que l'assistant ne voit pas

Le symptôme est toujours le même. L'assistant répond qu'il ne dispose pas de la décision, alors que le PDF est bien dans le dossier importé. Variante plus gênante : il répond sur la base d'une note de synthèse ancienne, elle bien en texte, et passe à côté du jugement lui-même.

Le diagnostic tient en un mot : le fichier est un PDF image. Il sort d'un scanner ou d'un copieur configuré sans reconnaissance optique de caractères, l'OCR. À l'écran, un humain lit le texte sans difficulté. Pour une machine, la page est une photographie : aucun caractère à extraire, donc rien à indexer. Le test prend trois secondes. Ouvrez le PDF, essayez de sélectionner un mot à la souris. Si rien ne se surligne, le document est invisible pour n'importe quel moteur de recherche documentaire.

Le fix se joue en deux temps. Pour le flux entrant, activez l'OCR dans les réglages de numérisation du copieur, souvent présenté sous l'intitulé « PDF consultable » ou « searchable PDF ». Une manipulation, une fois, et le problème cesse de se reproduire. Pour le stock existant, un traitement par lot suffit : l'ordre de grandeur observé se compte en secondes par page, pas en intervention manuelle par document. Commencez par les dossiers que vous interrogez le plus, pas par les archives de 2009.

Gros plan sur la vitre d'un scanner à plat ouvert où repose une liasse de pages agrafées posée face contre verre, lumière dorée de fin d'après-midi
Face contre vitre, la liasse est parfaitement lisible pour l'avocat qui la scanne. Sans OCR, elle ne contiendra aucun texte exploitable.

Nommer et dater ses fichiers : les règles que les Archives de l'État appliquent déjà

Les Archives de l'État en Belgique publient des règles de nommage et de classement destinées aux administrations. Elles sont transposables telles quelles à un cabinet d'avocats, et elles servent autant le confrère qui cherche que le moteur qui indexe.

Le schéma recommandé : date_type_de_document_[expéditeur/destinataire]_sujet_[version]. Avec des dates au format aaaammjj, par exemple 20240501, pour que les fichiers se trient correctement tout seuls. Trente caractères maximum par nom de fichier. Uniquement des lettres, des chiffres et le tiret bas, sans espaces ni ponctuation, parce qu'un autre logiciel repris plus tard ne saura peut-être pas les lire. Cinq niveaux maximum dans l'arborescence. Et pas de rubrique « Divers », « Autres » ou « Généralités », qui absorbent tout ce que personne ne veut classer.

Les Archives recommandent aussi un classement fonctionnel, par activité, plutôt que structurel, calqué sur l'organigramme : il ne doit pas être refait à chaque réorganisation du cabinet.

Type de fichierTexte lisible par la machineDate exploitableDoublons fréquentsÀ traiter avant de connecter
PDF généré depuis WordOuiMétadonnée et nom de fichierFaibleRien
PDF scanné, sortie copieurNonAucuneÉlevéPassage à l'OCR, sinon invisible
DOCX ou ODT de travailOuiMétadonnée peu fiableTrès élevé (v1, v2, final)Désigner la version qui fait foi
E-mail exporté et pièces jointesOuiOui, en-tête du messageTrès élevéDédoublonner les pièces jointes
Photo d'un document (JPEG, HEIC)NonDate de prise de vue, pas du documentMoyenPassage à l'OCR et renommage
Document papier non numériséNonAucuneSans objetHors périmètre tant qu'il reste papier

Une précision honnête : ces règles ont été écrites pour des archivistes, pas pour de la recherche sémantique. Un RAG retrouvera un passage pertinent dans un fichier mal nommé, du moment que le texte est là. Le nommage ne conditionne pas la recherche. Il conditionne votre capacité à trancher entre deux résultats quand l'assistant vous en présente trois versions.

Pourquoi on ne refait pas tout le plan de classement avant de brancher un RAG

Reconstruire l'arborescence complète du cabinet comme préalable à la connexion d'un RAG est le meilleur moyen de ne jamais le connecter. Le projet mobilise tout le monde, se heurte à la résistance prévisible des confrères qui maîtrisent le classement actuel, aussi imparfait soit-il, et s'étale sur des mois pendant lesquels rien n'est branché.

Il y a une raison technique de ne pas commencer par là. Un RAG ne navigue pas dans votre arborescence : il cherche dans du texte. Une hiérarchie de dossiers impeccable améliore la vie des humains, elle ne change presque rien à ce que la recherche remonte. Les quatre choses qui changent le résultat sont ailleurs : du texte extractible, une version qui fait foi, une date exploitable, un périmètre décidé.

La nuance mérite d'être dite, parce qu'elle vient des archivistes eux-mêmes. Interrogées sur le point de savoir si une bonne fonction de recherche rend le classement superflu, les Archives de l'État répondent non, pour une raison qui tient toujours : une recherche ne donne pas de vue d'ensemble. Un RAG vous répond sur ce qu'il a trouvé, jamais sur ce qui manque. Gardez donc un plan de classement et une gestion documentaire qui tient, pour les humains et pour savoir ce que vous détenez. Ne le transformez pas en condition préalable.

Le choix qu'un cabinet regrette, c'est d'avoir lancé une refonte documentaire de six mois en guise de préparation, puis d'avoir branché l'outil sur un fonds toujours pas océrisé. Le classement était magnifique. La moitié des pièces restait invisible.

Par où commencer cette semaine

Cinq gestes, dans l'ordre, et le RAG du cabinet repose sur des données exploitables.

  1. Ouvrez dix documents au hasard dans le dossier que vous consultez le plus et tentez de sélectionner du texte. La proportion de scans muets vous donne la taille réelle du chantier.
  2. Activez l'OCR sur le copieur. C'est le seul geste qui empêche le problème de grossir pendant que vous y réfléchissez.
  3. Choisissez un périmètre pilote : une matière, quelques dossiers, pas le cabinet entier.
  4. Sur ce périmètre, tranchez la version qui fait foi et redatez les fichiers au format aaaammjj.
  5. Posez dix questions dont vous connaissez déjà la réponse, et vérifiez les sources citées une par une. C'est votre recette de référence avant d'élargir.

Cette dernière étape n'est pas négociable. Un RAG bien alimenté ne supprime pas la vérification : il la rend praticable, parce qu'il cite les passages sur lesquels il s'appuie. Un corpus mal préparé lui retire cette possibilité.

Jef (https://www.jef.chat) transforme la base documentaire d'un cabinet en assistant IA aux réponses sourcées, adossé aux sources officielles belges et européennes détaillées sur sa page sources. L'inscription est gratuite, avec 50 messages offerts.

FAQ

Qu'est-ce qu'un RAG, en une phrase ?
RAG, pour retrieval augmented generation, désigne un système qui cherche d'abord des passages dans une base documentaire, puis rédige sa réponse à partir de ces passages en citant leur origine. Le modèle ne répond pas de mémoire : il répond à partir de ce que la recherche lui a remonté.
Faut-il réorganiser tous ses dossiers avant de connecter un assistant IA ?
Non. Quatre points font la différence : que le texte soit extractible, donc que les scans soient passés à l'OCR, qu'une version fasse foi, que les documents soient datables, et que le périmètre importé soit décidé. La refonte complète de l'arborescence peut attendre.
Pourquoi un assistant IA ne trouve-t-il pas un document qui se trouve pourtant dans le dossier ?
Le plus souvent, le fichier est un PDF image sans couche texte, produit par un scanner configuré sans reconnaissance optique de caractères. Le test : ouvrir le PDF et tenter de sélectionner un mot. Si rien ne se surligne, aucun moteur ne peut l'indexer.
Comment nommer ses fichiers pour qu'ils restent exploitables ?
Les Archives de l'État en Belgique recommandent un schéma fixe commençant par la date, des dates au format aaaammjj, trente caractères maximum, et uniquement des lettres, des chiffres et le tiret bas. Les fichiers se trient alors correctement et la date reste lisible sans ouvrir le document.
Un RAG supprime-t-il le risque d'erreur ?
Non. Une étude du RegLab de Stanford publiée en 2025 au Journal of Empirical Legal Studies a mesuré des taux de réponses fausses ou mal étayées de 17 % à 33 % sur trois outils de recherche juridique construits sur du RAG. La vérification des sources citées reste à la charge de l'avocat.

Sources citées

Essayez Jef sur
un de vos dossiers.

Recherche, rédaction, transcription et veille juridique : toutes les fonctionnalités sont accessibles dès l’essai.

Essayer gratuitement

50 messages offerts. Sans engagement.