Le parsing : l’analogie du dépouillement du courrier — comment une IA transforme un document en données

Huit heures trente, service courrier. Une pile d’enveloppes de tailles différentes : des factures, deux prospectus, une lettre manuscrite, un relevé plié en trois. Quelqu’un ouvre, écarte, repère, recopie un montant et une échéance dans le registre. Vingt minutes plus tard, la pile informe est devenue quinze lignes de tableau. Personne n’a produit une seule information nouvelle : tout était déjà là, mais dans une forme inutilisable.

Cette opération banale porte un nom en informatique : le parsing. C’est la brique la plus ignorée de toute la chaîne de l’IA, et celle qui fait échouer le plus de projets.

Le parsing en trois définitions

Niveau 1 — Tout public

Parser, c’est ouvrir le courrier : prendre quelque chose qui arrive en vrac et ranger chaque information dans la bonne case.

Niveau 2 — Manager

Le parsing transforme un document conçu pour un œil humain (un PDF, un contrat, une page web) en données qu’un programme peut trier, filtrer et calculer. C’est l’étape qui sépare « j’ai un document » de « j’ai de l’information ».

Niveau 3 — Définition académique

Analyse d’une suite de symboles au regard d’une structure attendue — grammaire, schéma de données, mise en page — afin d’en produire une représentation explicite et manipulable par la machine.

L’analogie-maîtresse : le dépouillement du courrier

Reprenons notre service courrier. La personne qui dépouille fait quatre choses, dans cet ordre, sans jamais y penser.

Elle ouvre et déchiffre : sortir la feuille de l’enveloppe, lire ce qui est imprimé, y compris quand c’est une photocopie de travers ou une écriture manuscrite. Elle reconnaît la forme : ceci est une facture, cela un courrier commercial, ceci encore un tableau à trois colonnes. Elle n’a pas besoin de lire tous les mots pour le savoir — la disposition sur la page suffit. Elle identifie les champs qui comptent : dans cette facture, le nombre en bas à droite est le total, celui en haut est un numéro de commande, la date près du tampon est l’échéance. Enfin elle recopie dans le registre, c’est-à-dire dans un format fixe, toujours le même, où chaque colonne a un sens.

C’est très exactement ce que fait un système de parsing sur vos documents. Il déchiffre les caractères, reconnaît la mise en page, identifie les éléments logiques (titre, paragraphe, tableau, note de bas de page, champ de formulaire), et produit une sortie normalisée. Sans cette étape, un modèle de langage ne reçoit pas un document : il reçoit une bouillie de caractères où la colonne de gauche et la colonne de droite se sont mélangées ligne par ligne.

Et le courrier va dans les deux sens. Quand le service répond, il ne rédige pas une lettre libre : il remplit un formulaire normalisé, parce que le destinataire, lui aussi, devra le traiter mécaniquement. C’est le second visage du parsing, celui qu’on oublie toujours : un modèle de langage ne produit que du texte. Quand votre application attend un montant, une date ou un appel d’outil, il faut relire cette réponse et en extraire une structure valide. Un modèle qui écrit « le total est d’environ 1 240 euros, je crois » a peut-être raison ; il est inutilisable tel quel. C’est ce travail-là qui rend possibles les appels d’outils via MCP et, plus largement, tout le harnais qui entoure le modèle.

Les limites de cette image

La personne du service courrier sait quand elle ne sait pas. Devant une écriture illisible, elle laisse la case vide et va demander. Un parseur automatique, lui, produit toujours quelque chose : c’est sa nature. Et notre employée comprend ce qu’elle recopie, alors qu’un parseur manipule des formes sans en saisir le sens. L’analogie décrit bien le geste, pas le doute.

Où se situe le parsing dans la chaîne

1. À l’entrée — du document au texte structuré Document brut PDF, scan, page web PARSING déchiffrer, reconnaître la mise en page Texte structuré titres, tableaux, champs Chunks, vecteurs puis RAG 2. À la sortie — du texte à l’action Réponse du modèle du texte, rien de plus PARSING DE SORTIE schéma imposé, format vérifié Structure validée champs, arguments Action outil, base, application Le parsing est la charnière : sans lui, ni RAG à l’entrée, ni agent à la sortie.

Déconstruction : le courrier, étape par étape

Composant technique Dans notre analogie En réalité
Reconnaissance de caractères (OCR) Déchiffrer une photocopie pâle ou une écriture penchée Transformer des pixels en caractères. Nécessaire pour les scans, inutile pour un PDF déjà textuel.
Analyse de mise en page Voir d’un coup d’œil que c’est une facture, pas une lettre Repérer les zones de la page et leur rôle : colonnes, en-têtes, cellules, marges. C’est ici que se joue la lecture correcte d’un document à deux colonnes.
Extraction de la structure logique Savoir que le nombre en bas à droite est le total Rattacher chaque fragment à un rôle : titre, section, ligne de tableau, note. Le sens vient de la position autant que des mots.
Normalisation Recopier dans le registre, toujours les mêmes colonnes Produire une sortie au format attendu (Markdown, JSON, table), quelle que soit la forme du document d’origine.
Parsing de sortie Répondre sur formulaire, pas en lettre libre Contraindre et vérifier la réponse du modèle pour qu’elle soit directement exploitable par un programme.

Token, chunk, parsing : trois découpages qu’on confond

Notion Ce qu’elle découpe À quel moment
Parsing La forme du document, en éléments qui ont un rôle En tout premier, sur le fichier brut
Chunking Le texte déjà propre, en morceaux de taille utile Après le parsing, avant la vectorisation
Tokenisation Les mots eux-mêmes, en fragments statistiques À l’entrée du modèle, automatiquement

Pour approfondir : les tokens, le chunking et la vectorisation.

Ce que ça change pour vous

  1. Votre projet documentaire échouera d’abord au parsing. Quand un assistant interne répond mal, le réflexe est de changer de modèle ou de retoucher le prompt. Regardez plutôt ce qui a été réellement extrait de vos documents. Très souvent, le fichier a été aplati en une suite de caractères où l’ordre de lecture est faux — et aucun modèle ne rattrape cela. Le RAG et les bases vectorielles supposent tous les deux que cette étape a été bien faite.
  2. Les tableaux sont le point de rupture. Contrats, rapports financiers, bilans QSE, catalogues produits : tout ce qui compte dans une entreprise vit dans des tableaux, et c’est précisément ce que le parsing rate le plus souvent. Avant de lancer un projet, testez la chaîne sur vos trois documents les plus laids, pas sur le plus propre.
  3. Deux familles d’outils, deux logiques de coût. Les bibliothèques classiques lisent le fichier de façon déterministe : rapides, prévisibles, peu chères, mais démunies devant une mise en page complexe. Les modèles qui « regardent » la page comme une image font bien mieux sur les documents difficiles, coûtent nettement plus cher et raisonnent par reconnaissance visuelle. Le choix est budgétaire autant que technique.
  4. Un parseur peut inventer. Dès qu’un modèle génératif fait le travail d’extraction, il peut compléter une cellule illisible par ce qui lui semble plausible — c’est le même mécanisme que l’hallucination. D’où l’intérêt d’un contrôle sur échantillon, d’un point de reprise humain sur les documents sensibles, et d’une trace de ce qui a été extrait — une exigence qui rejoint directement les obligations de documentation prévues par l’AI Act.
  5. Côté sortie, exigez un format. Si vous branchez un modèle sur un outil métier, ne lui demandez pas une belle phrase : demandez une structure, et vérifiez-la avant de l’utiliser. C’est ce qui distingue une démonstration réussie d’un système qui tient en production.

FAQ

Le parsing, ce n’est pas juste du copier-coller ?▼
Non, et l’expérience du copier-coller le montre bien : copiez un tableau de PDF dans un traitement de texte, vous obtenez une colonne de chiffres sans lien avec leurs libellés. Le copier-coller récupère les caractères. Le parsing récupère en plus les relations entre eux — quel chiffre appartient à quelle ligne, quelle ligne à quelle section.
Quelle différence entre OCR et parsing ?▼
L’OCR transforme une image de texte en caractères : c’est déchiffrer. Le parsing organise ces caractères en structure : c’est comprendre la forme du document. L’OCR est souvent une étape du parsing, jamais l’inverse. Un PDF natif n’a pas besoin d’OCR, mais il a toujours besoin de parsing.
Pourquoi mon PDF donne n’importe quoi dans un chatbot ?▼
Parce que le PDF est un format d’impression : il décrit où poser chaque caractère sur la page, pas ce que ce caractère signifie. La notion de « paragraphe » ou de « cellule » n’y existe pas vraiment. Tout outil qui lit un PDF doit donc reconstituer une structure qui n’a jamais été enregistrée. Sur une mise en page simple, cela marche bien ; sur deux colonnes ou un tableau fusionné, cela se dégrade vite.
Un parseur peut-il se tromper sans le dire ?▼
Oui, et c’est son défaut le plus gênant. Une extraction ratée ne produit pas un message d’erreur : elle produit un texte qui a l’air correct. Un montant rattaché à la mauvaise ligne reste un montant plausible. C’est pourquoi on contrôle un parsing sur un échantillon relu à la main, avant d’industrialiser.
Faut-il savoir coder pour s’en occuper ?▼
Non pour le comprendre et l’arbitrer, oui pour le mettre en œuvre finement. Un manager n’a pas à choisir l’outil, mais il doit savoir poser la bonne question à son prestataire : sur quels documents la chaîne a-t-elle été testée, comment mesure-t-on la qualité de l’extraction, et que se passe-t-il quand elle échoue.

Les deux articles fondateurs

1. Lire la page, pas seulement les mots — LayoutLM (2020)

Publié à la conférence KDD en 2020 par une équipe de Microsoft Research Asia, ce travail part d’un constat simple : les modèles de langage de l’époque traitaient les documents comme du texte pur, en ignorant leur mise en page.

L’idée centrale : apprendre en même temps les mots et leur position sur la page. Dans notre analogie, c’est le moment où l’employé cesse de lire l’enveloppe mot à mot et reconnaît une facture à sa disposition. La position d’un nombre devient une information au même titre que le nombre lui-même.

Ce que ça a changé : l’extraction d’information dans les formulaires, factures et documents scannés est devenue un problème d’apprentissage plutôt qu’un empilement de règles manuelles. Toute une famille de modèles de compréhension documentaire en descend.

✅ Xu, Y., Li, M., Cui, L., Huang, S., Wei, F., & Zhou, M. (2020). LayoutLM: Pre-training of text and layout for document image understanding. Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, 1192–1200. https://doi.org/10.1145/3394486.3403172

2. Parser pendant que le modèle écrit — PICARD (2021)

Présenté à la conférence EMNLP en 2021, ce travail s’attaque au problème inverse : un modèle à qui l’on demande de produire une requête de base de données produit souvent du texte qui ressemble à du code valide, mais ne l’est pas.

L’idée centrale : au lieu de laisser le modèle écrire puis de vérifier après coup, on analyse sa production au fur et à mesure et on écarte, à chaque étape, les continuations qui rendraient le résultat invalide. Dans notre analogie, c’est un formulaire qui refuse d’avancer tant que la case précédente n’est pas correctement remplie.

Ce que ça a changé : le parsing a cessé d’être une étape qui vient après la génération pour devenir une contrainte pendant la génération. C’est le principe qui sous-tend aujourd’hui les sorties structurées et les appels d’outils fiables des agents.

✅ Scholak, T., Schucher, N., & Bahdanau, D. (2021). PICARD: Parsing incrementally for constrained auto-regressive decoding from language models. Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, 9895–9901. https://doi.org/10.18653/v1/2021.emnlp-main.779

Trois prompts pour apprendre

Explique-moi ce qu’est le parsing d’un document avec l’image du dépouillement du courrier. Puis dis-moi précisément où cette image cesse d’être juste.

🎯 Objectif : explorer | 📚 Ce qu’on apprend : à distinguer ce qu’une analogie explique de ce qu’elle masque.

Voici ma définition du parsing : [écrivez la vôtre en deux phrases]. Corrige-la, puis pose-moi trois questions pour vérifier que j’ai vraiment compris.

🎯 Objectif : tester sa compréhension | 📚 Ce qu’on apprend : la différence entre reconnaître un mot et savoir l’expliquer.

Je te colle un extrait de document copié en vrac. Reconstitue-le en tableau propre, puis liste les informations que tu n’as PAS pu retrouver avec certitude.

🎯 Objectif : cas pratique management | 📚 Ce qu’on apprend : à voir en direct ce qu’une extraction perd — et à exiger que l’incertitude soit déclarée.

Note méthodologique

Cet article a été rédigé avec l’assistance d’une IA générative, sur la base d’un gabarit pédagogique conçu par l’auteure. Les deux références académiques citées ont été vérifiées une à une dans leurs actes de publication respectifs (ACM Digital Library et ACL Anthology). L’image d’illustration a été générée par IA.

Suivre le blog

Sans newsletter qui monétise vos données.

📡 RSS 📖 WP LinkedIn → S’abonner

En savoir plus sur Maria Mercanti-Guérin

Abonnez-vous pour poursuivre la lecture et avoir accès à l’ensemble des archives.

Poursuivre la lecture