Huit heures trente, service courrier. Une pile d’enveloppes de tailles différentes : des factures, deux prospectus, une lettre manuscrite, un relevé plié en trois. Quelqu’un ouvre, écarte, repère, recopie un montant et une échéance dans le registre. Vingt minutes plus tard, la pile informe est devenue quinze lignes de tableau. Personne n’a produit une seule information nouvelle : tout était déjà là, mais dans une forme inutilisable.
Cette opération banale porte un nom en informatique : le parsing. C’est la brique la plus ignorée de toute la chaîne de l’IA, et celle qui fait échouer le plus de projets.
Le parsing en trois définitions
Parser, c’est ouvrir le courrier : prendre quelque chose qui arrive en vrac et ranger chaque information dans la bonne case.
Le parsing transforme un document conçu pour un œil humain (un PDF, un contrat, une page web) en données qu’un programme peut trier, filtrer et calculer. C’est l’étape qui sépare « j’ai un document » de « j’ai de l’information ».
Analyse d’une suite de symboles au regard d’une structure attendue — grammaire, schéma de données, mise en page — afin d’en produire une représentation explicite et manipulable par la machine.
L’analogie-maîtresse : le dépouillement du courrier
Reprenons notre service courrier. La personne qui dépouille fait quatre choses, dans cet ordre, sans jamais y penser.
Elle ouvre et déchiffre : sortir la feuille de l’enveloppe, lire ce qui est imprimé, y compris quand c’est une photocopie de travers ou une écriture manuscrite. Elle reconnaît la forme : ceci est une facture, cela un courrier commercial, ceci encore un tableau à trois colonnes. Elle n’a pas besoin de lire tous les mots pour le savoir — la disposition sur la page suffit. Elle identifie les champs qui comptent : dans cette facture, le nombre en bas à droite est le total, celui en haut est un numéro de commande, la date près du tampon est l’échéance. Enfin elle recopie dans le registre, c’est-à-dire dans un format fixe, toujours le même, où chaque colonne a un sens.
C’est très exactement ce que fait un système de parsing sur vos documents. Il déchiffre les caractères, reconnaît la mise en page, identifie les éléments logiques (titre, paragraphe, tableau, note de bas de page, champ de formulaire), et produit une sortie normalisée. Sans cette étape, un modèle de langage ne reçoit pas un document : il reçoit une bouillie de caractères où la colonne de gauche et la colonne de droite se sont mélangées ligne par ligne.
Et le courrier va dans les deux sens. Quand le service répond, il ne rédige pas une lettre libre : il remplit un formulaire normalisé, parce que le destinataire, lui aussi, devra le traiter mécaniquement. C’est le second visage du parsing, celui qu’on oublie toujours : un modèle de langage ne produit que du texte. Quand votre application attend un montant, une date ou un appel d’outil, il faut relire cette réponse et en extraire une structure valide. Un modèle qui écrit « le total est d’environ 1 240 euros, je crois » a peut-être raison ; il est inutilisable tel quel. C’est ce travail-là qui rend possibles les appels d’outils via MCP et, plus largement, tout le harnais qui entoure le modèle.
Les limites de cette image
La personne du service courrier sait quand elle ne sait pas. Devant une écriture illisible, elle laisse la case vide et va demander. Un parseur automatique, lui, produit toujours quelque chose : c’est sa nature. Et notre employée comprend ce qu’elle recopie, alors qu’un parseur manipule des formes sans en saisir le sens. L’analogie décrit bien le geste, pas le doute.
Où se situe le parsing dans la chaîne
Déconstruction : le courrier, étape par étape
| Composant technique | Dans notre analogie | En réalité |
|---|---|---|
| Reconnaissance de caractères (OCR) | Déchiffrer une photocopie pâle ou une écriture penchée | Transformer des pixels en caractères. Nécessaire pour les scans, inutile pour un PDF déjà textuel. |
| Analyse de mise en page | Voir d’un coup d’œil que c’est une facture, pas une lettre | Repérer les zones de la page et leur rôle : colonnes, en-têtes, cellules, marges. C’est ici que se joue la lecture correcte d’un document à deux colonnes. |
| Extraction de la structure logique | Savoir que le nombre en bas à droite est le total | Rattacher chaque fragment à un rôle : titre, section, ligne de tableau, note. Le sens vient de la position autant que des mots. |
| Normalisation | Recopier dans le registre, toujours les mêmes colonnes | Produire une sortie au format attendu (Markdown, JSON, table), quelle que soit la forme du document d’origine. |
| Parsing de sortie | Répondre sur formulaire, pas en lettre libre | Contraindre et vérifier la réponse du modèle pour qu’elle soit directement exploitable par un programme. |
Token, chunk, parsing : trois découpages qu’on confond
| Notion | Ce qu’elle découpe | À quel moment |
|---|---|---|
| Parsing | La forme du document, en éléments qui ont un rôle | En tout premier, sur le fichier brut |
| Chunking | Le texte déjà propre, en morceaux de taille utile | Après le parsing, avant la vectorisation |
| Tokenisation | Les mots eux-mêmes, en fragments statistiques | À l’entrée du modèle, automatiquement |
Pour approfondir : les tokens, le chunking et la vectorisation.
Ce que ça change pour vous
- Votre projet documentaire échouera d’abord au parsing. Quand un assistant interne répond mal, le réflexe est de changer de modèle ou de retoucher le prompt. Regardez plutôt ce qui a été réellement extrait de vos documents. Très souvent, le fichier a été aplati en une suite de caractères où l’ordre de lecture est faux — et aucun modèle ne rattrape cela. Le RAG et les bases vectorielles supposent tous les deux que cette étape a été bien faite.
- Les tableaux sont le point de rupture. Contrats, rapports financiers, bilans QSE, catalogues produits : tout ce qui compte dans une entreprise vit dans des tableaux, et c’est précisément ce que le parsing rate le plus souvent. Avant de lancer un projet, testez la chaîne sur vos trois documents les plus laids, pas sur le plus propre.
- Deux familles d’outils, deux logiques de coût. Les bibliothèques classiques lisent le fichier de façon déterministe : rapides, prévisibles, peu chères, mais démunies devant une mise en page complexe. Les modèles qui « regardent » la page comme une image font bien mieux sur les documents difficiles, coûtent nettement plus cher et raisonnent par reconnaissance visuelle. Le choix est budgétaire autant que technique.
- Un parseur peut inventer. Dès qu’un modèle génératif fait le travail d’extraction, il peut compléter une cellule illisible par ce qui lui semble plausible — c’est le même mécanisme que l’hallucination. D’où l’intérêt d’un contrôle sur échantillon, d’un point de reprise humain sur les documents sensibles, et d’une trace de ce qui a été extrait — une exigence qui rejoint directement les obligations de documentation prévues par l’AI Act.
- Côté sortie, exigez un format. Si vous branchez un modèle sur un outil métier, ne lui demandez pas une belle phrase : demandez une structure, et vérifiez-la avant de l’utiliser. C’est ce qui distingue une démonstration réussie d’un système qui tient en production.
FAQ
Les deux articles fondateurs
1. Lire la page, pas seulement les mots — LayoutLM (2020)
Publié à la conférence KDD en 2020 par une équipe de Microsoft Research Asia, ce travail part d’un constat simple : les modèles de langage de l’époque traitaient les documents comme du texte pur, en ignorant leur mise en page.
L’idée centrale : apprendre en même temps les mots et leur position sur la page. Dans notre analogie, c’est le moment où l’employé cesse de lire l’enveloppe mot à mot et reconnaît une facture à sa disposition. La position d’un nombre devient une information au même titre que le nombre lui-même.
Ce que ça a changé : l’extraction d’information dans les formulaires, factures et documents scannés est devenue un problème d’apprentissage plutôt qu’un empilement de règles manuelles. Toute une famille de modèles de compréhension documentaire en descend.
✅ Xu, Y., Li, M., Cui, L., Huang, S., Wei, F., & Zhou, M. (2020). LayoutLM: Pre-training of text and layout for document image understanding. Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, 1192–1200. https://doi.org/10.1145/3394486.3403172
2. Parser pendant que le modèle écrit — PICARD (2021)
Présenté à la conférence EMNLP en 2021, ce travail s’attaque au problème inverse : un modèle à qui l’on demande de produire une requête de base de données produit souvent du texte qui ressemble à du code valide, mais ne l’est pas.
L’idée centrale : au lieu de laisser le modèle écrire puis de vérifier après coup, on analyse sa production au fur et à mesure et on écarte, à chaque étape, les continuations qui rendraient le résultat invalide. Dans notre analogie, c’est un formulaire qui refuse d’avancer tant que la case précédente n’est pas correctement remplie.
Ce que ça a changé : le parsing a cessé d’être une étape qui vient après la génération pour devenir une contrainte pendant la génération. C’est le principe qui sous-tend aujourd’hui les sorties structurées et les appels d’outils fiables des agents.
✅ Scholak, T., Schucher, N., & Bahdanau, D. (2021). PICARD: Parsing incrementally for constrained auto-regressive decoding from language models. Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, 9895–9901. https://doi.org/10.18653/v1/2021.emnlp-main.779
Trois prompts pour apprendre
Explique-moi ce qu’est le parsing d’un document avec l’image du dépouillement du courrier. Puis dis-moi précisément où cette image cesse d’être juste.
🎯 Objectif : explorer | 📚 Ce qu’on apprend : à distinguer ce qu’une analogie explique de ce qu’elle masque.
Voici ma définition du parsing : [écrivez la vôtre en deux phrases]. Corrige-la, puis pose-moi trois questions pour vérifier que j’ai vraiment compris.
🎯 Objectif : tester sa compréhension | 📚 Ce qu’on apprend : la différence entre reconnaître un mot et savoir l’expliquer.
Je te colle un extrait de document copié en vrac. Reconstitue-le en tableau propre, puis liste les informations que tu n’as PAS pu retrouver avec certitude.
🎯 Objectif : cas pratique management | 📚 Ce qu’on apprend : à voir en direct ce qu’une extraction perd — et à exiger que l’incertitude soit déclarée.
Note méthodologique
Cet article a été rédigé avec l’assistance d’une IA générative, sur la base d’un gabarit pédagogique conçu par l’auteure. Les deux références académiques citées ont été vérifiées une à une dans leurs actes de publication respectifs (ACM Digital Library et ACL Anthology). L’image d’illustration a été générée par IA.






















