Knowledge cutoff & grounding : l’expert revenu d’une longue expédition, ignorant de l’actu

Imaginez un grand spécialiste parti trois ans en expédition, coupé de tout. À son retour, il est brillant — mais figé au jour de son départ : il ignore qui a gagné les dernières élections, le prix actuel du café, l’actualité de son propre domaine. Une IA générative est exactement cet expert : ses connaissances s’arrêtent à une date de coupure (knowledge cutoff). Et pour qu’elle parle du présent, il faut lui tendre le journal du jour : c’est le grounding.

Définition : la même idée, à trois hauteurs

Niveau 1 — Tout public

La date de coupure, c’est le moment après lequel l’IA ne sait plus rien : elle a appris jusque-là, puis plus rien. Le grounding, c’est lui fournir des documents récents pour qu’elle réponde sur l’actualité.

Niveau 2 — Manager / décideur

La connaissance interne du modèle est gelée à sa date d’entraînement. Le grounding la relie à des sources externes et actuelles (recherche web, vos documents) au moment de la question, pour des réponses à jour et sourcées.

Niveau 3 — Définition académique

La connaissance paramétrique est figée au pré-entraînement ; le grounding augmente la génération d’une mémoire non-paramétrique récupérée à l’inférence (RAG, outils), améliorant actualité, factualité et provenance.

L’analogie-maîtresse : l’expert revenu d’expédition

Notre expert a tout emmagasiné jusqu’au jour de son départ. Cette masse de savoir, il la porte en lui : c’est sa mémoire interne. Pour une IA, c’est la connaissance paramétrique — engrammée dans le modèle pendant l’entraînement, et qui s’arrête net à la date de coupure. Interrogez-le sur ce qui s’est passé après son départ, et il y a deux issues : ou bien il dit « je l’ignore », ou bien — plus embêtant — il répond avec aplomb quelque chose d’inventé. Cette seconde issue, chez une IA, porte un nom : l’hallucination.

La parade est simple : avant de le laisser répondre sur l’actualité, on lui tend un dossier de mise à jour — le journal du jour, les derniers rapports. Il lit, puis répond en s’appuyant dessus. C’est le grounding : on fournit au modèle des documents récents qu’il place dans sa fenêtre de contexte, et il ancre sa réponse sur ces sources plutôt que sur sa seule mémoire.

Concrètement, ce dossier vient soit d’une recherche web, soit d’une récupération dans vos propres documents — c’est là qu’interviennent le RAG et les bases de données vectorielles : on va chercher les passages pertinents et on les glisse sous les yeux de l’expert avant qu’il ne réponde. La recherche fondatrice parle joliment de deux mémoires : celle, figée, qu’il porte en lui, et celle, fraîche, qu’on lui apporte.

Là où l’analogie s’arrête. Notre expert sait qu’il s’est absenté : il peut prévenir « attention, je suis resté trois ans coupé du monde ». Le modèle, lui, ne connaît pas toujours de façon fiable la frontière de son propre savoir — d’où des erreurs assurées, sans avertissement. De plus, l’humain retient définitivement ce qu’il lit ; le modèle, lui, oublie tout à la fin de la conversation (sauf réentraînement). Enfin, le grounding ne vaut que ce que valent les documents fournis : un mauvais dossier, et la réponse sera fausse — mais bien sourcée.

Coupure et grounding, en un schéma

Connaissances apprises (mémoire figée) angle mort : actualité inconnue date de coupure Documents récents web / base documentaire grounding = on fournit le journal du jour Modèle expert de retour Réponse à jour ancrée sur des sources

Déconstruction : la mémoire de l’expert

Notion technique Dans notre analogie En réalité, sans jargon
Date de coupure Le jour du départ en expédition La dernière date des données d’entraînement
Connaissance paramétrique Ce que l’expert porte en tête Le savoir engrammé dans le modèle, figé
Grounding Lui tendre le journal du jour Ancrer la réponse sur des documents récents fournis
Mémoire récupérée Le dossier de mise à jour Les passages allés chercher à la volée (RAG)
Provenance Citer d’où vient l’info Les sources qui appuient la réponse

Ce que ça change pour vous

  • Une IA « de base » ignore l’actualité récente. Avant de lui faire confiance sur un fait récent, demandez-vous — et demandez-lui — sa date de coupure.
  • Pour du récent ou du précis, exigez du grounding. Privilégiez les outils qui cherchent des sources (web, vos documents) et qui citent leur provenance, plutôt que la réponse « de mémoire ».
  • Sans grounding, le risque d’invention grimpe. Sur l’actualité, une IA non connectée comblera volontiers les vides. Le grounding est votre meilleur garde-fou anti-hallucination.
  • Le grounding ne fait pas de miracle. Il ne vaut que ce que valent les documents fournis : sources datées, fiables et pertinentes restent votre responsabilité.

FAQ pour débuter

C’est quoi, la date de coupure ?
La dernière date jusqu’à laquelle le modèle a été entraîné. Au-delà, il n’a « rien lu ». Deux modèles différents ont des dates différentes ; c’est une information à vérifier.
Pourquoi l’IA invente-t-elle sur l’actualité ?
Parce qu’elle ne connaît pas toujours la limite de son savoir et tend à produire une réponse plausible même sans information. Comme l’expert qui, gêné d’avouer son ignorance, brode.
Grounding, c’est juste une connexion internet ?
Souvent une recherche web, oui — mais pas seulement. Cela peut aussi être la récupération dans vos propres documents (RAG, base vectorielle). L’idée commune : fournir au modèle des sources à jour au moment de répondre.
Comment savoir si une réponse est à jour ?
Demandez les sources et leur date. Un outil qui cite des références récentes est plus fiable qu’une réponse sans provenance. En cas de doute sur un fait récent, recoupez.

Les deux articles fondateurs

1. Petroni et al. — la mémoire figée : « Language Models as Knowledge Bases? » (2019)

Contexte. Les modèles pré-entraînés apprennent la langue, mais que retiennent-ils vraiment des faits du monde ?

Idée centrale. Ils stockent une part de connaissance factuelle directement dans leurs paramètres — une mémoire interne, apprise une fois pour toutes.

Pourquoi ça compte. C’est cette mémoire paramétrique qui explique à la fois la puissance des modèles… et leur date de coupure : ce qui n’a pas été appris n’y est pas.

✅ Petroni, F., Rocktäschel, T., Lewis, P., Bakhtin, A., Wu, Y., Miller, A. H., & Riedel, S. (2019). Language Models as Knowledge Bases? Proceedings of EMNLP-IJCNLP 2019, 2463–2473. (DOI:10.18653/v1/D19-1250)

2. Lewis et al. — le journal du jour : RAG (2020)

Contexte. La mémoire interne d’un modèle est difficile à mettre à jour et ne cite pas ses sources. Comment l’ancrer sur du concret ?

Idée centrale. Combiner deux mémoires : la mémoire paramétrique (figée) du modèle et une mémoire non-paramétrique récupérée — des documents cherchés puis fournis au moment de répondre.

Pourquoi ça compte. C’est l’acte fondateur du grounding : donner à l’expert son dossier de mise à jour, pour des réponses plus actuelles et sourcées.

✅ Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems, 33, 9459–9474. (arXiv:2005.11401)

Trois prompts pour apprendre

Quelle est ta date de coupure des connaissances ? Puis dis-moi honnêtement si tu peux répondre à une question sur un événement de cette semaine.

🎯 Tester | 📚 Ce qu’on apprend : repérer la limite temporelle du modèle.

Explique la différence entre répondre « de mémoire » et répondre « après avoir cherché des sources », avec un exemple concret.

🎯 Comprendre | 📚 Ce qu’on apprend : saisir l’apport du grounding.

Pour quels types de questions faut-il exiger des sources récentes plutôt que se fier aux connaissances internes d’une IA ? Donne 4 cas.

🎯 Esprit critique | 📚 Ce qu’on apprend : savoir quand se méfier de la mémoire figée.

📝 Note méthodologique. Cet article a été rédigé avec l’aide d’une IA générative, sur la base d’un gabarit pédagogique et d’analogies conçus par l’autrice. Les deux références fondatrices ont été vérifiées manuellement. L’image d’illustration a été générée par IA. L’objectif reste pédagogique : rendre un concept technique accessible aux étudiants et cadres en management.

Suivre le blog

Sans newsletter qui monétise vos données.

📡 RSS 📖 WP LinkedIn → S’abonner

En savoir plus sur Maria Mercanti-Guérin

Abonnez-vous pour poursuivre la lecture et avoir accès à l’ensemble des archives.

Poursuivre la lecture