Les bases de données vectorielles, la bibliothèque rangée par ressemblance de sens, pas par ordre alphabétique

Imaginez une bibliothèque où les livres ne seraient pas rangés par ordre alphabétique, mais par ressemblance de sens : tous les ouvrages sur la cuisine côte à côte, ceux sur le sport dans un autre coin, et si vous cherchez « plat végétarien rapide », le bibliothécaire vous emmène directement vers l’étagère la plus proche de votre idée — même si aucun livre ne porte ces mots exacts. C’est très précisément ce que fait une base de données vectorielle.

Définition : la même idée, à trois hauteurs

Niveau 1 — Tout public

C’est une base qui range les informations selon leur sens, pas selon leurs mots. On peut alors retrouver ce qui « veut dire la même chose », même sans les mots-clés exacts.

Niveau 2 — Manager / décideur

Elle stocke des vecteurs (des traductions numériques du sens) et retrouve les plus proches d’une requête. C’est le moteur de la recherche sémantique et des assistants qui interrogent vos documents.

Niveau 3 — Définition académique

Elle indexe des plongements (embeddings) dans un espace de haute dimension et répond aux requêtes par recherche des plus proches voisins, souvent approximative (ANN) via un index de graphe navigable, pour une complexité sous-linéaire.

L’analogie-maîtresse : la bibliothèque rangée par ressemblance de sens

Dans une bibliothèque classique, ranger par ordre alphabétique est pratique pour retrouver un titre connu — mais inutile si vous cherchez « une idée ». Notre bibliothèque idéale range autrement : chaque livre reçoit une adresse dans un espace du sens, et deux ouvrages qui parlent de choses proches se retrouvent voisins de rayon.

Cette « adresse », en IA, c’est un vecteur : une liste de nombres qui résume le sens d’un texte. C’est tout l’objet de la vectorisation : « voiture » et « automobile » obtiennent des vecteurs très proches, « voiture » et « banane » des vecteurs très éloignés. La base vectorielle stocke toutes ces adresses.

Chercher revient alors à demander : « quels sont les plus proches voisins de ma requête ? » On transforme la question en vecteur, puis on récupère les documents dont l’adresse est la plus proche. Le mot-clé exact ne compte plus — c’est la proximité de sens qui décide. Pour que ce soit rapide sur des millions d’entrées, on ne compare pas tout à tout : un index organise l’espace pour naviguer vers les bons rayons en quelques sauts (c’est le rôle d’algorithmes comme HNSW, cités plus bas).

C’est ce mécanisme qui alimente le RAG : avant de répondre, l’assistant va chercher dans la base les passages les plus pertinents et les glisse dans sa fenêtre de contexte. En ancrant la réponse sur des documents réels, on réduit d’ailleurs les hallucinations.

Là où l’analogie s’arrête. Nos rayons de bibliothèque ont deux ou trois dimensions ; l’espace du sens en compte des centaines, impossibles à visualiser. La « proximité » y est une distance mathématique, pas une intuition humaine. Et la recherche est souvent approximative : pour aller vite, on accepte de rater parfois le tout meilleur voisin. Enfin, la qualité dépend entièrement du modèle qui fabrique les adresses : un mauvais plongement range mal, et aucune base n’y remédie.

L’espace du sens, en un schéma

L’espace du sens (schématisé en 2D) amas « cuisine » amas « finance » amas « sport » requête « plat végétarien rapide » → 3 plus proches voisins (cercle) Rangé par proximité de sens — l’ordre alphabétique n’a aucun rôle ici.

Déconstruction : de la bibliothèque au moteur

Notion technique Dans notre analogie En réalité, sans jargon
Vecteur (embedding) L’adresse d’un livre dans l’espace du sens Une liste de nombres qui résume le sens d’un texte
Base vectorielle La bibliothèque rangée par sens Le magasin qui stocke et interroge tous ces vecteurs
Plus proches voisins Les livres du même rayon Les documents dont le sens est le plus proche de la requête
Index (ex. HNSW) Le plan qui mène vite au bon rayon La structure qui évite de tout comparer un à un
Recherche approximative Aller vite, quitte à rater parfois le meilleur Un compromis assumé entre vitesse et précision

Ce que ça change pour vous

  • On cherche par sens, pas par mot exact. Taper « voiture » peut ramener des documents parlant d’« automobile » ou de « véhicule ». C’est l’atout majeur face à une recherche par mots-clés.
  • C’est le socle des assistants sur vos documents. Derrière « pose une question à ma base de connaissances » se cache presque toujours une base vectorielle qui alimente le RAG.
  • La qualité des « adresses » est décisive. Le modèle d’embedding compte autant que la base : un bon rangement dépend d’un bon plongement. À choisir selon votre langue et votre domaine.
  • Ce n’est pas une base classique. Une base SQL excelle pour les correspondances exactes et les filtres ; la base vectorielle, pour la proximité de sens. On les combine souvent plutôt qu’on ne les oppose.

FAQ pour débuter

En quoi est-ce différent d’une base de données classique ?
Une base classique cherche des correspondances exactes (« trouve la ligne où nom = Dupont »). Une base vectorielle cherche la proximité de sens (« trouve ce qui ressemble à cette idée »). Deux logiques complémentaires.
Comment « range-t-on par sens » concrètement ?
Un modèle transforme chaque texte en vecteur (son adresse dans l’espace du sens), puis un index organise ces adresses pour retrouver vite les plus proches d’une requête, elle aussi transformée en vecteur.
La recherche est-elle exacte ?
Souvent non, et c’est voulu : sur de gros volumes, on utilise une recherche approximative qui va beaucoup plus vite en acceptant de manquer, de temps en temps, le tout meilleur voisin. Un curseur vitesse/précision se règle.
À quoi ça sert concrètement ?
Recherche sémantique, assistants qui répondent à partir de vos documents (RAG), recommandation, détection de doublons ou de contenus proches. Partout où « ce qui se ressemble » compte plus que « le mot exact ».

Les deux articles fondateurs

1. Mikolov et al. — le sens comme vecteur : word2vec (2013)

Contexte. Comment représenter le sens d’un mot pour qu’une machine puisse mesurer que deux mots « se ressemblent » ?

Idée centrale. Apprendre pour chaque mot un vecteur tel que les mots de sens proche aient des vecteurs proches — la ressemblance de sens devient une distance calculable.

Pourquoi ça compte. C’est le socle des plongements : sans « adresses dans l’espace du sens », une base vectorielle n’aurait rien à ranger.

✅ Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. ICLR 2013 (Workshop). (arXiv:1301.3781)

2. Malkov & Yashunin — retrouver vite les voisins : HNSW (2018)

Contexte. Comparer une requête à des millions de vecteurs un par un est trop lent. Comment trouver les plus proches voisins sans tout parcourir ?

Idée centrale. Un graphe hiérarchique de voisinage (Hierarchical Navigable Small World) qui permet de « sauter » vers les bons rayons en un temps quasi logarithmique.

Pourquoi ça compte. C’est l’algorithme d’indexation au cœur de la plupart des bases vectorielles modernes — ce qui rend la recherche par sens praticable à grande échelle.

✅ Malkov, Y. A., & Yashunin, D. A. (2018). Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs. IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(4), 824–836. (arXiv:1603.09320)

Trois prompts pour apprendre

Explique-moi la différence entre chercher par mot-clé et chercher par proximité de sens, avec un exemple où les deux ne donnent pas le même résultat.

🎯 Comprendre | 📚 Ce qu’on apprend : saisir l’atout de la recherche sémantique.

Je veux un assistant qui répond à partir de mes documents. Explique-moi, étape par étape, où intervient une base vectorielle.

🎯 Relier au RAG | 📚 Ce qu’on apprend : situer la base dans une chaîne concrète.

Pourquoi la recherche « approximative » est-elle souvent préférée à la recherche exacte ? Donne le compromis en une phrase simple.

🎯 Esprit critique | 📚 Ce qu’on apprend : comprendre le compromis vitesse/précision.

📝 Note méthodologique. Cet article a été rédigé avec l’aide d’une IA générative, sur la base d’un gabarit pédagogique et d’analogies conçus par l’autrice. Les deux références fondatrices ont été vérifiées manuellement. L’image d’illustration a été générée par IA. L’objectif reste pédagogique : rendre un concept technique accessible aux étudiants et cadres en management.

Suivre le blog

Sans newsletter qui monétise vos données.

📡 RSS 📖 WP LinkedIn → S’abonner

En savoir plus sur Maria Mercanti-Guérin

Abonnez-vous pour poursuivre la lecture et avoir accès à l’ensemble des archives.

Poursuivre la lecture