Imaginez une bibliothèque où les livres ne seraient pas rangés par ordre alphabétique, mais par ressemblance de sens : tous les ouvrages sur la cuisine côte à côte, ceux sur le sport dans un autre coin, et si vous cherchez « plat végétarien rapide », le bibliothécaire vous emmène directement vers l’étagère la plus proche de votre idée — même si aucun livre ne porte ces mots exacts. C’est très précisément ce que fait une base de données vectorielle.
Définition : la même idée, à trois hauteurs
C’est une base qui range les informations selon leur sens, pas selon leurs mots. On peut alors retrouver ce qui « veut dire la même chose », même sans les mots-clés exacts.
Elle stocke des vecteurs (des traductions numériques du sens) et retrouve les plus proches d’une requête. C’est le moteur de la recherche sémantique et des assistants qui interrogent vos documents.
Elle indexe des plongements (embeddings) dans un espace de haute dimension et répond aux requêtes par recherche des plus proches voisins, souvent approximative (ANN) via un index de graphe navigable, pour une complexité sous-linéaire.
L’analogie-maîtresse : la bibliothèque rangée par ressemblance de sens
Dans une bibliothèque classique, ranger par ordre alphabétique est pratique pour retrouver un titre connu — mais inutile si vous cherchez « une idée ». Notre bibliothèque idéale range autrement : chaque livre reçoit une adresse dans un espace du sens, et deux ouvrages qui parlent de choses proches se retrouvent voisins de rayon.
Cette « adresse », en IA, c’est un vecteur : une liste de nombres qui résume le sens d’un texte. C’est tout l’objet de la vectorisation : « voiture » et « automobile » obtiennent des vecteurs très proches, « voiture » et « banane » des vecteurs très éloignés. La base vectorielle stocke toutes ces adresses.
Chercher revient alors à demander : « quels sont les plus proches voisins de ma requête ? » On transforme la question en vecteur, puis on récupère les documents dont l’adresse est la plus proche. Le mot-clé exact ne compte plus — c’est la proximité de sens qui décide. Pour que ce soit rapide sur des millions d’entrées, on ne compare pas tout à tout : un index organise l’espace pour naviguer vers les bons rayons en quelques sauts (c’est le rôle d’algorithmes comme HNSW, cités plus bas).
C’est ce mécanisme qui alimente le RAG : avant de répondre, l’assistant va chercher dans la base les passages les plus pertinents et les glisse dans sa fenêtre de contexte. En ancrant la réponse sur des documents réels, on réduit d’ailleurs les hallucinations.
Là où l’analogie s’arrête. Nos rayons de bibliothèque ont deux ou trois dimensions ; l’espace du sens en compte des centaines, impossibles à visualiser. La « proximité » y est une distance mathématique, pas une intuition humaine. Et la recherche est souvent approximative : pour aller vite, on accepte de rater parfois le tout meilleur voisin. Enfin, la qualité dépend entièrement du modèle qui fabrique les adresses : un mauvais plongement range mal, et aucune base n’y remédie.
L’espace du sens, en un schéma
Déconstruction : de la bibliothèque au moteur
| Notion technique | Dans notre analogie | En réalité, sans jargon |
|---|---|---|
| Vecteur (embedding) | L’adresse d’un livre dans l’espace du sens | Une liste de nombres qui résume le sens d’un texte |
| Base vectorielle | La bibliothèque rangée par sens | Le magasin qui stocke et interroge tous ces vecteurs |
| Plus proches voisins | Les livres du même rayon | Les documents dont le sens est le plus proche de la requête |
| Index (ex. HNSW) | Le plan qui mène vite au bon rayon | La structure qui évite de tout comparer un à un |
| Recherche approximative | Aller vite, quitte à rater parfois le meilleur | Un compromis assumé entre vitesse et précision |
Ce que ça change pour vous
- On cherche par sens, pas par mot exact. Taper « voiture » peut ramener des documents parlant d’« automobile » ou de « véhicule ». C’est l’atout majeur face à une recherche par mots-clés.
- C’est le socle des assistants sur vos documents. Derrière « pose une question à ma base de connaissances » se cache presque toujours une base vectorielle qui alimente le RAG.
- La qualité des « adresses » est décisive. Le modèle d’embedding compte autant que la base : un bon rangement dépend d’un bon plongement. À choisir selon votre langue et votre domaine.
- Ce n’est pas une base classique. Une base SQL excelle pour les correspondances exactes et les filtres ; la base vectorielle, pour la proximité de sens. On les combine souvent plutôt qu’on ne les oppose.
FAQ pour débuter
Les deux articles fondateurs
1. Mikolov et al. — le sens comme vecteur : word2vec (2013)
Contexte. Comment représenter le sens d’un mot pour qu’une machine puisse mesurer que deux mots « se ressemblent » ?
Idée centrale. Apprendre pour chaque mot un vecteur tel que les mots de sens proche aient des vecteurs proches — la ressemblance de sens devient une distance calculable.
Pourquoi ça compte. C’est le socle des plongements : sans « adresses dans l’espace du sens », une base vectorielle n’aurait rien à ranger.
✅ Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. ICLR 2013 (Workshop). (arXiv:1301.3781)
2. Malkov & Yashunin — retrouver vite les voisins : HNSW (2018)
Contexte. Comparer une requête à des millions de vecteurs un par un est trop lent. Comment trouver les plus proches voisins sans tout parcourir ?
Idée centrale. Un graphe hiérarchique de voisinage (Hierarchical Navigable Small World) qui permet de « sauter » vers les bons rayons en un temps quasi logarithmique.
Pourquoi ça compte. C’est l’algorithme d’indexation au cœur de la plupart des bases vectorielles modernes — ce qui rend la recherche par sens praticable à grande échelle.
✅ Malkov, Y. A., & Yashunin, D. A. (2018). Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs. IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(4), 824–836. (arXiv:1603.09320)
Trois prompts pour apprendre
Explique-moi la différence entre chercher par mot-clé et chercher par proximité de sens, avec un exemple où les deux ne donnent pas le même résultat.
🎯 Comprendre | 📚 Ce qu’on apprend : saisir l’atout de la recherche sémantique.
Je veux un assistant qui répond à partir de mes documents. Explique-moi, étape par étape, où intervient une base vectorielle.
🎯 Relier au RAG | 📚 Ce qu’on apprend : situer la base dans une chaîne concrète.
Pourquoi la recherche « approximative » est-elle souvent préférée à la recherche exacte ? Donne le compromis en une phrase simple.
🎯 Esprit critique | 📚 Ce qu’on apprend : comprendre le compromis vitesse/précision.
📝 Note méthodologique. Cet article a été rédigé avec l’aide d’une IA générative, sur la base d’un gabarit pédagogique et d’analogies conçus par l’autrice. Les deux références fondatrices ont été vérifiées manuellement. L’image d’illustration a été générée par IA. L’objectif reste pédagogique : rendre un concept technique accessible aux étudiants et cadres en management.





















