Rétropropagation et descente de gradient : comment une IA apprend (l’analogie de la montagne dans le brouillard) Exercices et Prompts

Vous êtes en montagne, surpris par un brouillard épais. Impossible de voir la vallée, ni même à dix mètres. Pourtant vous voulez descendre. Que faites-vous ? Vous sentez la pente sous vos pieds et vous faites un pas dans la direction qui descend le plus. Puis un autre. Et encore un autre. Sans jamais voir l’ensemble, vous rejoignez le bas. C’est exactement ainsi qu’une IA apprend.

Définition : la même idée, à trois hauteurs

Niveau 1 — Tout public

Pour apprendre, une IA mesure son erreur, puis corrige un tout petit peu ses réglages dans le sens qui réduit cette erreur. Elle recommence des milliers de fois jusqu’à se tromper le moins possible.

Niveau 2 — Manager / décideur

La descente de gradient ajuste les poids du modèle pas à pas, dans la direction qui diminue l’erreur. La rétropropagation est la technique qui calcule, pour chaque poids, dans quel sens et de combien le corriger — en remontant l’erreur de la sortie vers l’entrée.

Niveau 3 — Définition académique

La rétropropagation applique la règle de dérivation en chaîne pour calculer le gradient de la fonction de perte par rapport à chaque paramètre ; la descente de gradient met ensuite à jour ces paramètres dans la direction opposée au gradient, pondérée par un taux d’apprentissage.

L’analogie-maîtresse : descendre la montagne dans le brouillard

Reprenons notre randonneur perdu dans le brouillard. Son objectif : atteindre le point le plus bas, la vallée. Dans notre histoire, l’altitude représente l’erreur du modèle — plus on est haut, plus l’IA se trompe. Le but de l’apprentissage, c’est de descendre le plus bas possible.

Privé de vue d’ensemble, le randonneur n’a qu’une information locale : la pente sous ses pieds. Cette pente, c’est le gradient. Elle lui dit dans quelle direction le sol descend le plus fort. Il fait alors un pas dans cette direction, réévalue la pente à son nouvel emplacement, refait un pas, et ainsi de suite. Pas après pas, il perd de l’altitude. C’est la descente de gradient : avancer vers le bas en se fiant uniquement à la pente locale.

La taille de ses pas a son importance. Des pas minuscules : il descend, mais avec une lenteur décourageante. Des pas de géant : il risque d’enjamber la vallée et de remonter sur le versant d’en face. Ce réglage de la longueur du pas porte un nom : le taux d’apprentissage. Tout l’art consiste à le choisir ni trop petit, ni trop grand.

Reste une question : dans un réseau qui empile des milliers de neurones sur de nombreuses couches (layers), comment savoir quel poids de quel neurone a contribué à l’erreur, et dans quel sens le corriger ? C’est là qu’intervient la rétropropagation. Imaginez une chaîne de randonneurs encordés : celui de tête constate l’écart à l’arrivée, puis transmet l’information à celui juste derrière, qui la transmet au suivant, et ainsi jusqu’au départ. Chacun apprend ainsi sa part de responsabilité dans l’erreur. Techniquement, le modèle part de l’erreur finale et la « remonte » couche par couche, de la sortie vers l’entrée, pour attribuer à chaque poids sa correction.

Rétropropagation et descente de gradient forment donc un duo : la première dit dans quel sens corriger chaque poids, la seconde applique la correction d’un petit pas. Répété sur d’innombrables exemples, ce cycle est, très concrètement, ce qu’on appelle « entraîner » un modèle.

Là où l’analogie s’arrête. Notre randonneur évolue sur un paysage à deux dimensions ; un vrai modèle descend dans un espace à des millions de dimensions, une par poids. Et ce paysage peut comporter des « faux-bas » — des creux locaux qui ne sont pas le point le plus bas. C’est l’un des défis de l’entraînement : éviter de se croire arrivé dans une simple cuvette à mi-pente.

La descente, en un schéma

erreur réglage des poids du modèle départ erreur minimale chaque pas suit la pente

Déconstruction : du randonneur au modèle

Notion technique Dans notre analogie En réalité, sans jargon
Fonction de perte (erreur) L’altitude : plus on est haut, plus on se trompe La mesure chiffrée de l’écart entre la réponse du modèle et la bonne réponse
Gradient La pente sous les pieds La direction dans laquelle l’erreur diminue le plus vite
Descente de gradient Faire un pas vers le bas, encore et encore Corriger les poids par petites étapes pour réduire l’erreur
Taux d’apprentissage La longueur de chaque pas Trop petit : lent ; trop grand : on dépasse la cible
Rétropropagation La chaîne encordée qui se transmet l’écart de l’arrivée au départ Le calcul qui attribue à chaque poids sa part de correction

Ce que ça change pour vous

  • « Entraîner » n’a rien de mystérieux. C’est répéter un cycle « mesurer l’erreur → corriger un peu ». La magie apparente du deep learning repose sur cette mécanique étonnamment simple, mais déroulée à très grande échelle.
  • L’entraînement coûte cher. Des millions de pas sur des millions d’exemples expliquent les temps de calcul et les factures d’énergie. Vous saisissez désormais pourquoi entraîner un grand modèle se compte en semaines et en millions d’euros.
  • Un modèle n’atteint jamais la perfection. Il s’arrête « assez bas », pas au point absolument optimal. D’où une marge d’erreur résiduelle, inhérente, qu’aucun réglage n’efface totalement.
  • La qualité des exemples dicte le résultat. Le randonneur descend le paysage qu’on lui donne. Si les données d’entraînement sont biaisées ou pauvres, la vallée atteinte le sera aussi.

FAQ pour débuter

Quelle différence entre rétropropagation et descente de gradient ?
La rétropropagation calcule, pour chaque poids, dans quel sens le corriger (elle remonte l’erreur). La descente de gradient applique ensuite la correction d’un petit pas. L’une indique la direction, l’autre fait avancer.
C’est quoi un « creux local » et pourquoi c’est gênant ?
Une petite cuvette à mi-pente où le randonneur croit être arrivé, alors que la vraie vallée est plus bas ailleurs. Le modèle peut s’y « coincer ». Diverses astuces (élan, pas variable, redémarrages) aident à en sortir.
Pourquoi avancer par petits pas plutôt que sauter directement en bas ?
Parce qu’on ne voit pas la vallée : on ne connaît que la pente locale. Un grand saut « à l’aveugle » risque de retomber plus haut. Les petits pas garantissent qu’on descend bien à chaque étape.
Est-ce que tous les modèles d’IA apprennent comme ça ?
La grande majorité des réseaux de neurones modernes, oui. Des variantes existent (formes de descente plus rapides, par lots), mais le principe « mesurer l’erreur, corriger les poids dans le sens de la pente » reste le socle commun.

Les deux articles fondateurs

1. Cauchy invente la descente de gradient (1847)

Contexte. Bien avant l’informatique, le mathématicien français Augustin-Louis Cauchy cherche une méthode pour résoudre de grands systèmes d’équations, notamment en astronomie.

Idée centrale. Dans une brève note à l’Académie des Sciences, il propose d’avancer pas à pas dans la direction de plus forte descente pour atteindre un minimum. C’est, mot pour mot, notre randonneur dans le brouillard.

Pourquoi ça compte. Presque anodine à l’époque, cette méthode est devenue, dans ses multiples variantes, l’outil d’optimisation au cœur de tout l’apprentissage automatique moderne.

✅ Cauchy, A. (1847). Méthode générale pour la résolution des systèmes d’équations simultanées. Comptes Rendus de l’Académie des Sciences, 25, 536–538.

2. Rumelhart, Hinton & Williams popularisent la rétropropagation (1986)

Contexte. Les réseaux à plusieurs couches existent, mais on ne sait pas les entraîner efficacement : comment répartir la correction de l’erreur entre toutes les couches ?

Idée centrale. Les auteurs décrivent une procédure qui ajuste les poids du réseau en remontant l’erreur de la sortie vers l’entrée, permettant aux couches cachées de capturer des caractéristiques utiles.

Pourquoi ça compte. C’est l’article qui rend les réseaux profonds réellement entraînables. Sans lui, pas de deep learning tel que nous le connaissons.

✅ Rumelhart, D. E., Hinton, G. E., & Williams, R. J. (1986). Learning representations by back-propagating errors. Nature, 323, 533–536.

Trois prompts pour apprendre

Explique-moi la descente de gradient avec une analogie autre que la montagne dans le brouillard, puis dis-moi ce que représente le « taux d’apprentissage » dans ton analogie.

🎯 Explorer | 📚 Ce qu’on apprend : transposer le mécanisme « pente / pas » sur un autre terrain.

Qu’est-ce qui se passe si le taux d’apprentissage est beaucoup trop grand ? Et beaucoup trop petit ? Réponds simplement, sans formule.

🎯 Tester sa compréhension | 📚 Ce qu’on apprend : l’effet concret du réglage du pas.

En quoi le fait qu’un modèle s’arrête « assez bas » mais pas au minimum parfait devrait-il rendre un manager prudent face à une IA présentée comme « optimale » ?

🎯 Cas pratique management | 📚 Ce qu’on apprend : relier l’imperfection de l’entraînement à l’esprit critique.

📝 Note méthodologique. Cet article a été rédigé avec l’aide d’une IA générative, sur la base d’un gabarit pédagogique et d’analogies conçus par l’autrice. Les deux références fondatrices ont été vérifiées manuellement. L’objectif reste pédagogique : rendre un concept technique accessible aux étudiants et cadres en management.

Suivre le blog

Sans newsletter qui monétise vos données.

📡 RSS 📖 WP LinkedIn → S’abonner

En savoir plus sur Maria Mercanti-Guérin

Abonnez-vous pour poursuivre la lecture et avoir accès à l’ensemble des archives.

Poursuivre la lecture