Quantization & IA embarquée : la photo qu’on allège pour la faire tenir sur un téléphone – TD et prompts

Pour faire tenir des milliers de photos sur votre téléphone, vous ne réduisez pas le nombre de vos souvenirs : vous allégez chaque image, en codant chaque pixel avec un peu moins de précision. Le fichier fond, l’image reste parfaitement reconnaissable. La quantization (quantification) applique exactement cette idée à l’IA : garder le même modèle, mais stocker ses nombres avec moins de précision. C’est ce qui permet à un modèle de tenir — et de tourner — sur un simple appareil : l’IA embarquée.

Définition : la même idée, à trois hauteurs

Niveau 1 — Tout public

On arrondit les milliers de nombres qui composent un modèle pour qu’ils prennent moins de place. Le modèle devient plus léger et plus rapide, tout en donnant des réponses quasi identiques.

Niveau 2 — Manager / décideur

La quantization réduit la précision numérique des paramètres (par exemple de 16 à 8 ou 4 bits) sans changer l’architecture. Résultat : moins de mémoire, moins d’énergie, plus de vitesse — la clé pour déployer sur serveur modeste ou sur l’appareil.

Niveau 3 — Définition académique

La quantification représente poids (et parfois activations) sur une largeur de bits réduite via une correspondance vers un ensemble discret de valeurs. Elle se décline en post-training ou quantization-aware training, cette dernière co-adaptant l’entraînement pour préserver la précision.

L’analogie-maîtresse : la photo qu’on allège

Une photo, c’est une grille de pixels, et chaque pixel est décrit par des nombres (ses couleurs). En haute précision, chaque nuance est codée très finement — superbe, mais lourd. Pour alléger, on réduit la précision de chaque valeur : au lieu de milliers de nuances, on en garde quelques centaines. À l’œil, l’image est la même ; sur le disque, elle pèse une fraction.

Un modèle d’IA, c’est pareil : des milliers de nombres — ses poids, ces réglages hérités de l’entraînement d’un réseau de deep learning. Par défaut, chacun est stocké avec beaucoup de décimales (16 ou 32 bits). La quantization les arrondit : on passe, disons, de 0,7381924 à 0,74. Répété sur des milliards de poids, le gain d’espace et de vitesse est spectaculaire — et la réponse du modèle ne bouge presque pas.

C’est cet arrondi qui rend l’IA embarquée possible : un modèle quantifié peut tenir dans la mémoire d’un téléphone ou d’un objet connecté, y tourner vite, consommer peu — et traiter les données sur place, sans les envoyer ailleurs. Un levier direct de coût, de latence et de confidentialité.

La quantization complète les deux autres stratégies d’efficience 2026, sans se confondre avec elles. La distillation entraîne un élève plus petit ; la quantization garde le même modèle mais arrondit ses nombres. Le Mixture of Experts, lui, joue sur les parties du modèle activées. On peut d’ailleurs les combiner. Et à l’autre bout du spectre, les reasoning models dépensent plus de calcul pour réfléchir : quantifier rend chaque pas moins cher, raisonner ajoute des pas.

Là où l’analogie s’arrête. Trop compresser une photo fait apparaître des aplats et des bandes disgracieuses ; trop quantifier un modèle dégrade ses réponses. Et tout ne se vaut pas : quelques valeurs « aberrantes », rares mais décisives, pèsent lourd dans un grand modèle — les arrondir brutalement casse tout. Les méthodes modernes les traitent à part. Enfin, on parle ici de la précision de chaque nombre (la finesse du codage), pas du nombre de paramètres : on n’enlève pas de pixels, on code chacun plus grossièrement.

L’arrondi, en un schéma

Modèle complet nombres très précis · 16–32 bits 0,7381924 0,1029571 0,9634480 lourd arrondir Modèle quantifié arrondis · 8–4 bits 0,74 0,10 0,96 Léger & rapide même modèle, moins de bits Tourne sur un téléphone IA embarquée

Déconstruction : de la photo au modèle

Notion technique Dans notre analogie En réalité, sans jargon
Poids Les couleurs de chaque pixel Les nombres réglés du modèle
Largeur de bits La finesse du codage couleur Le nombre de chiffres gardés par valeur
Quantifier Alléger la photo Arrondir les poids à moins de précision
Valeurs aberrantes Les détails qu’il ne faut pas écraser Rares poids décisifs, à traiter à part
IA embarquée La photo qui tient sur le téléphone Un modèle qui tourne sur l’appareil

Ce que ça change pour vous

  • Un modèle peut tenir sur votre matériel. Grâce à la quantization, des modèles autrefois réservés aux gros serveurs tournent sur un ordinateur portable, voire un téléphone. De quoi tester en local, à faible coût.
  • Confidentialité et latence. Traiter les données sur l’appareil, sans les envoyer sur un serveur, réduit les risques et le délai. Un argument fort pour des usages sensibles.
  • Il existe un curseur qualité/légèreté. 8 bits passent souvent inaperçus ; descendre à 4 bits ou moins peut dégrader selon la tâche. À tester sur vos cas plutôt qu’à choisir le plus agressif par défaut.
  • Les « versions » d’un modèle ne se valent pas. Une même famille peut exister en plusieurs quantifications. Lire la précision (16, 8, 4 bits) aide à comprendre pourquoi deux variantes diffèrent en taille, vitesse et qualité.

FAQ pour débuter

Quantization ou distillation : quelle différence ?
La distillation entraîne un élève plus petit qui imite un maître. La quantization garde le même modèle et arrondit simplement ses nombres. L’une change de modèle, l’autre change la précision — et on peut les combiner.
Arrondir les nombres, ça n’abîme pas le modèle ?
Peu, si c’est fait avec soin. Comme une photo légèrement compressée reste nette, un modèle bien quantifié garde l’essentiel de sa qualité. Le risque apparaît quand on descend trop bas ou qu’on écrase des valeurs décisives.
Qu’est-ce que l’IA embarquée exactement ?
C’est faire tourner un modèle directement sur un appareil (téléphone, objet connecté, voiture) plutôt que sur un serveur distant. La quantization, en allégeant le modèle, est l’une des clés qui rendent cela possible.
Jusqu’où peut-on descendre en précision ?
8 bits sont souvent quasi transparents ; 4 bits marchent dans bien des cas ; en dessous, la qualité devient fragile et dépend fortement de la tâche. C’est un arbitrage à valider empiriquement, pas une règle universelle.

Les deux articles fondateurs

1. Jacob et al. — la quantification pour l’inférence embarquée (2018)

Contexte. Faire tourner des réseaux sur téléphone butait sur la mémoire et la consommation des calculs en virgule flottante.

Idée centrale. Représenter et calculer les réseaux en entiers 8 bits, avec un entraînement co-conçu pour préserver la précision — une inférence efficace, sans modifier l’architecture.

Pourquoi ça compte. C’est une référence fondatrice de la quantification moderne pour l’IA embarquée : moins de mémoire, moins d’énergie, à qualité quasi préservée.

✅ Jacob, B., Kligys, S., Chen, B., Zhu, M., Tang, M., Howard, A. G., Adam, H., & Kalenichenko, D. (2018). Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference. CVPR 2018, 2704–2713. (arXiv:1712.05877)

2. Dettmers et al. — quantifier les grands modèles sans perte : LLM.int8() (2022)

Contexte. Les très grands modèles de langage exigeaient une mémoire GPU considérable ; les quantifier semblait dégrader leur performance.

Idée centrale. Une multiplication en entiers 8 bits qui, en traitant à part quelques valeurs aberrantes, réduit de moitié la mémoire d’inférence tout en conservant la performance pleine précision.

Pourquoi ça compte. C’est le travail qui a rendu la quantification praticable à l’échelle des LLM, les rendant bien plus accessibles.

✅ Dettmers, T., Lewis, M., Belkada, Y., & Zettlemoyer, L. (2022). LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale. Advances in Neural Information Processing Systems, 35. (arXiv:2208.07339)

Trois prompts pour apprendre

Explique-moi, avec l’exemple d’une photo, la différence entre réduire le nombre de pixels et réduire la précision de chaque pixel. Rapporte-le à la quantization.

🎯 Clarifier | 📚 Ce qu’on apprend : distinguer taille et précision.

Compare quantization, distillation et Mixture of Experts en un tableau : ce que chacune réduit, ce qu’elle préserve, quand la préférer.

🎯 Relier les concepts | 📚 Ce qu’on apprend : situer les trois leviers d’efficience 2026.

Pour un usage sur téléphone qui doit rester confidentiel, explique pourquoi l’IA embarquée est un atout et quels compromis elle impose.

🎯 Appliquer | 📚 Ce qu’on apprend : relier quantization, embarqué et confidentialité.

📝 Note méthodologique. Cet article a été rédigé avec l’aide d’une IA générative, sur la base d’un gabarit pédagogique et d’analogies conçus par l’autrice. Les deux références fondatrices ont été vérifiées manuellement. L’objectif reste pédagogique : rendre un concept technique accessible aux étudiants et cadres en management.

Suivre le blog

Sans newsletter qui monétise vos données.

📡 RSS 📖 WP LinkedIn → S’abonner

En savoir plus sur Maria Mercanti-Guérin

Abonnez-vous pour poursuivre la lecture et avoir accès à l’ensemble des archives.

Poursuivre la lecture