Concepts · Quantification
Comment un modèle de centre de données tient dans votre bureau.
La quantification est la technologie sans éclat qui décide si l'IA souveraine coûte un serveur ou un centre de données. Voici comment elle fonctionne réellement, avec assez de détails pour que vos ingénieurs vérifient.
Le mécanisme
La taille d'un modèle, c'est octets par poids × poids.
L'entraînement utilise des nombres 16 bits. L'inférence n'y est pas obligée — l'essentiel de cette précision est une redondance que vous pouvez dépenser.
La quantification stocke chaque poids sur moins de bits — regroupés et remis à l'échelle pour préserver le comportement du modèle. Moitié moins de bits, moitié moins de mémoire, et généralement plus rapide aussi : aux charges à faible lot et locataire unique sous lesquelles les systèmes on-premise tournent réellement, la vitesse de génération est limitée par la vitesse à laquelle les poids affluent de la mémoire — un modèle plus petit est donc plus rapide.
| Précision | Modèle 8B | Modèle 70B | Tourne sur |
|---|---|---|---|
| 16 bits (entraînement) | ~16 Go | ~140 Go | Nœud multi-GPU |
| 8 bits | ~8 Go | ~70 Go | GPU de centre de données |
| 4 bits (le point idéal) | ~4,5 Go | ~40 Go | Un GPU workstation / une carte 48 Go (juste — ou 2×24 Go) |
| 1–2 bits (la frontière) | ~1,5–2,5 Go | ~12–20 Go | Laptop ou boîtier edge (un téléphone, pour la classe 27B et en dessous) |
Poids uniquement — la mémoire de travail ajoute le cache KV (ci-dessous) et le surcoût d'exécution. Le placement d'un 70B sur une carte 48 Go suppose une variante 4 bits compacte et un cache quantifié ; les chiffres exacts dépendent du format et du regroupement, et nous dimensionnons le budget complet lors du cadrage.
Le compromis
Ce qu'elle coûte, et comment nous le gardons honnête.
La quantification échange une part mesurable de qualité contre une réduction de mémoire de 3–4× et le palier matériel en dessous. Le mot clé est mesurable.
4 bits : le défaut de production
Les formats 4 bits modernes — K-quants GGUF pour un service de type llama.cpp, AWQ ou GPTQ ailleurs — coûtent typiquement un point ou deux sur des benchmarks larges ; sur une tâche étroite et affinée, souvent rien de détectable. C'est là que la plupart des déploiements souverains devraient vivre : un 70B en ~40 Go de poids, un 8B en moins de 5 Go.
En dessous de 4 bits : conçu, pas naïf
Arrondir plus fort détruit la qualité. Des formats ternaires et binaires conçus à dessein — de plus en plus associés à un entraînement conscient de la quantification — gardent les modèles utiles à 1–2 bits par poids, réduisant un modèle de classe 27B à la taille d'un téléphone. Cette frontière avance vite, et c'est celle que nous suivons de plus près.
Notre règle : réévaluer, puis livrer
Chaque version quantifiée est ré-exécutée face à votre jeu d'évaluation et livrée avec l'écart de qualité documenté à côté de la base de référence en pleine précision. Si la quantification coûte plus que le gain de déploiement ne le vaut pour votre tâche, le rapport le dit et nous montons en gamme.
Le second budget
Le contexte a aussi sa facture mémoire.
Les poids ne sont que la moitié de l'exercice de dimensionnement. L'autre moitié est le cache KV — la mémoire de travail du modèle pour votre conversation ou votre document.
Pour chaque token du contexte, le modèle stocke des activations clé-valeur. Sur de courts contextes, c'est du bruit ; à 100K tokens de contexte — un long contrat, un dossier complet — le cache croît jusqu'aux gigaoctets et peut rivaliser avec les poids eux-mêmes.
Le cache se quantifie aussi : un stockage KV en 4 bits réduit son empreinte de plusieurs fois, ce qui fait souvent la différence entre « les longs documents rentrent » et « ils ne rentrent pas » sur une machine donnée. L'architecture compte également — les modèles plus récents à attention hybride gardent le cache proportionnellement petit pour leur taille.
Conséquence pratique : quand nous nous engageons sur « traite vos contrats de 200 pages sur une seule machine », cette affirmation a été dimensionnée — poids, cache, surcoût — pas espérée.
Pourquoi cela compte ici
La quantification est la courbe de coût de la souveraineté.
Chaque bit retiré d'un poids fait descendre « tourne là où vivent vos données » d'un cran sur l'échelle matérielle.
En 16 bits, faire tourner votre propre modèle est une demande d'investissement avec un plan de salle joint. En 4 bits, c'est un serveur. À la frontière 1–2 bits, cela commence à signifier des laptops, des boîtiers edge et des machines qui n'ont jamais vu de câble réseau — les environnements où vivent réellement les données régulées.
C'est pourquoi nous traitons la quantification comme une discipline de premier ordre, pas une case à cocher. Voyez sur quoi tournent les systèmes obtenus dans le runtime souverain.
FAQ
Questions sur la quantification.
La quantification rend-elle le modèle moins bon ?
Pourquoi un long contexte demande-t-il autant de mémoire ?
Vous voulez le dimensionnement pour votre cas d'usage ?
Dites-nous les documents et le matériel dont vous disposez — nous reviendrons avec le budget mémoire et la machine sur laquelle cela tourne.