Aller au contenu

Concepts · Quantification

Comment un modèle de centre de données tient dans votre bureau.

La quantification est la technologie sans éclat qui décide si l'IA souveraine coûte un serveur ou un centre de données. Voici comment elle fonctionne réellement, avec assez de détails pour que vos ingénieurs vérifient.

Le mécanisme

La taille d'un modèle, c'est octets par poids × poids.

L'entraînement utilise des nombres 16 bits. L'inférence n'y est pas obligée — l'essentiel de cette précision est une redondance que vous pouvez dépenser.

La quantification stocke chaque poids sur moins de bits — regroupés et remis à l'échelle pour préserver le comportement du modèle. Moitié moins de bits, moitié moins de mémoire, et généralement plus rapide aussi : aux charges à faible lot et locataire unique sous lesquelles les systèmes on-premise tournent réellement, la vitesse de génération est limitée par la vitesse à laquelle les poids affluent de la mémoire — un modèle plus petit est donc plus rapide.

Précision Modèle 8B Modèle 70B Tourne sur
16 bits (entraînement) ~16 Go ~140 Go Nœud multi-GPU
8 bits ~8 Go ~70 Go GPU de centre de données
4 bits (le point idéal) ~4,5 Go ~40 Go Un GPU workstation / une carte 48 Go (juste — ou 2×24 Go)
1–2 bits (la frontière) ~1,5–2,5 Go ~12–20 Go Laptop ou boîtier edge (un téléphone, pour la classe 27B et en dessous)

Poids uniquement — la mémoire de travail ajoute le cache KV (ci-dessous) et le surcoût d'exécution. Le placement d'un 70B sur une carte 48 Go suppose une variante 4 bits compacte et un cache quantifié ; les chiffres exacts dépendent du format et du regroupement, et nous dimensionnons le budget complet lors du cadrage.

Le compromis

Ce qu'elle coûte, et comment nous le gardons honnête.

La quantification échange une part mesurable de qualité contre une réduction de mémoire de 3–4× et le palier matériel en dessous. Le mot clé est mesurable.

4 bits : le défaut de production

Les formats 4 bits modernes — K-quants GGUF pour un service de type llama.cpp, AWQ ou GPTQ ailleurs — coûtent typiquement un point ou deux sur des benchmarks larges ; sur une tâche étroite et affinée, souvent rien de détectable. C'est là que la plupart des déploiements souverains devraient vivre : un 70B en ~40 Go de poids, un 8B en moins de 5 Go.

En dessous de 4 bits : conçu, pas naïf

Arrondir plus fort détruit la qualité. Des formats ternaires et binaires conçus à dessein — de plus en plus associés à un entraînement conscient de la quantification — gardent les modèles utiles à 1–2 bits par poids, réduisant un modèle de classe 27B à la taille d'un téléphone. Cette frontière avance vite, et c'est celle que nous suivons de plus près.

Notre règle : réévaluer, puis livrer

Chaque version quantifiée est ré-exécutée face à votre jeu d'évaluation et livrée avec l'écart de qualité documenté à côté de la base de référence en pleine précision. Si la quantification coûte plus que le gain de déploiement ne le vaut pour votre tâche, le rapport le dit et nous montons en gamme.

Le second budget

Le contexte a aussi sa facture mémoire.

Les poids ne sont que la moitié de l'exercice de dimensionnement. L'autre moitié est le cache KV — la mémoire de travail du modèle pour votre conversation ou votre document.

Pour chaque token du contexte, le modèle stocke des activations clé-valeur. Sur de courts contextes, c'est du bruit ; à 100K tokens de contexte — un long contrat, un dossier complet — le cache croît jusqu'aux gigaoctets et peut rivaliser avec les poids eux-mêmes.

Le cache se quantifie aussi : un stockage KV en 4 bits réduit son empreinte de plusieurs fois, ce qui fait souvent la différence entre « les longs documents rentrent » et « ils ne rentrent pas » sur une machine donnée. L'architecture compte également — les modèles plus récents à attention hybride gardent le cache proportionnellement petit pour leur taille.

Conséquence pratique : quand nous nous engageons sur « traite vos contrats de 200 pages sur une seule machine », cette affirmation a été dimensionnée — poids, cache, surcoût — pas espérée.

Pourquoi cela compte ici

La quantification est la courbe de coût de la souveraineté.

Chaque bit retiré d'un poids fait descendre « tourne là où vivent vos données » d'un cran sur l'échelle matérielle.

En 16 bits, faire tourner votre propre modèle est une demande d'investissement avec un plan de salle joint. En 4 bits, c'est un serveur. À la frontière 1–2 bits, cela commence à signifier des laptops, des boîtiers edge et des machines qui n'ont jamais vu de câble réseau — les environnements où vivent réellement les données régulées.

C'est pourquoi nous traitons la quantification comme une discipline de premier ordre, pas une case à cocher. Voyez sur quoi tournent les systèmes obtenus dans le runtime souverain.

FAQ

Questions sur la quantification.

La quantification rend-elle le modèle moins bon ?
Légèrement, et de façon mesurable — c'est là tout l'intérêt. « Souvent invisible sur une tâche étroite » n'est pas un livrable, aussi ré-exécutons-nous votre jeu d'évaluation sur la version quantifiée et livrons l'écart à côté de la base de référence en pleine précision. Un modèle quantifié sans rapport d'évaluation est une supposition.
Pourquoi un long contexte demande-t-il autant de mémoire ?
Le modèle conserve un cache clé-valeur (KV) pour chaque token de la conversation, et sur de longs contextes le cache — et non les poids — devient le plus gros consommateur de mémoire, croissant linéairement avec la longueur du contexte jusqu'aux gigaoctets. Le cache peut aussi être quantifié, réduisant son empreinte de plusieurs fois. C'est un second budget que nous dimensionnons explicitement lors du cadrage, car « supporte 100K de contexte » sur une fiche technique ne signifie rien sans la mémoire pour le contenir.

Vous voulez le dimensionnement pour votre cas d'usage ?

Dites-nous les documents et le matériel dont vous disposez — nous reviendrons avec le budget mémoire et la machine sur laquelle cela tourne.