Vai al contenuto

Concetti · Quantizzazione

Come un modello da data center entra nel vostro ufficio.

La quantizzazione è la tecnologia poco appariscente che decide se l'IA sovrana costa un server o un data center. Ecco come funziona davvero, con dettaglio sufficiente perché i vostri ingegneri lo verifichino.

Il meccanismo

La dimensione di un modello è byte per peso × pesi.

L'addestramento usa numeri a 16 bit. L'inferenza non deve — gran parte di quella precisione è ridondanza che potete spendere.

La quantizzazione memorizza ogni peso in meno bit — raggruppati e riscalati così da preservare il comportamento del modello. Metà dei bit, metà della memoria, e di solito anche più veloce: ai carichi a basso batch e tenant singolo con cui i sistemi on-premise girano davvero, la velocità di generazione è limitata da quanto rapidamente i pesi fluiscono dalla memoria — quindi un modello più piccolo è più veloce.

Precisione Modello 8B Modello 70B Gira su
16 bit (addestramento) ~16 GB ~140 GB Nodo multi-GPU
8 bit ~8 GB ~70 GB GPU da data center
4 bit (il punto ideale) ~4,5 GB ~40 GB Una GPU workstation / una scheda da 48 GB (al limite — o 2×24 GB)
1–2 bit (la frontiera) ~1,5–2,5 GB ~12–20 GB Laptop o box edge (un telefono, per la classe 27B e inferiore)

Solo pesi — la memoria di lavoro aggiunge la cache KV (sotto) e l'overhead di runtime. Far stare un 70B su una scheda da 48 GB presuppone una variante 4 bit compatta e una cache quantizzata; le cifre esatte dipendono da formato e raggruppamento, e dimensioniamo il budget completo in fase di definizione del perimetro.

Il compromesso

Quanto costa, e come lo teniamo onesto.

La quantizzazione scambia una porzione misurabile di qualità con una riduzione di memoria di 3–4× e il gradino hardware sottostante. La parola chiave è misurabile.

4 bit: il default di produzione

I formati 4 bit moderni — K-quant GGUF per il serving in stile llama.cpp, AWQ o GPTQ altrove — costano tipicamente un punto o due sui benchmark ampi; su un compito ristretto e ottimizzato, spesso nulla di rilevabile. È qui che dovrebbe stare la maggior parte dei deployment sovrani: un 70B in ~40 GB di pesi, un 8B in meno di 5 GB.

Sotto i 4 bit: progettato, non ingenuo

Arrotondare più duramente distrugge la qualità. Formati ternari e binari costruiti ad hoc — sempre più abbinati a un addestramento consapevole della quantizzazione — mantengono utili i modelli a 1–2 bit per peso, riducendo un modello di classe 27B alle dimensioni di un telefono. Questa frontiera si muove in fretta, ed è quella che seguiamo più da vicino.

La nostra regola: rivalutare, poi consegnare

Ogni versione quantizzata viene rieseguita rispetto al vostro set di valutazione e consegnata con la differenza di qualità documentata accanto alla baseline a piena precisione. Se la quantizzazione costa più di quanto il guadagno di deployment valga per il vostro compito, il rapporto lo dice e saliamo di classe.

Il secondo budget

Anche il contesto ha il suo conto in memoria.

I pesi sono solo metà dell'esercizio di dimensionamento. L'altra metà è la cache KV — la memoria di lavoro del modello per la vostra conversazione o documento.

Per ogni token nel contesto, il modello memorizza attivazioni chiave-valore. Con contesti brevi è rumore; con contesti da 100K token — un lungo contratto, un fascicolo completo — la cache cresce fino ai gigabyte e può rivaleggiare con i pesi stessi.

Anche la cache si quantizza: una memorizzazione KV a 4 bit ne riduce l'impronta di diverse volte, il che spesso fa la differenza tra «i documenti lunghi ci stanno» e «non ci stanno» su una data macchina. Conta anche l'architettura — i modelli più recenti con attenzione ibrida mantengono la cache sproporzionatamente piccola rispetto alla loro dimensione.

Conseguenza pratica: quando ci impegniamo su «gestisce i vostri contratti di 200 pagine su una sola macchina», questa affermazione è stata dimensionata — pesi, cache, overhead — non sperata.

Perché conta qui

La quantizzazione è la curva di costo della sovranità.

Ogni bit tolto a un peso sposta «gira dove risiedono i vostri dati» di un gradino più in basso sulla scala hardware.

A 16 bit, eseguire il proprio modello è una richiesta di investimento con una planimetria allegata. A 4 bit, è un server. Alla frontiera 1–2 bit, comincia a significare laptop, box edge e macchine che non hanno mai visto un cavo di rete — gli ambienti in cui i dati regolamentati vivono davvero.

Per questo trattiamo la quantizzazione come una disciplina di prima classe, non una casella da spuntare. Vedete su cosa girano i sistemi risultanti nel runtime sovrano.

FAQ

Domande sulla quantizzazione.

La quantizzazione peggiora il modello?
Leggermente, e in modo misurabile — è questo il punto. «Spesso invisibile su un compito ristretto» non è un deliverable, quindi rieseguiamo il vostro set di valutazione sulla versione quantizzata e consegniamo la differenza accanto alla baseline a piena precisione. Un modello quantizzato senza rapporto di valutazione è un'ipotesi.
Perché un contesto lungo richiede così tanta memoria?
Il modello mantiene una cache chiave-valore (KV) per ogni token della conversazione, e con contesti lunghi la cache — non i pesi — diventa il maggior consumatore di memoria, crescendo linearmente con la lunghezza del contesto fino ai gigabyte. Anche la cache può essere quantizzata, riducendone l'impronta di diverse volte. È un secondo budget che dimensioniamo esplicitamente in fase di definizione del perimetro, perché «supporta 100K di contesto» su una scheda tecnica non significa nulla senza la memoria per contenerlo.

Volete il dimensionamento per il vostro caso d'uso?

Diteci i documenti e l'hardware che avete — torneremo con il budget di memoria e la macchina su cui viene eseguito.