Vai al contenuto

Concetti · Modelli piccoli

Modelli piccoli, misurati.

Due domande decidono un build sovrano: quanto grande deve essere il modello per il compito e da quale base partite. Questa pagina risponde a entrambe — capacità rispetto alla dimensione, cosa sa fare davvero ogni classe di dimensione, e lo spettro dall'Apertus interamente svizzero ai modelli aperti europei e internazionali — limiti onesti e inquadramento di conformità inclusi.

Dimensione

Quanto modello serve al compito?

La capacità cresce con la dimensione — ma si appiattisce, e i rendimenti diventano presto costosi. La maggior parte del lavoro regolamentato non vive alla frontiera; vive nelle bande che un modello piccolo raggiunge.

La dimensione di un modello si misura in parametri — da ~1B fino a oltre 200B. Più parametri comprano conoscenza più ampia e ragionamento più profondo, ma la curva si piega: il salto da 1B a 8B è trasformativo, da 8B a 70B è reale ma costoso, e oltre pagate molto per poco sulla maggior parte dei compiti.

Il trucco: la dimensione necessaria la fissa il compito, non l'ambizione. Estrazione, classificazione, instradamento e redazione strutturata vivono nelle bande basse — il terreno di casa di un modello piccolo. E la freccia rossa qui sotto è tutto il punto di questa pagina: ottimizzare un modello piccolo su un compito ristretto solleva la sua capacità effettiva nella banda superiore, così un 8B ottimizzato batte un generalista molto più grande sul lavoro che eseguite davvero.

8B ottimizzato sul vostro compito ristretto 8B di base Ragionamento di frontiera Lavoro di conoscenza applicato Lavoro di routine strutturato ricerca aperta · sintesi inedita Q&A di dominio con citazione · traduzione estrazione · classificazione · instradamento 1B 8B 30B 70B 235B Dimensione del modello → Capacità →
Illustrativo, non un benchmark. La capacità grezza cresce con il numero di parametri ma si appiattisce — e i rendimenti diventano costosi. Ottimizzare un modello piccolo su un compito ristretto solleva la sua capacità effettiva nella banda superiore; per questo un 8B ottimizzato può battere un modello generale molto più grande sul vostro lavoro definito. I numeri veri vengono dalla valutazione sul vostro compito.

L'effetto

La specializzazione batte la scala sui compiti ristretti.

I benchmark generali premiano l'ampiezza. Il vostro workflow premia la profondità — i vostri modelli, la vostra terminologia, i vostri formati, i vostri casi limite.

Pronto all'uso, un modello piccolo generico è un generalista che per caso parla la vostra lingua. Ottimizzato su qualche migliaio di esempi del vostro compito, diventa uno specialista che ha letto il vostro corpus. Quanto valga dipende da dove parte il modello di base — esattamente ciò che l'ablazione in ogni Pilot misura, sui vostri documenti, prima che vi impegniate.

Il punto di riferimento pubblico in Svizzera: il servizio di traduzione del Cantone Ticino è passato dal 90 % al 94 % di accuratezza dopo l'ottimizzazione di Apertus-8B su dati cantonali, eseguito interamente su infrastruttura cantonale. Quattro punti in cima alla scala — in un servizio in produzione, la differenza tra controllare l'output a campione e rifarlo.

Un'API di frontiera ha due svantaggi strutturali su questo terreno: non ha mai visto i vostri documenti, e non potrà mai — perché sono i documenti che non potete cedere. Il vantaggio del modello piccolo non è l'intelligenza. È l'accesso.

Apertus-8B di base
90%
Ottimizzato su dati cantonali
94%+4 pt
Cantone Ticino — accuratezza di traduzione su testo cantonale, prima e dopo l'ottimizzazione di Apertus-8B. Fonte: CSCS.

Il metodo

L'ottimizzazione insegna il comportamento. Il retrieval fornisce i fatti.

I due vengono regolarmente confusi — e questa confusione è dove i progetti di IA falliscono.

Ottimizzazione

Insegna il compito: la vostra terminologia, i formati dei documenti, il tono, la struttura di output, il comportamento di rifiuto. Non memorizza i fatti in modo affidabile — usarla come archivio di conoscenza è un errore di progettazione che ci rifiutiamo di consegnare.

Retrieval (RAG)

Fornisce i fatti: la versione attuale delle vostre policy, contratti e archivi, citati fino alla pagina di origine. La conoscenza si aggiorna nel momento in cui lo fa il documento — nessun riaddestramento.

L'ablazione

Ogni Pilot valuta tutti e quattro i bracci — base, retrieval, ottimizzazione, combinato — sul vostro set di valutazione. La tabella dice quale sistema vale la pena acquistare.

Misurata, la divisione è netta: nella nostra ablazione FINMA, la sola ottimizzazione ha portato la conformità di formato da ~2 % a 100 % lasciando però l'accuratezza risposta-più-citazione all'1,6 % — comportamento appreso, fatti no. Solo retrieval: 22,4 %. Combinato: 45,4 %.

La base

Interamente svizzero, o flessibile quanto la vostra conformità consente.

Apertus è la nostra scelta predefinita — l'LLM interamente aperto e interamente trasparente della Svizzera. Ma la sovranità non è solo svizzera. Dove la vostra policy lo consente, una base aperta europea o internazionale può vincere la vostra valutazione e girare comunque interamente sulla vostra infrastruttura.

← Massima sovranità e trasparenzaMassima capacità e flessibilità →

Interamente svizzero

Sovrano e interamente trasparente

Apertus

Pesi aperti e dati di addestramento aperti, origine svizzera. La scelta quando ogni strato deve essere verificabile — settore pubblico, o le posture di conformità più rigorose.

Europeo

Con base UE, pesi aperti

Mistral · Teuken · EuroLLM

Fornitori europei, pesi aperti, forte copertura delle lingue UE. La provenienza resta in Europa; i dati di addestramento di solito non sono pubblicati.

Internazionale

Migliore performance aperta

Llama · Qwen · Gemma

I modelli aperti più forti indipendentemente dall'origine. Massima capacità ed ecosistema — il compromesso è la trasparenza dei dati di addestramento e, per alcuni, il paese d'origine.

Ogni opzione gira allo stesso modo: pesi aperti, sulla vostra infrastruttura, i vostri dati non escono mai. Verso destra si compra capacità ed ecosistema; verso sinistra trasparenza della provenienza. Dove si colloca la vostra organizzazione è una decisione di conformità e approvvigionamento — e all'interno del livello scelto è ancora la valutazione a decidere quale modello vince.

L'EU AI Act consente un modello come Qwen?

In breve: il regolamento classifica in base al rischio d'uso e impone obblighi di trasparenza al fornitore di un modello per finalità generali — non limita un modello di base in base al paese d'origine. Eseguire un modello aperto sulla vostra infrastruttura mantiene i vostri dati nella vostra giurisdizione, indipendentemente da dove i pesi sono stati addestrati.

Ciò che può escludere un modello è la vostra stessa policy di approvvigionamento o governance dei dati: diversi enti pubblici svizzeri ed europei limitano la tecnologia di origine cinese per policy interna, non per il regolamento. È una decisione che inquadriamo con voi — ed è esattamente per questo che esiste l'opzione interamente svizzera. Non è consulenza legale; lavoriamo insieme ai vostri team di conformità e legale.

Il catalogo

I modelli di base su cui costruiamo.

Una shortlist di lavoro, raggruppata per origine. Dimensioni e hardware sono fatti; prestazioni e velocità sono qualitative — la classifica vera viene sempre dalla valutazione sul vostro compito.

Svizzera — sovranità massima

Apertus

EPFL · ETH Zurigo · CSCS (Svizzera)

Interamente aperto
Dimensioni
8B · 70B
Hardware
8B → workstation · 70B → nodo

L'LLM sovrano della Svizzera — l'unica base qui a pubblicare i propri dati di addestramento e la ricetta, non solo i pesi. Multilingue per costruzione, incluso lo svizzero-tedesco e il romancio.

Ideale per: Settore pubblico, Q&A regolamentato, traduzione — ovunque la verificabilità completa sia il requisito

Prestazioni & velocità: Forte sui compiti ristretti ottimizzati e sulle lingue nazionali svizzere; dietro ai maggiori modelli internazionali sul lavoro generale aperto

+ Punto di forza
Tracciabilità completa dei dati, ispezionabile da un auditor; origine e giurisdizione svizzere

△ Compromesso
Ecosistema più giovane e meno dimensioni rispetto agli operatori affermati

Europa — con base UE, pesi aperti

Mistral

Mistral AI (Francia)

Pesi aperti
Dimensioni
8B · ~24B · più grande
Hardware
8B → workstation · 24B → singola GPU 24–48 GB

Famiglia francese aperta ed efficiente, con release permissive (Apache-2.0) e forte copertura delle lingue europee.

Ideale per: Lavoro documentale multilingue UE, redazione e riassunto con budget hardware ristretto

Prestazioni & velocità: Eccellente capacità per parametro; frequente vincitrice di valutazione sui compiti multilingue europei

+ Punto di forza
Con base UE, licenze permissive, prestazioni molto forti per la dimensione

△ Compromesso
Dati di addestramento non pubblicati; i livelli più grandi non sono tutti aperti

Teuken · EuroLLM

OpenGPT-X / consorzi UE (Europa)

Aperto · finanziato dall'UE
Dimensioni
7B · 9B
Hardware
→ workstation

Modelli europei finanziati con fondi pubblici, addestrati per un'ampia copertura delle lingue UE — tutte le 24 lingue ufficiali — con documentazione insolitamente aperta.

Ideale per: Deployment sovrani UE che vogliono una provenienza di ricerca pubblica europea e ampia copertura linguistica

Prestazioni & velocità: Copertura multilingue solida a piccola dimensione; ecosistema più ridotto e meno checkpoint ottimizzati di Mistral

+ Punto di forza
Provenienza dalla ricerca pubblica europea; ampia copertura delle lingue ufficiali

△ Compromesso
Più piccolo e meno collaudato dei leader di mercato

Internazionale — migliore performance aperta

Llama

Meta (USA)

Pesi aperti · licenza community
Dimensioni
8B · 70B · più grande
Hardware
8B → workstation · 70B → nodo

La famiglia aperta di Meta — il tooling e l'ecosistema community più maturi di qualsiasi modello aperto.

Ideale per: Baseline generaliste e tooling agentico dove conta la maturità dell'ecosistema

Prestazioni & velocità: Forte capacità generale su tutte le dimensioni; un contendente di valutazione affidabile

+ Punto di forza
Ecosistema, tooling e supporto all'ottimizzazione impareggiabili

△ Compromesso
Origine USA; una licenza community con restrizioni d'uso; dati di addestramento non pubblici

Qwen

Alibaba (Cina)

Pesi aperti (Apache-2.0)
Dimensioni
7B–72B dense · 235B MoE
Hardware
8B → workstation · 32B → singola GPU · 72B / MoE → nodo

Tra i modelli aperti più forti su ragionamento, codice e lavoro multilingue, con la più ampia gamma di dimensioni — incluse mixture-of-experts efficienti in memoria.

Ideale per: I compiti aperti più esigenti dove la capacità è prioritaria e la policy lo consente

Prestazioni & velocità: Livello aperto di frontiera sui benchmark di ragionamento e multilingue; le varianti MoE girano più velocemente di un modello dense della stessa dimensione totale

+ Punto di forza
Migliore performance aperta, licenze permissive, una dimensione per ogni budget hardware

△ Compromesso
Origine cinese — alcune policy di approvvigionamento pubbliche svizzere ed europee la escludono; dati di addestramento non pubblici

Gemma

Google (USA)

Pesi aperti
Dimensioni
2B · 9B · 27B
Hardware
→ workstation (tutte le dimensioni)

La famiglia aperta compatta di Google, calibrata per alta qualità alle piccole e medie dimensioni che stanno su una singola GPU.

Ideale per: Carichi mono-GPU e all'edge sensibili alla latenza

Prestazioni & velocità: Qualità per parametro competitiva nella fascia piccola e media

+ Punto di forza
Piccolo, veloce, facile da eseguire su hardware modesto

△ Compromesso
Origine USA; limitato a 27B; dati di addestramento non pubblici

Dimensionare l'hardware dietro tutto questo è una disciplina a sé — vedi la quantizzazione per come un 70B sta in ~40 GB e un 8B in meno di 5 GB, e il runtime sovrano per le forme di deployment.

L'economia

Un ordine di grandezza più economico da eseguire — e più veloce.

I modelli piccoli non rientrano solo nel vostro perimetro di conformità. Rientrano nel vostro budget — in franchi e in millisecondi.

Costo di servizio: eseguire un modello 7–8B costa all'incirca un ordine di grandezza in meno rispetto a un modello di classe 70B — la differenza tra una GPU di classe workstation e un nodo multi-GPU, tra un ordine d'acquisto e un ciclo di approvvigionamento.

Latenza: ogni chiamata a un'API cloud paga una tassa di andata e ritorno — salti di rete, TLS, attesa dietro altri tenant — prima ancora che i vostri token raggiungano una GPU; i primi token arrivano abitualmente solo dopo diverse centinaia di millisecondi. Un modello piccolo nel vostro rack evita del tutto questa tassa, e il suo prefill e decode più rapidi si aggiungono — è ciò che rende istantanei le pipeline documentali ad alto volume e gli assistenti interattivi.

Il moltiplicatore di sovranità: ogni parametro di cui non avete bisogno è conformità che non dovete acquistare. Un modello piccolo specializzato per compito gira su una sola macchina — la forma workstation nel runtime sovrano — il che apre i deployment air-gapped e all'edge (reparto produttivo, clinica, servizio sul campo) dove le piattaforme gestite e le API statunitensi non possono strutturalmente seguire.

I limiti

Quando un modello piccolo è la scelta sbagliata.

Un esperto che non vi dice quando il suo strumento preferito perde non è un esperto. I modelli piccoli perdono qui:

Assistenza aperta

«Rispondi a tutto su tutto» premia la scala. Se vi serve un assistente di conversazione generale su conoscenza pubblica, un modello di frontiera se la cava meglio.

Ampia conoscenza del mondo

I modelli piccoli sanno di meno. Il retrieval colma il divario solo dove il vostro corpus ha la risposta — non può recuperare ciò che nessuno ha scritto.

Ragionamento profondo a più passaggi

Le lunghe catene di ragionamento inedito favoriscono ancora i modelli più grandi. Il volume di routine va al piccolo; la coda difficile scala a un modello locale più grande.

Lavoro non sensibile e a basso volume

Se i dati possono uscire e il volume è trascurabile, un abbonamento API è più semplice. Ve lo diremo nella call di definizione del perimetro.

La linea di demarcazione non è un'opinione — è il set di valutazione. Per questo ogni ingaggio inizia costruendone uno: consegna guidata dalla valutazione.

FAQ

Domande sui modelli piccoli.

Un modello 8B è davvero abbastanza buono per testi giuridici o clinici in tedesco?
Per un compito definito, di solito sì — ma non vi chiediamo mai di crederci sulla parola. Ogni ingaggio inizia costruendo un set di valutazione dai vostri documenti e misurando modello di base, RAG, ottimizzazione e la combinazione rispetto ad esso. Se il modello piccolo non supera l'asticella concordata in anticipo, lo vedete nel rapporto prima di spendere per la produzione. L'Apertus-8B ottimizzato del Cantone Ticino esegue la traduzione cantonale in produzione con il 94 % di accuratezza — lo schema è reale, ma è la valutazione a decidere per il vostro compito.
Potete usare una base non svizzera come Mistral o Qwen — e l'EU AI Act lo consente?
Sì. Apertus è la nostra scelta predefinita perché è interamente svizzero e l'unica base a pubblicare i propri dati di addestramento — ma se la vostra policy lo consente, un modello europeo come Mistral o internazionale come Qwen può entrare nella valutazione ed essere consegnato se vince, girando sempre sulla vostra infrastruttura con pesi che vi appartengono. Sull'AI Act nello specifico: classifica i sistemi in base al rischio d'uso e impone doveri di trasparenza al fornitore del modello — non limita un modello di base in base al paese d'origine. Il vero vincolo è di solito la vostra policy di approvvigionamento e governance dei dati, che inquadriamo con voi. Non è consulenza legale — lavoriamo insieme ai vostri team di conformità e legale.
E il lavoro a forte carico di ragionamento?
Il ragionamento profondo a più passaggi su domande aperte è l'ambito in cui la dimensione del modello paga ancora. La nostra risposta è architetturale, non ideologica — un modello piccolo gestisce il volume di routine, e le richieste che non può gestire con sicurezza scalano a un modello aperto più grande in esecuzione sulla stessa infrastruttura. Nulla scala verso un'API cloud. La pagina del runtime sovrano descrive come funziona questo router.
L'ottimizzazione non diventa obsoleta ogni volta che esce un modello di base migliore?
Gli asset costosi sopravvivono ai cambi di modello. Il vostro set di valutazione, i vostri dati di addestramento curati e il vostro corpus di retrieval si trasferiscono tutti invariati; rieseguire un'ottimizzazione LoRA su un modello di base più recente è questione di giorni, non una ricostruzione. È anche per questo che restiamo agnostici rispetto al modello — Apertus, Mistral, Llama o Qwen, quello che vince sul vostro set di valutazione all'interno del livello che la vostra conformità consente.

Un modello piccolo supererebbe la vostra asticella?

Un workflow, i vostri documenti, il nostro harness. Costruiremo il set di valutazione e vi mostreremo l'ablazione — nella vostra giurisdizione.