Concetti · Modelli piccoli
Modelli piccoli, misurati.
Due domande decidono un build sovrano: quanto grande deve essere il modello per il compito e da quale base partite. Questa pagina risponde a entrambe — capacità rispetto alla dimensione, cosa sa fare davvero ogni classe di dimensione, e lo spettro dall'Apertus interamente svizzero ai modelli aperti europei e internazionali — limiti onesti e inquadramento di conformità inclusi.
Dimensione
Quanto modello serve al compito?
La capacità cresce con la dimensione — ma si appiattisce, e i rendimenti diventano presto costosi. La maggior parte del lavoro regolamentato non vive alla frontiera; vive nelle bande che un modello piccolo raggiunge.
La dimensione di un modello si misura in parametri — da ~1B fino a oltre 200B. Più parametri comprano conoscenza più ampia e ragionamento più profondo, ma la curva si piega: il salto da 1B a 8B è trasformativo, da 8B a 70B è reale ma costoso, e oltre pagate molto per poco sulla maggior parte dei compiti.
Il trucco: la dimensione necessaria la fissa il compito, non l'ambizione. Estrazione, classificazione, instradamento e redazione strutturata vivono nelle bande basse — il terreno di casa di un modello piccolo. E la freccia rossa qui sotto è tutto il punto di questa pagina: ottimizzare un modello piccolo su un compito ristretto solleva la sua capacità effettiva nella banda superiore, così un 8B ottimizzato batte un generalista molto più grande sul lavoro che eseguite davvero.
L'effetto
La specializzazione batte la scala sui compiti ristretti.
I benchmark generali premiano l'ampiezza. Il vostro workflow premia la profondità — i vostri modelli, la vostra terminologia, i vostri formati, i vostri casi limite.
Pronto all'uso, un modello piccolo generico è un generalista che per caso parla la vostra lingua. Ottimizzato su qualche migliaio di esempi del vostro compito, diventa uno specialista che ha letto il vostro corpus. Quanto valga dipende da dove parte il modello di base — esattamente ciò che l'ablazione in ogni Pilot misura, sui vostri documenti, prima che vi impegniate.
Il punto di riferimento pubblico in Svizzera: il servizio di traduzione del Cantone Ticino è passato dal 90 % al 94 % di accuratezza dopo l'ottimizzazione di Apertus-8B su dati cantonali, eseguito interamente su infrastruttura cantonale. Quattro punti in cima alla scala — in un servizio in produzione, la differenza tra controllare l'output a campione e rifarlo.
Un'API di frontiera ha due svantaggi strutturali su questo terreno: non ha mai visto i vostri documenti, e non potrà mai — perché sono i documenti che non potete cedere. Il vantaggio del modello piccolo non è l'intelligenza. È l'accesso.
Il metodo
L'ottimizzazione insegna il comportamento. Il retrieval fornisce i fatti.
I due vengono regolarmente confusi — e questa confusione è dove i progetti di IA falliscono.
Ottimizzazione
Insegna il compito: la vostra terminologia, i formati dei documenti, il tono, la struttura di output, il comportamento di rifiuto. Non memorizza i fatti in modo affidabile — usarla come archivio di conoscenza è un errore di progettazione che ci rifiutiamo di consegnare.
Retrieval (RAG)
Fornisce i fatti: la versione attuale delle vostre policy, contratti e archivi, citati fino alla pagina di origine. La conoscenza si aggiorna nel momento in cui lo fa il documento — nessun riaddestramento.
L'ablazione
Ogni Pilot valuta tutti e quattro i bracci — base, retrieval, ottimizzazione, combinato — sul vostro set di valutazione. La tabella dice quale sistema vale la pena acquistare.
Misurata, la divisione è netta: nella nostra ablazione FINMA, la sola ottimizzazione ha portato la conformità di formato da ~2 % a 100 % lasciando però l'accuratezza risposta-più-citazione all'1,6 % — comportamento appreso, fatti no. Solo retrieval: 22,4 %. Combinato: 45,4 %.
La base
Interamente svizzero, o flessibile quanto la vostra conformità consente.
Apertus è la nostra scelta predefinita — l'LLM interamente aperto e interamente trasparente della Svizzera. Ma la sovranità non è solo svizzera. Dove la vostra policy lo consente, una base aperta europea o internazionale può vincere la vostra valutazione e girare comunque interamente sulla vostra infrastruttura.
Interamente svizzero
Sovrano e interamente trasparente
Apertus
Pesi aperti e dati di addestramento aperti, origine svizzera. La scelta quando ogni strato deve essere verificabile — settore pubblico, o le posture di conformità più rigorose.
Europeo
Con base UE, pesi aperti
Mistral · Teuken · EuroLLM
Fornitori europei, pesi aperti, forte copertura delle lingue UE. La provenienza resta in Europa; i dati di addestramento di solito non sono pubblicati.
Internazionale
Migliore performance aperta
Llama · Qwen · Gemma
I modelli aperti più forti indipendentemente dall'origine. Massima capacità ed ecosistema — il compromesso è la trasparenza dei dati di addestramento e, per alcuni, il paese d'origine.
L'EU AI Act consente un modello come Qwen?
In breve: il regolamento classifica in base al rischio d'uso e impone obblighi di trasparenza al fornitore di un modello per finalità generali — non limita un modello di base in base al paese d'origine. Eseguire un modello aperto sulla vostra infrastruttura mantiene i vostri dati nella vostra giurisdizione, indipendentemente da dove i pesi sono stati addestrati.
Ciò che può escludere un modello è la vostra stessa policy di approvvigionamento o governance dei dati: diversi enti pubblici svizzeri ed europei limitano la tecnologia di origine cinese per policy interna, non per il regolamento. È una decisione che inquadriamo con voi — ed è esattamente per questo che esiste l'opzione interamente svizzera. Non è consulenza legale; lavoriamo insieme ai vostri team di conformità e legale.
Il catalogo
I modelli di base su cui costruiamo.
Una shortlist di lavoro, raggruppata per origine. Dimensioni e hardware sono fatti; prestazioni e velocità sono qualitative — la classifica vera viene sempre dalla valutazione sul vostro compito.
Svizzera — sovranità massima
Apertus
EPFL · ETH Zurigo · CSCS (Svizzera)
- Dimensioni
- 8B · 70B
- Hardware
- 8B → workstation · 70B → nodo
L'LLM sovrano della Svizzera — l'unica base qui a pubblicare i propri dati di addestramento e la ricetta, non solo i pesi. Multilingue per costruzione, incluso lo svizzero-tedesco e il romancio.
Ideale per: Settore pubblico, Q&A regolamentato, traduzione — ovunque la verificabilità completa sia il requisito
Prestazioni & velocità: Forte sui compiti ristretti ottimizzati e sulle lingue nazionali svizzere; dietro ai maggiori modelli internazionali sul lavoro generale aperto
+ Punto di forza
Tracciabilità completa dei dati, ispezionabile da un auditor; origine e giurisdizione svizzere
△ Compromesso
Ecosistema più giovane e meno dimensioni rispetto agli operatori affermati
Europa — con base UE, pesi aperti
Mistral
Mistral AI (Francia)
- Dimensioni
- 8B · ~24B · più grande
- Hardware
- 8B → workstation · 24B → singola GPU 24–48 GB
Famiglia francese aperta ed efficiente, con release permissive (Apache-2.0) e forte copertura delle lingue europee.
Ideale per: Lavoro documentale multilingue UE, redazione e riassunto con budget hardware ristretto
Prestazioni & velocità: Eccellente capacità per parametro; frequente vincitrice di valutazione sui compiti multilingue europei
+ Punto di forza
Con base UE, licenze permissive, prestazioni molto forti per la dimensione
△ Compromesso
Dati di addestramento non pubblicati; i livelli più grandi non sono tutti aperti
Teuken · EuroLLM
OpenGPT-X / consorzi UE (Europa)
- Dimensioni
- 7B · 9B
- Hardware
- → workstation
Modelli europei finanziati con fondi pubblici, addestrati per un'ampia copertura delle lingue UE — tutte le 24 lingue ufficiali — con documentazione insolitamente aperta.
Ideale per: Deployment sovrani UE che vogliono una provenienza di ricerca pubblica europea e ampia copertura linguistica
Prestazioni & velocità: Copertura multilingue solida a piccola dimensione; ecosistema più ridotto e meno checkpoint ottimizzati di Mistral
+ Punto di forza
Provenienza dalla ricerca pubblica europea; ampia copertura delle lingue ufficiali
△ Compromesso
Più piccolo e meno collaudato dei leader di mercato
Internazionale — migliore performance aperta
Llama
Meta (USA)
- Dimensioni
- 8B · 70B · più grande
- Hardware
- 8B → workstation · 70B → nodo
La famiglia aperta di Meta — il tooling e l'ecosistema community più maturi di qualsiasi modello aperto.
Ideale per: Baseline generaliste e tooling agentico dove conta la maturità dell'ecosistema
Prestazioni & velocità: Forte capacità generale su tutte le dimensioni; un contendente di valutazione affidabile
+ Punto di forza
Ecosistema, tooling e supporto all'ottimizzazione impareggiabili
△ Compromesso
Origine USA; una licenza community con restrizioni d'uso; dati di addestramento non pubblici
Qwen
Alibaba (Cina)
- Dimensioni
- 7B–72B dense · 235B MoE
- Hardware
- 8B → workstation · 32B → singola GPU · 72B / MoE → nodo
Tra i modelli aperti più forti su ragionamento, codice e lavoro multilingue, con la più ampia gamma di dimensioni — incluse mixture-of-experts efficienti in memoria.
Ideale per: I compiti aperti più esigenti dove la capacità è prioritaria e la policy lo consente
Prestazioni & velocità: Livello aperto di frontiera sui benchmark di ragionamento e multilingue; le varianti MoE girano più velocemente di un modello dense della stessa dimensione totale
+ Punto di forza
Migliore performance aperta, licenze permissive, una dimensione per ogni budget hardware
△ Compromesso
Origine cinese — alcune policy di approvvigionamento pubbliche svizzere ed europee la escludono; dati di addestramento non pubblici
Gemma
Google (USA)
- Dimensioni
- 2B · 9B · 27B
- Hardware
- → workstation (tutte le dimensioni)
La famiglia aperta compatta di Google, calibrata per alta qualità alle piccole e medie dimensioni che stanno su una singola GPU.
Ideale per: Carichi mono-GPU e all'edge sensibili alla latenza
Prestazioni & velocità: Qualità per parametro competitiva nella fascia piccola e media
+ Punto di forza
Piccolo, veloce, facile da eseguire su hardware modesto
△ Compromesso
Origine USA; limitato a 27B; dati di addestramento non pubblici
Dimensionare l'hardware dietro tutto questo è una disciplina a sé — vedi la quantizzazione per come un 70B sta in ~40 GB e un 8B in meno di 5 GB, e il runtime sovrano per le forme di deployment.
L'economia
Un ordine di grandezza più economico da eseguire — e più veloce.
I modelli piccoli non rientrano solo nel vostro perimetro di conformità. Rientrano nel vostro budget — in franchi e in millisecondi.
Costo di servizio: eseguire un modello 7–8B costa all'incirca un ordine di grandezza in meno rispetto a un modello di classe 70B — la differenza tra una GPU di classe workstation e un nodo multi-GPU, tra un ordine d'acquisto e un ciclo di approvvigionamento.
Latenza: ogni chiamata a un'API cloud paga una tassa di andata e ritorno — salti di rete, TLS, attesa dietro altri tenant — prima ancora che i vostri token raggiungano una GPU; i primi token arrivano abitualmente solo dopo diverse centinaia di millisecondi. Un modello piccolo nel vostro rack evita del tutto questa tassa, e il suo prefill e decode più rapidi si aggiungono — è ciò che rende istantanei le pipeline documentali ad alto volume e gli assistenti interattivi.
Il moltiplicatore di sovranità: ogni parametro di cui non avete bisogno è conformità che non dovete acquistare. Un modello piccolo specializzato per compito gira su una sola macchina — la forma workstation nel runtime sovrano — il che apre i deployment air-gapped e all'edge (reparto produttivo, clinica, servizio sul campo) dove le piattaforme gestite e le API statunitensi non possono strutturalmente seguire.
I limiti
Quando un modello piccolo è la scelta sbagliata.
Un esperto che non vi dice quando il suo strumento preferito perde non è un esperto. I modelli piccoli perdono qui:
Assistenza aperta
«Rispondi a tutto su tutto» premia la scala. Se vi serve un assistente di conversazione generale su conoscenza pubblica, un modello di frontiera se la cava meglio.
Ampia conoscenza del mondo
I modelli piccoli sanno di meno. Il retrieval colma il divario solo dove il vostro corpus ha la risposta — non può recuperare ciò che nessuno ha scritto.
Ragionamento profondo a più passaggi
Le lunghe catene di ragionamento inedito favoriscono ancora i modelli più grandi. Il volume di routine va al piccolo; la coda difficile scala a un modello locale più grande.
Lavoro non sensibile e a basso volume
Se i dati possono uscire e il volume è trascurabile, un abbonamento API è più semplice. Ve lo diremo nella call di definizione del perimetro.
La linea di demarcazione non è un'opinione — è il set di valutazione. Per questo ogni ingaggio inizia costruendone uno: consegna guidata dalla valutazione.
FAQ
Domande sui modelli piccoli.
Un modello 8B è davvero abbastanza buono per testi giuridici o clinici in tedesco?
Potete usare una base non svizzera come Mistral o Qwen — e l'EU AI Act lo consente?
E il lavoro a forte carico di ragionamento?
L'ottimizzazione non diventa obsoleta ogni volta che esce un modello di base migliore?
Un modello piccolo supererebbe la vostra asticella?
Un workflow, i vostri documenti, il nostro harness. Costruiremo il set di valutazione e vi mostreremo l'ablazione — nella vostra giurisdizione.