Demo dal vivo · inferenza sul dispositivo
Un modello funzionante, in esecuzione dentro questa pagina.
Qui sotto, un modello linguistico da 1,7 miliardi di parametri smista messaggi di supporto — categoria, urgenza, riassunto di una riga — calcolati sulla vostra GPU, in questa scheda del browser. Nessuna API, nessun server, nessun dato in uscita. È la forma più estrema dell'argomento che questo sito sostiene: modelli che girano dove risiedono i dati.
Perché è importante
L'obiezione all'IA sovrana è la capacità. La risposta è il perimetro.
Le organizzazioni regolamentate non possono inviare i dati dei clienti ad API di IA di terzi — il segreto bancario, il segreto medico e le regole degli appalti dicono tutti la stessa cosa. La controargomentazione abituale è che tutto ciò che potete eseguire in proprio è troppo debole per essere utile. È vero, se vi aspettate che un solo modello faccia tutto.
Smette di essere vero quando il compito è ristretto. Un modello piccolo con un solo compito ben definito — classificare questo messaggio, estrarre questi campi, redigere questa risposta standard — può essere valutato, reso deterministico ed eseguito su hardware che controllate. La quantizzazione lo riduce finché «hardware che controllate» può significare una workstation, un telefono — o, come qui, una scheda del browser.
Questa pagina è la prova concreta: un modello reale con un compito reale, e un'impronta di rete di 0 byte per tutto ciò che digitate.
Il caso d'uso
Triage del supporto: un compito ristretto canonico.
Ogni organizzazione di servizi ha una casella in entrata: reclami, segnalazioni di guasti, domande commerciali, reset di password. Qualcuno — o qualcosa — legge ogni messaggio e decide di cosa si tratta e quanto è urgente prima che qualcuno intervenga. Quella decisione è perfetta per un modello piccolo: l'input è un messaggio, l'output è un insieme chiuso di etichette più un riassunto di una riga, e ogni risposta è verificabile.
La demo qui sotto fa esattamente questo. Incollate un messaggio (o usate un esempio) e il modello restituisce Categoria · Urgenza · Riassunto. Ogni messaggio viene smistato in modo indipendente — nessuna cronologia, nessuna deriva. Passate alla scheda Chat per parlare liberamente con lo stesso modello e calibrare le vostre aspettative su cosa possono e non possono fare 1,7 miliardi di parametri a 1 bit.
In un progetto cliente è qui che il lavoro inizia, non finisce: la tassonomia diventa quella delle vostre categorie, il modello viene ottimizzato sui vostri messaggi etichettati, e un harness di valutazione lo misura rispetto alla vostra asticella prima che tocchi la produzione — lo stesso metodo delle nostre ablazioni pubblicate.
Gira interamente in questa scheda su WebGPU. Il primo avvio scarica il modello — ~237 MB, una sola volta — poi resta nella cache e funziona offline. Consigliato Chrome o Edge desktop con una GPU.
Download del modello da huggingface.co · i vostri messaggi non lasciano mai questo dispositivo · versione standalone ↗
Cosa sta girando
Bonsai-1.7B — un modello aperto a 1 bit.
Bonsai-1.7B è un modello aperto di Prism ML (Apache-2.0): derivato da Qwen3-1.7B e addestrato end-to-end per pesi a 1 bit. Il motore WebGPU — kernel di calcolo scritti a mano che decodificano i pesi impacchettati sulla vostra GPU — è stato pubblicato dalla webml-community per il modello di punta da 27B (MIT); noi lo abbiamo portato sull'architettura qwen3 semplice dell'1.7B per questa pagina. È un dimostratore indipendente, non uno dei nostri fine-tune di Apertus.
- 1.125
- Bit per peso
- 0.24 GB
- Download una tantum
- 32k
- Finestra di contesto in token
- 0
- Byte di dati in uscita
Q1_0: bit di segno impacchettati + scale di gruppo FP16 — circa 14 volte più piccolo dello stesso modello in FP16
Nella cache del browser dopo il primo caricamento; da lì in poi funziona offline
L'intera lunghezza di contesto di Qwen3-1.7B, eseguita sulla vostra GPU
I pesi arrivano da Hugging Face; nulla di ciò che digitate va da nessuna parte
Dalla demo alla produzione
Lo schema è il prodotto.
Quello che avete appena usato è uno schema: un modello piccolo, delimitato sul compito, quantizzato per stare nell'hardware che avete davvero, in esecuzione dove risiedono i dati. Nei progetti per i clienti applichiamo lo stesso schema con ingredienti diversi — Apertus, il modello aperto svizzero, ottimizzato sui vostri dati, distribuito nella vostra giurisdizione e tenuto a un'asticella di valutazione concordata prima dell'inizio del progetto.
Se la vostra organizzazione ha una casella in entrata, un flusso di documenti o una pipeline di moduli che oggi le persone smistano a mano, di solito è quello il primo progetto giusto: ristretto, misurabile e sovrano dal primo giorno.
Domande
I dettagli che contano.
Qualcosa di ciò che digito lascia il mio browser?
Perché il modello pesa solo 0,24 GB?
È questo il modello che sysf.io distribuisce ai clienti?
Di cosa ho bisogno per eseguirlo?
Definite il vostro primo compito ristretto.
Una call di 30 minuti per definire il perimetro — vi diremo onestamente se un modello piccolo, ottimizzato sul compito, fa al caso vostro.