Vai al contenuto

Demo dal vivo · inferenza sul dispositivo

Un modello funzionante, in esecuzione dentro questa pagina.

Qui sotto, un modello linguistico da 1,7 miliardi di parametri smista messaggi di supporto — categoria, urgenza, riassunto di una riga — calcolati sulla vostra GPU, in questa scheda del browser. Nessuna API, nessun server, nessun dato in uscita. È la forma più estrema dell'argomento che questo sito sostiene: modelli che girano dove risiedono i dati.

Perché è importante

L'obiezione all'IA sovrana è la capacità. La risposta è il perimetro.

Le organizzazioni regolamentate non possono inviare i dati dei clienti ad API di IA di terzi — il segreto bancario, il segreto medico e le regole degli appalti dicono tutti la stessa cosa. La controargomentazione abituale è che tutto ciò che potete eseguire in proprio è troppo debole per essere utile. È vero, se vi aspettate che un solo modello faccia tutto.

Smette di essere vero quando il compito è ristretto. Un modello piccolo con un solo compito ben definito — classificare questo messaggio, estrarre questi campi, redigere questa risposta standard — può essere valutato, reso deterministico ed eseguito su hardware che controllate. La quantizzazione lo riduce finché «hardware che controllate» può significare una workstation, un telefono — o, come qui, una scheda del browser.

Questa pagina è la prova concreta: un modello reale con un compito reale, e un'impronta di rete di 0 byte per tutto ciò che digitate.

Il caso d'uso

Triage del supporto: un compito ristretto canonico.

Ogni organizzazione di servizi ha una casella in entrata: reclami, segnalazioni di guasti, domande commerciali, reset di password. Qualcuno — o qualcosa — legge ogni messaggio e decide di cosa si tratta e quanto è urgente prima che qualcuno intervenga. Quella decisione è perfetta per un modello piccolo: l'input è un messaggio, l'output è un insieme chiuso di etichette più un riassunto di una riga, e ogni risposta è verificabile.

La demo qui sotto fa esattamente questo. Incollate un messaggio (o usate un esempio) e il modello restituisce Categoria · Urgenza · Riassunto. Ogni messaggio viene smistato in modo indipendente — nessuna cronologia, nessuna deriva. Passate alla scheda Chat per parlare liberamente con lo stesso modello e calibrare le vostre aspettative su cosa possono e non possono fare 1,7 miliardi di parametri a 1 bit.

In un progetto cliente è qui che il lavoro inizia, non finisce: la tassonomia diventa quella delle vostre categorie, il modello viene ottimizzato sui vostri messaggi etichettati, e un harness di valutazione lo misura rispetto alla vostra asticella prima che tocchi la produzione — lo stesso metodo delle nostre ablazioni pubblicate.

Gira interamente in questa scheda su WebGPU. Il primo avvio scarica il modello — ~237 MB, una sola volta — poi resta nella cache e funziona offline. Consigliato Chrome o Edge desktop con una GPU.

Download del modello da huggingface.co · i vostri messaggi non lasciano mai questo dispositivo · versione standalone ↗

Cosa sta girando

Bonsai-1.7B — un modello aperto a 1 bit.

Bonsai-1.7B è un modello aperto di Prism ML (Apache-2.0): derivato da Qwen3-1.7B e addestrato end-to-end per pesi a 1 bit. Il motore WebGPU — kernel di calcolo scritti a mano che decodificano i pesi impacchettati sulla vostra GPU — è stato pubblicato dalla webml-community per il modello di punta da 27B (MIT); noi lo abbiamo portato sull'architettura qwen3 semplice dell'1.7B per questa pagina. È un dimostratore indipendente, non uno dei nostri fine-tune di Apertus.

1.125
Bit per peso

Q1_0: bit di segno impacchettati + scale di gruppo FP16 — circa 14 volte più piccolo dello stesso modello in FP16

0.24 GB
Download una tantum

Nella cache del browser dopo il primo caricamento; da lì in poi funziona offline

32k
Finestra di contesto in token

L'intera lunghezza di contesto di Qwen3-1.7B, eseguita sulla vostra GPU

0
Byte di dati in uscita

I pesi arrivano da Hugging Face; nulla di ciò che digitate va da nessuna parte

Dalla demo alla produzione

Lo schema è il prodotto.

Quello che avete appena usato è uno schema: un modello piccolo, delimitato sul compito, quantizzato per stare nell'hardware che avete davvero, in esecuzione dove risiedono i dati. Nei progetti per i clienti applichiamo lo stesso schema con ingredienti diversi — Apertus, il modello aperto svizzero, ottimizzato sui vostri dati, distribuito nella vostra giurisdizione e tenuto a un'asticella di valutazione concordata prima dell'inizio del progetto.

Se la vostra organizzazione ha una casella in entrata, un flusso di documenti o una pipeline di moduli che oggi le persone smistano a mano, di solito è quello il primo progetto giusto: ristretto, misurabile e sovrano dal primo giorno.

Domande

I dettagli che contano.

Qualcosa di ciò che digito lascia il mio browser?
No. I pesi del modello vengono scaricati una sola volta da Hugging Face e memorizzati nella cache del browser; da quel momento, tutto il calcolo avviene sulla vostra GPU tramite WebGPU. I vostri messaggi non vengono mai inviati ad alcun server — non c'è alcun server.
Perché il modello pesa solo 0,24 GB?
Bonsai-1.7B memorizza i suoi pesi a circa 1,125 bit ciascuno (bit di segno impacchettati più piccole scale di gruppo) invece di 16 bit — circa 14 volte più piccolo dello stesso modello in FP16. La quantizzazione estrema è una delle leve che rendono sostenibile il deployment sovrano e on-premise; la nostra pagina di concetto sulla quantizzazione ne illustra i compromessi.
È questo il modello che sysf.io distribuisce ai clienti?
No — Bonsai-1.7B è un modello aperto indipendente di Prism ML, usato qui unicamente per dimostrare l'inferenza sul dispositivo. I sistemi dei clienti sono costruiti su Apertus, ottimizzato sui vostri dati e valutato sul vostro compito; lo schema è lo stesso, il modello è vostro.
Di cosa ho bisogno per eseguirlo?
Un browser desktop con WebGPU (Chrome o Edge recenti) e una GPU. Il primo avvio scarica ~237 MB, una sola volta. Se WebGPU non è disponibile la pagina lo segnala — nulla si rompe.

Definite il vostro primo compito ristretto.

Una call di 30 minuti per definire il perimetro — vi diremo onestamente se un modello piccolo, ottimizzato sul compito, fa al caso vostro.