Concetti · Runtime sovrano
Da una workstation a un air gap completo.
«Gira dove risiedono i vostri dati» è un'affermazione su hardware, reti e confini di fiducia. Ecco le forme di deployment reali — e lo schema di routing che mantiene veloci i modelli piccoli senza mai chiamare un cloud.
Le forme
Tre involucri di deployment, un principio.
Ogni forma mantiene dati, modello e orchestrazione all'interno di un unico confine di fiducia che controllate. Differiscono per dove si trova quel confine.
Classe workstation
4–8B specializzato per compito, quantizzato
Un server GPU nel vostro rack — o un armadio con serratura nel vostro ufficio. Esegue un modello piccolo ottimizzato con retrieval a velocità interattiva per un team o una pipeline documentale. È la forma che rende l'IA sovrana una voce di budget anziché un progetto.
Classe nodo
Classe 70B, o più modelli
Un server multi-GPU nel vostro data center o nel vostro cloud svizzero. Esegue modelli più grandi, più carichi di lavoro concorrenti, e il livello di escalation del router qui sotto. La forma per i rollout a livello di organizzazione.
Air-gapped / confidenziale
Qualsiasi dimensione, massima isolazione
O infrastruttura fisicamente scollegata con runbook di aggiornamento offline, o VM di confidential computing con attestazione remota — memoria cifrata con chiavi che l'operatore non detiene mai. Dettaglio a livello di chip nelle FAQ qui sotto.
Ciò che rende possibile la forma workstation è una quantizzazione aggressiva e verificata dalla valutazione.
Lo schema
Prima il piccolo, escalation locale.
L'architettura di routing che cattura l'economia dei modelli piccoli senza rinunciare alla coda difficile — né alla sovranità.
-
01
Il modello piccolo vede ogni richiesta per primo
Il 4–8B specializzato per compito risponde per primo — veloce, economico, sulla forma classe workstation. Per un workflow ben definito, è la stragrande maggioranza del volume.
-
02
Un router sorveglia i problemi
Le violazioni di schema e le chiamate di strumenti fallite sono trigger inequivocabili. I segnali di confidenza e fuori distribuzione sono più difficili — li calibriamo per compito rispetto al vostro set di valutazione, e la soglia di escalation è un compromesso misurato, non un default di cui ci fidiamo ciecamente.
-
03
L'escalation va a un modello locale più grande
Le richieste segnalate vengono rieseguite sul livello classe nodo: un modello aperto più grande sulla vostra infrastruttura. La versione cloud di questo schema scala verso un'API statunitense — la nostra mai. Sui deployment solo workstation, le richieste segnalate vengono invece instradate a una coda di revisione umana: un sistema piccolo che sa quando passare la mano batte uno grande che non lo fa mai.
-
04
Tutto viene registrato e rivalutato
I tassi di escalation e gli esiti alimentano il ciclo di valutazione: un tasso crescente significa che il compito è derivato o che il modello piccolo ha bisogno di un aggiornamento — visibile nelle metriche settimane prima che gli utenti se ne accorgano.
Il confine
La fuoriuscita nulla è una proprietà di progettazione, non una promessa.
Non dovreste dover credere sulla parola a un fornitore per «nulla esce». Dovreste poterlo verificare al firewall.
Il runtime è containerizzato e autosufficiente: pesi del modello, indice di retrieval, orchestrazione e monitoraggio girano tutti all'interno del vostro segmento di rete. Nessun componente chiama verso l'esterno — nessuna telemetria, nessun ping di licenza, nessuna «statistica d'uso anonima». Le vostre regole del firewall possono dire deny all egress, e il sistema continua a funzionare. Questo è il test, e potete eseguirlo voi stessi.
Anche il monitoraggio resta all'interno: dashboard, log e punteggi di valutazione sono serviti localmente, e la conservazione dei log segue la vostra policy — i log di inferenza contengono i vostri dati. Lo stack di tracing self-hosted alla base di ciò è sulla pagina dell'orchestrazione.
Sulle forme workstation e air-gapped, questa è anche una demo che ci piace fare: staccate il cavo di rete, continuate a lavorare.
FAQ
Domande sul runtime.
Quanto costa davvero l'hardware?
Cos'è il confidential computing, concretamente?
Come ricevono aggiornamenti i sistemi air-gapped?
Quale forma si adatta ai vostri vincoli?
Descrivete i vostri vincoli di data governance nella call di definizione del perimetro — li mapperemo a una forma di deployment e metteremo dimensionamento e throughput nella proposta.