Vai al contenuto

Concetti · Runtime sovrano

Da una workstation a un air gap completo.

«Gira dove risiedono i vostri dati» è un'affermazione su hardware, reti e confini di fiducia. Ecco le forme di deployment reali — e lo schema di routing che mantiene veloci i modelli piccoli senza mai chiamare un cloud.

Le forme

Tre involucri di deployment, un principio.

Ogni forma mantiene dati, modello e orchestrazione all'interno di un unico confine di fiducia che controllate. Differiscono per dove si trova quel confine.

Classe workstation

4–8B specializzato per compito, quantizzato

Un server GPU nel vostro rack — o un armadio con serratura nel vostro ufficio. Esegue un modello piccolo ottimizzato con retrieval a velocità interattiva per un team o una pipeline documentale. È la forma che rende l'IA sovrana una voce di budget anziché un progetto.

Classe nodo

Classe 70B, o più modelli

Un server multi-GPU nel vostro data center o nel vostro cloud svizzero. Esegue modelli più grandi, più carichi di lavoro concorrenti, e il livello di escalation del router qui sotto. La forma per i rollout a livello di organizzazione.

Air-gapped / confidenziale

Qualsiasi dimensione, massima isolazione

O infrastruttura fisicamente scollegata con runbook di aggiornamento offline, o VM di confidential computing con attestazione remota — memoria cifrata con chiavi che l'operatore non detiene mai. Dettaglio a livello di chip nelle FAQ qui sotto.

Ciò che rende possibile la forma workstation è una quantizzazione aggressiva e verificata dalla valutazione.

Lo schema

Prima il piccolo, escalation locale.

L'architettura di routing che cattura l'economia dei modelli piccoli senza rinunciare alla coda difficile — né alla sovranità.

  1. 01
    Il modello piccolo vede ogni richiesta per primo

    Il 4–8B specializzato per compito risponde per primo — veloce, economico, sulla forma classe workstation. Per un workflow ben definito, è la stragrande maggioranza del volume.

  2. 02
    Un router sorveglia i problemi

    Le violazioni di schema e le chiamate di strumenti fallite sono trigger inequivocabili. I segnali di confidenza e fuori distribuzione sono più difficili — li calibriamo per compito rispetto al vostro set di valutazione, e la soglia di escalation è un compromesso misurato, non un default di cui ci fidiamo ciecamente.

  3. 03
    L'escalation va a un modello locale più grande

    Le richieste segnalate vengono rieseguite sul livello classe nodo: un modello aperto più grande sulla vostra infrastruttura. La versione cloud di questo schema scala verso un'API statunitense — la nostra mai. Sui deployment solo workstation, le richieste segnalate vengono invece instradate a una coda di revisione umana: un sistema piccolo che sa quando passare la mano batte uno grande che non lo fa mai.

  4. 04
    Tutto viene registrato e rivalutato

    I tassi di escalation e gli esiti alimentano il ciclo di valutazione: un tasso crescente significa che il compito è derivato o che il modello piccolo ha bisogno di un aggiornamento — visibile nelle metriche settimane prima che gli utenti se ne accorgano.

Il confine

La fuoriuscita nulla è una proprietà di progettazione, non una promessa.

Non dovreste dover credere sulla parola a un fornitore per «nulla esce». Dovreste poterlo verificare al firewall.

Il runtime è containerizzato e autosufficiente: pesi del modello, indice di retrieval, orchestrazione e monitoraggio girano tutti all'interno del vostro segmento di rete. Nessun componente chiama verso l'esterno — nessuna telemetria, nessun ping di licenza, nessuna «statistica d'uso anonima». Le vostre regole del firewall possono dire deny all egress, e il sistema continua a funzionare. Questo è il test, e potete eseguirlo voi stessi.

Anche il monitoraggio resta all'interno: dashboard, log e punteggi di valutazione sono serviti localmente, e la conservazione dei log segue la vostra policy — i log di inferenza contengono i vostri dati. Lo stack di tracing self-hosted alla base di ciò è sulla pagina dell'orchestrazione.

Sulle forme workstation e air-gapped, questa è anche una demo che ci piace fare: staccate il cavo di rete, continuate a lavorare.

FAQ

Domande sul runtime.

Quanto costa davvero l'hardware?
La forma workstation — un server mono-GPU che esegue un 4–8B specializzato per compito — è tipicamente una macchina da CHF 5'000–15'000 che risiede nel vostro rack esistente o in un armadio d'ufficio con serratura. La forma nodo per i modelli di classe 70B è un investimento a metà delle cinque cifre o un noleggio nel vostro cloud svizzero. Il dimensionamento esatto (e le cifre di throughput impegnate) fa parte di ogni proposta — e l'hardware del Pilot può essere il nostro, così la spesa in infrastruttura inizia solo dopo il superamento della valutazione.
Cos'è il confidential computing, concretamente?
Macchine virtuali cifrate a livello hardware — AMD SEV-SNP o Intel TDX — in cui la memoria è cifrata con chiavi che l'operatore cloud non detiene mai, e l'attestazione remota vi consente di verificare crittograficamente lo stato di avvio (firmware, immagine, configurazione) prima che qualsiasi dato entri. Significato pratico — potete noleggiare infrastruttura svizzera spostando al contempo il fornitore fuori dal confine di fiducia della riservatezza dei dati. Una riserva che solleviamo prima del vostro team di sicurezza — una enclave CPU da sola non copre la GPU dove l'inferenza viene effettivamente eseguita; estendere il confine all'acceleratore richiede GPU compatibili con il confidential computing (classe NVIDIA H100, con trasferimenti cifrati e attestazione GPU), e dimensioniamo esattamente per questo quando il modello di minaccia lo richiede.
Come ricevono aggiornamenti i sistemi air-gapped?
Deliberatamente e in modo verificabile — mai via cavo. Aggiornamenti del modello, ricostruzioni dell'indice di retrieval e patch software arrivano come pacchetti offline firmati e con checksum, in finestre di manutenzione pianificate, installati da runbook documentati che il vostro personale può eseguire. Ogni aggiornamento viene rivalidato rispetto al vostro set di valutazione prima di sostituire la versione in esecuzione. Più lento dell'aggiornamento automatico cloud — che è esattamente ciò che vuole il vostro team di sicurezza.

Quale forma si adatta ai vostri vincoli?

Descrivete i vostri vincoli di data governance nella call di definizione del perimetro — li mapperemo a una forma di deployment e metteremo dimensionamento e throughput nella proposta.