Aller au contenu

Concepts · Runtime souverain

D'une seule workstation à un air gap complet.

« Tourne là où vivent vos données » est une affirmation sur le matériel, les réseaux et les frontières de confiance. Voici les formes de déploiement réelles — et le schéma de routage qui garde les petits modèles rapides sans jamais appeler un cloud.

Les formes

Trois enveloppes de déploiement, un principe.

Chaque forme garde données, modèle et orchestration à l'intérieur d'une unique frontière de confiance que vous contrôlez. Elles diffèrent par l'endroit où se situe cette frontière.

Classe workstation

4–8B spécialisé par tâche, quantifié

Un serveur GPU dans votre rack — ou une armoire verrouillée dans votre bureau. Fait tourner un petit modèle affiné avec recherche à vitesse interactive pour une équipe ou un pipeline documentaire. C'est la forme qui fait de l'IA souveraine une ligne budgétaire plutôt qu'un projet.

Classe nœud

Classe 70B, ou plusieurs modèles

Un serveur multi-GPU dans votre centre de données ou votre cloud suisse. Fait tourner des modèles plus grands, plusieurs charges concurrentes, et le palier d'escalade du routeur ci-dessous. La forme pour les déploiements à l'échelle de l'organisation.

Air-gapped / confidentiel

Toute taille, isolation maximale

Soit une infrastructure physiquement déconnectée avec des runbooks de mise à jour hors ligne, soit des VM de confidential computing avec attestation à distance — mémoire chiffrée avec des clés que l'opérateur ne détient jamais. Détail au niveau de la puce dans la FAQ ci-dessous.

Ce qui rend la forme workstation possible tout court, c'est une quantification agressive et vérifiée par l'évaluation.

Le schéma

Petit d'abord, escalade locale.

L'architecture de routage qui capte l'économie des petits modèles sans renoncer à la queue difficile — ni à la souveraineté.

  1. 01
    Le petit modèle voit chaque requête en premier

    Le 4–8B spécialisé par tâche répond en premier — rapide, économique, sur la forme classe workstation. Pour un workflow bien cadré, c'est l'écrasante majorité du volume.

  2. 02
    Un routeur guette les problèmes

    Les violations de schéma et les appels d'outils en échec sont des déclencheurs sans ambiguïté. Les signaux de confiance et hors distribution sont plus difficiles — nous les calibrons par tâche face à votre jeu d'évaluation, et le seuil d'escalade est un compromis mesuré, pas un défaut auquel nous faisons aveuglément confiance.

  3. 03
    L'escalade va vers un modèle local plus grand

    Les requêtes signalées sont ré-exécutées sur le palier classe nœud : un modèle ouvert plus grand sur votre propre infrastructure. La version cloud de ce schéma escalade vers une API américaine — la nôtre jamais. Sur les déploiements workstation uniquement, les requêtes signalées sont routées vers une file de revue humaine à la place : un petit système qui sait quand passer la main bat un grand qui ne le fait jamais.

  4. 04
    Tout est journalisé et re-noté

    Les taux d'escalade et les résultats alimentent la boucle d'évaluation : un taux en hausse signifie que la tâche a dérivé ou que le petit modèle a besoin d'un rafraîchissement — visible dans les métriques des semaines avant que les utilisateurs ne le remarquent.

La frontière

La fuite nulle est une propriété de conception, pas une promesse.

Vous ne devriez pas avoir à croire un fournisseur sur parole pour « rien ne sort ». Vous devriez pouvoir le vérifier au pare-feu.

Le runtime est conteneurisé et autonome : poids du modèle, index de recherche, orchestration et monitoring tournent tous à l'intérieur de votre segment réseau. Aucun composant n'appelle vers l'extérieur — pas de télémétrie, pas de pings de licence, pas de « statistiques d'usage anonymes ». Vos règles de pare-feu peuvent dire deny all egress, et le système continue de fonctionner. C'est le test, et vous pouvez le mener vous-même.

Le monitoring reste dedans aussi : tableaux de bord, journaux et scores d'évaluation sont servis localement, et la rétention des journaux suit votre politique — les journaux d'inférence contiennent vos données. La pile de traçage auto-hébergée derrière cela est sur la page orchestration.

Sur les formes workstation et air-gapped, c'est aussi une démo que nous aimons faire : débranchez le câble réseau, continuez à travailler.

FAQ

Questions sur le runtime.

Combien coûte réellement le matériel ?
La forme workstation — un serveur mono-GPU qui fait tourner un 4–8B spécialisé par tâche — est typiquement une machine de CHF 5 000–15 000 installée dans votre rack existant ou une armoire de bureau verrouillée. La forme nœud pour les modèles de classe 70B est un investissement de milieu de cinq chiffres ou une location dans votre cloud suisse. Le dimensionnement exact (et les chiffres de débit engagés) fait partie de chaque proposition — et le matériel du pilote peut être le nôtre, de sorte que la dépense d'infrastructure ne commence qu'après le franchissement de l'évaluation.
Qu'est-ce que le confidential computing, concrètement ?
Des machines virtuelles chiffrées par le matériel — AMD SEV-SNP ou Intel TDX — où la mémoire est chiffrée avec des clés que l'opérateur cloud ne détient jamais, et l'attestation à distance vous permet de vérifier cryptographiquement l'état de lancement (firmware, image, configuration) avant qu'aucune donnée n'entre. Sens pratique — vous pouvez louer de l'infrastructure suisse tout en sortant le fournisseur de la frontière de confiance de la confidentialité des données. Une réserve que nous soulevons avant votre équipe de sécurité — une enclave CPU seule ne couvre pas le GPU où l'inférence tourne réellement ; étendre la frontière à l'accélérateur exige des GPU compatibles confidential computing (classe NVIDIA H100, avec transferts chiffrés et attestation GPU), et nous dimensionnons exactement pour cela quand le modèle de menace l'exige.
Comment les systèmes air-gapped reçoivent-ils des mises à jour ?
Délibérément et de façon vérifiable — jamais par un fil. Les mises à jour de modèle, les reconstructions d'index de recherche et les correctifs logiciels arrivent sous forme de lots hors ligne signés et à somme de contrôle, lors de fenêtres de maintenance planifiées, installés à partir de runbooks documentés que votre propre personnel peut exécuter. Chaque mise à jour est revalidée face à votre jeu d'évaluation avant de remplacer la version en cours. Plus lent qu'une mise à jour cloud automatique — c'est exactement ce que veut votre équipe de sécurité.

Quelle forme correspond à vos contraintes ?

Décrivez vos contraintes de gouvernance des données lors de l'appel de cadrage — nous les mapperons à une forme de déploiement et mettrons le dimensionnement et le débit dans la proposition.