Aller au contenu

Démo en direct · inférence sur l'appareil

Un modèle en fonctionnement, exécuté dans cette page.

Ci-dessous, un modèle de langage de 1,7 milliard de paramètres trie des messages de support — catégorie, urgence, résumé d'une ligne — calculés sur votre propre GPU, dans cet onglet de navigateur. Pas d'API, pas de serveur, aucune sortie de données. C'est la forme la plus extrême de l'argument que défend ce site : des modèles qui s'exécutent là où vivent les données.

Pourquoi c'est important

L'objection à l'IA souveraine, c'est la capacité. La réponse, c'est le périmètre.

Les organisations régulées ne peuvent pas envoyer les données de leurs clients à des API d'IA tierces — le secret bancaire, le secret médical et les règles de passation de marchés disent tous la même chose. Le contre-argument habituel veut que tout ce que vous pouvez exécuter vous-même soit trop faible pour être utile. C'est vrai si vous attendez d'un seul modèle qu'il fasse tout.

Cela cesse d'être vrai quand la tâche est étroite. Un petit modèle chargé d'une seule tâche bien définie — classer ce message, extraire ces champs, rédiger cette réponse standard — peut être évalué, rendu déterministe et exécuté sur du matériel que vous contrôlez. La quantification le réduit jusqu'à ce que « du matériel que vous contrôlez » puisse désigner une workstation, un téléphone — ou, comme ici, un onglet de navigateur.

Cette page en est la preuve concrète : un vrai modèle avec une vraie tâche, et une empreinte réseau de 0 octet pour tout ce que vous tapez.

Le cas d'usage

Le triage de support : la tâche étroite canonique.

Toute organisation de service a une boîte de réception : réclamations, signalements de panne, questions commerciales, réinitialisations de mot de passe. Quelqu'un — ou quelque chose — lit chaque message et décide de quoi il s'agit et de son degré d'urgence avant que quiconque n'agisse. Cette décision convient parfaitement à un petit modèle : l'entrée est un message, la sortie est un ensemble fermé d'étiquettes plus un résumé d'une ligne, et chaque réponse est vérifiable.

La démo ci-dessous fait exactement cela. Collez un message (ou utilisez un exemple) et le modèle renvoie Catégorie · Urgence · Résumé. Chaque message est trié indépendamment — pas d'historique, pas de dérive. Passez à l'onglet Chat pour dialoguer librement avec le même modèle et calibrer vos attentes sur ce que 1,7 milliard de paramètres 1 bit peuvent et ne peuvent pas faire.

Dans un projet client, c'est là que le travail commence, et non qu'il s'arrête : la taxonomie devient vos catégories, le modèle est affiné sur vos messages étiquetés, et un harnais d'évaluation le mesure contre votre barre avant qu'il ne touche la production — la même méthode que nos ablations publiées.

S'exécute entièrement dans cet onglet via WebGPU. Le premier lancement télécharge le modèle — ~237 Mo, une seule fois — puis il est mis en cache et fonctionne hors ligne. Chrome ou Edge sur ordinateur avec GPU recommandé.

Téléchargement du modèle depuis huggingface.co · vos messages ne quittent jamais cet appareil · version autonome ↗

Ce qui tourne

Bonsai-1.7B — un modèle ouvert 1 bit.

Bonsai-1.7B est un modèle ouvert de Prism ML (Apache-2.0) : construit à partir de Qwen3-1.7B et entraîné de bout en bout pour des poids 1 bit. Le moteur WebGPU — des kernels de calcul écrits à la main qui décodent les poids compactés sur votre GPU — a été publié par la webml-community pour le modèle phare 27B (MIT) ; nous l'avons porté sur l'architecture qwen3 simple du 1.7B pour cette page. C'est un démonstrateur indépendant, pas l'un de nos fine-tunes Apertus.

1.125
Bits par poids

Q1_0 : bits de signe compactés + échelles de groupe FP16 — environ 14× plus petit que le même modèle en FP16

0.24 GB
Téléchargement unique

Mis en cache par votre navigateur après le premier chargement ; fonctionne ensuite hors ligne

32k
Tokens de fenêtre de contexte

La longueur de contexte complète de Qwen3-1.7B, exécutée sur votre GPU

0
Octet de données sortantes

Les poids descendent de Hugging Face ; rien de ce que vous tapez ne part où que ce soit

De la démo à la production

Le schéma est le produit.

Ce que vous venez d'utiliser est un schéma : un petit modèle limité à une tâche, quantifié pour tenir sur le matériel dont vous disposez réellement, exécuté là où vivent les données. Dans les projets clients, nous appliquons le même schéma avec d'autres ingrédients — Apertus, le modèle ouvert suisse, affiné sur vos données, déployé dans votre juridiction et tenu à une barre d'évaluation convenue avant le début du projet.

Si votre organisation a une boîte de réception, un flux de documents ou un pipeline de formulaires que des personnes trient aujourd'hui à la main, c'est en général le bon premier projet : étroit, mesurable et souverain dès le premier jour.

Questions

Les petites lignes.

Ce que je tape quitte-t-il mon navigateur ?
Non. Les poids du modèle sont téléchargés une seule fois depuis Hugging Face et mis en cache par votre navigateur ; ensuite, tout le calcul se fait sur votre propre GPU via WebGPU. Vos messages ne sont jamais envoyés à un serveur — il n'y a pas de serveur.
Pourquoi le modèle ne pèse-t-il que 0,24 Go ?
Bonsai-1.7B stocke ses poids sur environ 1,125 bit chacun (bits de signe compactés plus petites échelles de groupe) au lieu de 16 bits — environ 14× plus petit que le même modèle en FP16. La quantification extrême est l'un des leviers qui rendent le déploiement souverain on-premise abordable ; notre page concept sur la quantification couvre les compromis.
Est-ce le modèle que sysf.io déploie pour ses clients ?
Non — Bonsai-1.7B est un modèle ouvert indépendant de Prism ML, utilisé ici uniquement pour démontrer l'inférence sur l'appareil. Les systèmes clients sont construits sur Apertus, affiné sur vos données et évalué sur votre tâche ; le schéma est le même, le modèle est le vôtre.
De quoi ai-je besoin pour l'exécuter ?
Un navigateur de bureau avec WebGPU (Chrome ou Edge récent) et un GPU. Le premier lancement télécharge ~237 Mo, une seule fois. Si WebGPU n'est pas disponible, la page vous le dira — rien ne casse.

Cartographiez votre première tâche étroite.

Un appel de cadrage de 30 minutes — nous vous dirons honnêtement si un petit modèle spécialisé par tâche convient.