Démo en direct · inférence sur l'appareil
Un modèle en fonctionnement, exécuté dans cette page.
Ci-dessous, un modèle de langage de 1,7 milliard de paramètres trie des messages de support — catégorie, urgence, résumé d'une ligne — calculés sur votre propre GPU, dans cet onglet de navigateur. Pas d'API, pas de serveur, aucune sortie de données. C'est la forme la plus extrême de l'argument que défend ce site : des modèles qui s'exécutent là où vivent les données.
Pourquoi c'est important
L'objection à l'IA souveraine, c'est la capacité. La réponse, c'est le périmètre.
Les organisations régulées ne peuvent pas envoyer les données de leurs clients à des API d'IA tierces — le secret bancaire, le secret médical et les règles de passation de marchés disent tous la même chose. Le contre-argument habituel veut que tout ce que vous pouvez exécuter vous-même soit trop faible pour être utile. C'est vrai si vous attendez d'un seul modèle qu'il fasse tout.
Cela cesse d'être vrai quand la tâche est étroite. Un petit modèle chargé d'une seule tâche bien définie — classer ce message, extraire ces champs, rédiger cette réponse standard — peut être évalué, rendu déterministe et exécuté sur du matériel que vous contrôlez. La quantification le réduit jusqu'à ce que « du matériel que vous contrôlez » puisse désigner une workstation, un téléphone — ou, comme ici, un onglet de navigateur.
Cette page en est la preuve concrète : un vrai modèle avec une vraie tâche, et une empreinte réseau de 0 octet pour tout ce que vous tapez.
Le cas d'usage
Le triage de support : la tâche étroite canonique.
Toute organisation de service a une boîte de réception : réclamations, signalements de panne, questions commerciales, réinitialisations de mot de passe. Quelqu'un — ou quelque chose — lit chaque message et décide de quoi il s'agit et de son degré d'urgence avant que quiconque n'agisse. Cette décision convient parfaitement à un petit modèle : l'entrée est un message, la sortie est un ensemble fermé d'étiquettes plus un résumé d'une ligne, et chaque réponse est vérifiable.
La démo ci-dessous fait exactement cela. Collez un message (ou utilisez un exemple) et le modèle renvoie Catégorie · Urgence · Résumé. Chaque message est trié indépendamment — pas d'historique, pas de dérive. Passez à l'onglet Chat pour dialoguer librement avec le même modèle et calibrer vos attentes sur ce que 1,7 milliard de paramètres 1 bit peuvent et ne peuvent pas faire.
Dans un projet client, c'est là que le travail commence, et non qu'il s'arrête : la taxonomie devient vos catégories, le modèle est affiné sur vos messages étiquetés, et un harnais d'évaluation le mesure contre votre barre avant qu'il ne touche la production — la même méthode que nos ablations publiées.
S'exécute entièrement dans cet onglet via WebGPU. Le premier lancement télécharge le modèle — ~237 Mo, une seule fois — puis il est mis en cache et fonctionne hors ligne. Chrome ou Edge sur ordinateur avec GPU recommandé.
Téléchargement du modèle depuis huggingface.co · vos messages ne quittent jamais cet appareil · version autonome ↗
Ce qui tourne
Bonsai-1.7B — un modèle ouvert 1 bit.
Bonsai-1.7B est un modèle ouvert de Prism ML (Apache-2.0) : construit à partir de Qwen3-1.7B et entraîné de bout en bout pour des poids 1 bit. Le moteur WebGPU — des kernels de calcul écrits à la main qui décodent les poids compactés sur votre GPU — a été publié par la webml-community pour le modèle phare 27B (MIT) ; nous l'avons porté sur l'architecture qwen3 simple du 1.7B pour cette page. C'est un démonstrateur indépendant, pas l'un de nos fine-tunes Apertus.
- 1.125
- Bits par poids
- 0.24 GB
- Téléchargement unique
- 32k
- Tokens de fenêtre de contexte
- 0
- Octet de données sortantes
Q1_0 : bits de signe compactés + échelles de groupe FP16 — environ 14× plus petit que le même modèle en FP16
Mis en cache par votre navigateur après le premier chargement ; fonctionne ensuite hors ligne
La longueur de contexte complète de Qwen3-1.7B, exécutée sur votre GPU
Les poids descendent de Hugging Face ; rien de ce que vous tapez ne part où que ce soit
De la démo à la production
Le schéma est le produit.
Ce que vous venez d'utiliser est un schéma : un petit modèle limité à une tâche, quantifié pour tenir sur le matériel dont vous disposez réellement, exécuté là où vivent les données. Dans les projets clients, nous appliquons le même schéma avec d'autres ingrédients — Apertus, le modèle ouvert suisse, affiné sur vos données, déployé dans votre juridiction et tenu à une barre d'évaluation convenue avant le début du projet.
Si votre organisation a une boîte de réception, un flux de documents ou un pipeline de formulaires que des personnes trient aujourd'hui à la main, c'est en général le bon premier projet : étroit, mesurable et souverain dès le premier jour.
Questions
Les petites lignes.
Ce que je tape quitte-t-il mon navigateur ?
Pourquoi le modèle ne pèse-t-il que 0,24 Go ?
Est-ce le modèle que sysf.io déploie pour ses clients ?
De quoi ai-je besoin pour l'exécuter ?
Cartographiez votre première tâche étroite.
Un appel de cadrage de 30 minutes — nous vous dirons honnêtement si un petit modèle spécialisé par tâche convient.