Concepts · Petits modèles
Petits modèles, mesurés.
Deux questions décident d'un build souverain : quelle taille de modèle la tâche exige-t-elle et de quelle base partez-vous. Cette page répond aux deux — capacité versus taille, ce que chaque classe de taille sait réellement faire, et le spectre de l'Apertus entièrement suisse aux modèles ouverts européens et internationaux — limites honnêtes et cadrage de conformité inclus.
Taille
Quelle taille de modèle la tâche exige-t-elle ?
La capacité augmente avec la taille — mais elle plafonne, et les rendements deviennent vite coûteux. La plupart du travail régulé ne vit pas à la frontière ; il vit dans les bandes qu'un petit modèle atteint.
La taille d'un modèle se mesure en paramètres — de ~1B à plus de 200B. Plus de paramètres achètent des connaissances plus larges et un raisonnement plus profond, mais la courbe s'infléchit : le saut de 1B à 8B est transformateur, de 8B à 70B il est réel mais coûteux, et au-delà vous payez beaucoup pour peu sur la plupart des tâches.
L'astuce : la taille nécessaire est fixée par la tâche, pas par l'ambition. Extraction, classification, routage et rédaction structurée vivent dans les bandes basses — le terrain de prédilection d'un petit modèle. Et la flèche rouge ci-dessous est tout l'enjeu de cette page : affiner un petit modèle sur une tâche étroite hisse sa capacité effective dans la bande supérieure, de sorte qu'un 8B affiné bat un généraliste bien plus grand sur le travail que vous exécutez réellement.
L'effet
La spécialisation bat l'échelle sur les tâches étroites.
Les benchmarks généraux récompensent l'étendue. Votre workflow récompense la profondeur — vos modèles, votre terminologie, vos formats, vos cas limites.
Prêt à l'emploi, un petit modèle généraliste est un généraliste qui se trouve parler votre langue. Affiné sur quelques milliers d'exemples de votre tâche, il devient un spécialiste qui a lu votre corpus. Ce que cela apporte dépend d'où part le modèle de base — c'est exactement ce que mesure l'ablation de chaque pilote, sur vos documents, avant que vous vous engagiez.
Le point de référence public en Suisse : le service de traduction du Canton du Tessin est passé de 90 % à 94 % de précision après affinage d'Apertus-8B sur des données cantonales, tournant entièrement sur l'infrastructure cantonale. Quatre points en haut de l'échelle — dans un service en production, la différence entre vérifier la sortie par sondage et la refaire.
Une API de pointe a deux handicaps structurels sur ce terrain : elle n'a jamais vu vos documents, et elle ne le pourra jamais — parce que ce sont les documents que vous ne pouvez pas confier. L'avantage du petit modèle n'est pas l'intelligence. C'est l'accès.
La méthode
L'affinage enseigne le comportement. La recherche fournit les faits.
On confond régulièrement les deux — et cette confusion est là où les projets d'IA échouent.
Affinage
Enseigne la tâche : votre terminologie, vos formats de documents, le ton, la structure de sortie, le comportement de refus. Il ne mémorise pas les faits de façon fiable — l'utiliser comme réservoir de connaissances est une erreur de conception que nous refusons de livrer.
Recherche (RAG)
Fournit les faits : la version actuelle de vos politiques, contrats et dossiers, cités jusqu'à la page source. La connaissance se met à jour dès que le document change — sans réentraînement.
L'ablation
Chaque pilote note les quatre volets — base, recherche, affinage, combiné — sur votre jeu d'évaluation. Le tableau indique quel système vaut la peine d'être acheté.
Mesurée, la répartition est nette : dans notre ablation FINMA, l'affinage seul a porté la conformité de format de ~2 % à 100 % tout en laissant la précision réponse-plus-citation à 1,6 % — comportement appris, faits non. Recherche seule : 22,4 %. Combiné : 45,4 %.
La base
Entièrement suisse, ou aussi flexible que votre conformité le permet.
Apertus est notre choix par défaut — le LLM entièrement ouvert et entièrement transparent de la Suisse. Mais la souveraineté n'est pas seulement suisse. Là où votre politique le permet, une base ouverte européenne ou internationale peut gagner votre évaluation tout en tournant entièrement sur votre infrastructure.
Entièrement suisse
Souverain & entièrement transparent
Apertus
Poids ouverts et données d'entraînement ouvertes, origine suisse. Le choix quand chaque couche doit être auditable — secteur public, ou les postures de conformité les plus strictes.
Européen
Basé en UE, poids ouverts
Mistral · Teuken · EuroLLM
Fournisseurs européens, poids ouverts, forte couverture des langues de l'UE. La provenance reste en Europe ; les données d'entraînement ne sont généralement pas publiées.
International
Meilleure performance ouverte
Llama · Qwen · Gemma
Les modèles ouverts les plus forts, quelle que soit l'origine. Capacité et écosystème maximaux — le compromis porte sur la transparence des données d'entraînement et, pour certains, le pays d'origine.
L'EU AI Act autorise-t-il un modèle comme Qwen ?
Version courte : le règlement classe selon le risque d'usage et impose des obligations de transparence au fournisseur d'un modèle à usage général — il ne restreint pas un modèle de base selon son pays d'origine. Faire tourner un modèle ouvert sur votre propre infrastructure garde vos données dans votre juridiction, peu importe où les poids ont été entraînés.
Ce qui peut écarter un modèle, c'est votre propre politique d'achat ou de gouvernance des données : plusieurs organismes publics suisses et européens restreignent la technologie d'origine chinoise par politique interne, pas par le règlement. C'est une décision que nous cadrons avec vous — et c'est précisément pour cela que l'option entièrement suisse existe. Pas un conseil juridique ; nous travaillons aux côtés de vos équipes conformité et juridique.
Le catalogue
Les modèles de base sur lesquels nous construisons.
Une liste de travail, groupée par origine. Tailles et matériel sont des faits ; performance et vitesse sont qualitatives — le vrai classement vient toujours de l'évaluation sur votre tâche.
Suisse — souveraineté maximale
Apertus
EPFL · ETH Zurich · CSCS (Suisse)
- Tailles
- 8B · 70B
- Matériel
- 8B → workstation · 70B → nœud
Le LLM souverain de la Suisse — la seule base ici à publier ses données d'entraînement et sa recette, pas seulement ses poids. Multilingue par construction, y compris le suisse allemand et le romanche.
Idéal pour: Secteur public, Q&R régulé, traduction — partout où l'auditabilité complète est l'exigence
Performance & vitesse: Fort sur les tâches étroites affinées et les langues nationales suisses ; en retrait des plus grands modèles internationaux sur le travail général ouvert
+ Atout
Traçabilité complète des données, inspectable par un auditeur ; origine et juridiction suisses
△ Compromis
Écosystème plus jeune et moins de tailles que les acteurs établis
Europe — basé en UE, poids ouverts
Mistral
Mistral AI (France)
- Tailles
- 8B · ~24B · plus grand
- Matériel
- 8B → workstation · 24B → un seul GPU 24–48 Go
Famille française ouverte et efficace, avec des versions permissives (Apache-2.0) et une forte couverture des langues européennes.
Idéal pour: Travail documentaire multilingue UE, rédaction et résumé avec un budget matériel serré
Performance & vitesse: Excellente capacité par paramètre ; vainqueur fréquent d'évaluation sur les tâches multilingues européennes
+ Atout
Basé en UE, licences permissives, très forte performance pour la taille
△ Compromis
Données d'entraînement non publiées ; les plus grands niveaux ne sont pas tous ouverts
Teuken · EuroLLM
OpenGPT-X / consortiums UE (Europe)
- Tailles
- 7B · 9B
- Matériel
- → workstation
Modèles européens financés sur fonds publics, entraînés pour une large couverture des langues de l'UE — les 24 langues officielles — avec une documentation exceptionnellement ouverte.
Idéal pour: Déploiements souverains UE voulant une provenance de recherche publique européenne et une large couverture linguistique
Performance & vitesse: Couverture multilingue solide à petite taille ; écosystème plus réduit et moins de points de contrôle affinés que Mistral
+ Atout
Provenance de la recherche publique européenne ; large couverture des langues officielles
△ Compromis
Plus petit et moins éprouvé que les leaders du marché
International — meilleure performance ouverte
Llama
Meta (États-Unis)
- Tailles
- 8B · 70B · plus grand
- Matériel
- 8B → workstation · 70B → nœud
La famille ouverte de Meta — l'outillage et l'écosystème communautaire les plus matures de tout modèle ouvert.
Idéal pour: Bases de référence généralistes et outillage agentique où la maturité de l'écosystème compte
Performance & vitesse: Forte capacité générale sur toutes les tailles ; un concurrent d'évaluation fiable
+ Atout
Écosystème, outillage et support d'affinage inégalés
△ Compromis
Origine américaine ; une licence communautaire avec restrictions d'usage ; données d'entraînement non publiques
Qwen
Alibaba (Chine)
- Tailles
- 7B–72B dense · 235B MoE
- Matériel
- 8B → workstation · 32B → un seul GPU · 72B / MoE → nœud
Parmi les modèles ouverts les plus forts en raisonnement, code et travail multilingue, avec la plus large gamme de tailles — dont des mixtures d'experts économes en mémoire.
Idéal pour: Les tâches ouvertes les plus exigeantes où la capacité prime et où la politique le permet
Performance & vitesse: Niveau de pointe ouvert sur les benchmarks de raisonnement et multilingues ; les variantes MoE tournent plus vite qu'un modèle dense de même taille totale
+ Atout
Meilleure performance ouverte, licences permissives, une taille pour chaque budget matériel
△ Compromis
Origine chinoise — certaines politiques d'achat publiques suisses et européennes l'excluent ; données d'entraînement non publiques
Gemma
Google (États-Unis)
- Tailles
- 2B · 9B · 27B
- Matériel
- → workstation (toutes tailles)
La famille ouverte compacte de Google, réglée pour une forte qualité aux petites et moyennes tailles tenant sur un seul GPU.
Idéal pour: Charges mono-GPU et en périphérie sensibles à la latence
Performance & vitesse: Qualité par paramètre compétitive dans la gamme petite et moyenne
+ Atout
Petit, rapide, facile à faire tourner sur du matériel modeste
△ Compromis
Origine américaine ; plafonné à 27B ; données d'entraînement non publiques
Dimensionner le matériel derrière tout cela est une discipline à part — voir la quantification pour comment un 70B tient dans ~40 Go et un 8B en moins de 5 Go, et le runtime souverain pour les formes de déploiement.
L'économie
Un ordre de grandeur moins cher à exploiter — et plus rapide.
Les petits modèles ne rentrent pas seulement dans votre enveloppe de conformité. Ils rentrent dans votre budget — en francs et en millisecondes.
Coût de service : faire tourner un modèle 7–8B coûte environ un ordre de grandeur de moins qu'un modèle de classe 70B — la différence entre un GPU de classe workstation et un nœud multi-GPU, entre un bon de commande et un cycle d'achat.
Latence : chaque appel d'API cloud paie une taxe d'aller-retour — sauts réseau, TLS, mise en file derrière d'autres locataires — avant même que vos tokens n'atteignent un GPU ; les premiers tokens n'arrivent souvent qu'après plusieurs centaines de millisecondes. Un petit modèle dans votre propre rack évite entièrement cette taxe, et son prefill et son decode plus rapides s'y ajoutent — c'est ce qui rend les pipelines documentaires à fort volume et les assistants interactifs instantanés.
Le multiplicateur de souveraineté : chaque paramètre dont vous n'avez pas besoin est de la conformité que vous n'avez pas à acheter. Un petit modèle spécialisé par tâche tourne sur une seule machine — la forme workstation dans le runtime souverain — ce qui ouvre les déploiements air-gapped et en périphérie (atelier, clinique, service terrain) où les plateformes hébergées et les API américaines ne peuvent structurellement pas suivre.
Les limites
Quand un petit modèle est le mauvais choix.
Un expert qui ne vous dit pas quand son outil préféré perd n'est pas un expert. Les petits modèles perdent ici :
Assistance ouverte
« Répondre à tout sur tout » récompense l'échelle. Si vous avez besoin d'un assistant de conversation général sur des connaissances publiques, un modèle de pointe s'en sort mieux.
Vaste connaissance du monde
Les petits modèles en savent moins. La recherche comble l'écart seulement là où votre corpus a la réponse — elle ne peut pas récupérer ce que personne n'a écrit.
Raisonnement profond multi-étapes
Les longues chaînes de raisonnement inédit favorisent encore les modèles plus grands. Le volume routinier va au petit ; la queue difficile escalade vers un modèle local plus grand.
Travail non sensible et à faible volume
Si les données peuvent sortir et que le volume est trivial, un abonnement API est plus simple. Nous le dirons lors de l'appel de cadrage.
La ligne de partage n'est pas une opinion — c'est le jeu d'évaluation. C'est pourquoi chaque engagement commence par en construire un : la livraison guidée par l'évaluation.
FAQ
Questions sur les petits modèles.
Un modèle 8B est-il vraiment assez bon pour du texte juridique ou clinique en allemand ?
Pouvez-vous utiliser une base non suisse comme Mistral ou Qwen — et l'EU AI Act l'autorise-t-il ?
Et le travail à forte charge de raisonnement ?
L'affinage ne devient-il pas obsolète à chaque nouveau modèle de base meilleur ?
Un petit modèle franchirait-il votre barre ?
Un workflow, vos documents, notre harnais. Nous construirons le jeu d'évaluation et vous montrerons l'ablation — dans votre juridiction.