Aller au contenu

Concepts · Petits modèles

Petits modèles, mesurés.

Deux questions décident d'un build souverain : quelle taille de modèle la tâche exige-t-elle et de quelle base partez-vous. Cette page répond aux deux — capacité versus taille, ce que chaque classe de taille sait réellement faire, et le spectre de l'Apertus entièrement suisse aux modèles ouverts européens et internationaux — limites honnêtes et cadrage de conformité inclus.

Taille

Quelle taille de modèle la tâche exige-t-elle ?

La capacité augmente avec la taille — mais elle plafonne, et les rendements deviennent vite coûteux. La plupart du travail régulé ne vit pas à la frontière ; il vit dans les bandes qu'un petit modèle atteint.

La taille d'un modèle se mesure en paramètres — de ~1B à plus de 200B. Plus de paramètres achètent des connaissances plus larges et un raisonnement plus profond, mais la courbe s'infléchit : le saut de 1B à 8B est transformateur, de 8B à 70B il est réel mais coûteux, et au-delà vous payez beaucoup pour peu sur la plupart des tâches.

L'astuce : la taille nécessaire est fixée par la tâche, pas par l'ambition. Extraction, classification, routage et rédaction structurée vivent dans les bandes basses — le terrain de prédilection d'un petit modèle. Et la flèche rouge ci-dessous est tout l'enjeu de cette page : affiner un petit modèle sur une tâche étroite hisse sa capacité effective dans la bande supérieure, de sorte qu'un 8B affiné bat un généraliste bien plus grand sur le travail que vous exécutez réellement.

8B affiné sur votre tâche étroite 8B de base Raisonnement de pointe Travail de connaissance appliqué Travail routinier structuré recherche ouverte · synthèse inédite Q&R métier avec citation · traduction extraction · classification · routage 1B 8B 30B 70B 235B Taille du modèle → Capacité →
Illustratif, pas un benchmark. La capacité brute augmente avec le nombre de paramètres mais plafonne — et les rendements deviennent coûteux. Affiner un petit modèle sur une tâche étroite hisse sa capacité effective dans la bande supérieure ; c'est pourquoi un 8B affiné peut battre un modèle général bien plus grand sur votre travail cadré. Les vrais chiffres viennent de l'évaluation sur votre tâche.

L'effet

La spécialisation bat l'échelle sur les tâches étroites.

Les benchmarks généraux récompensent l'étendue. Votre workflow récompense la profondeur — vos modèles, votre terminologie, vos formats, vos cas limites.

Prêt à l'emploi, un petit modèle généraliste est un généraliste qui se trouve parler votre langue. Affiné sur quelques milliers d'exemples de votre tâche, il devient un spécialiste qui a lu votre corpus. Ce que cela apporte dépend d'où part le modèle de base — c'est exactement ce que mesure l'ablation de chaque pilote, sur vos documents, avant que vous vous engagiez.

Le point de référence public en Suisse : le service de traduction du Canton du Tessin est passé de 90 % à 94 % de précision après affinage d'Apertus-8B sur des données cantonales, tournant entièrement sur l'infrastructure cantonale. Quatre points en haut de l'échelle — dans un service en production, la différence entre vérifier la sortie par sondage et la refaire.

Une API de pointe a deux handicaps structurels sur ce terrain : elle n'a jamais vu vos documents, et elle ne le pourra jamais — parce que ce sont les documents que vous ne pouvez pas confier. L'avantage du petit modèle n'est pas l'intelligence. C'est l'accès.

Apertus-8B de base
90%
Affiné sur données cantonales
94%+4 pts
Canton du Tessin — précision de traduction sur du texte cantonal, avant et après affinage d'Apertus-8B. Source : CSCS.

La méthode

L'affinage enseigne le comportement. La recherche fournit les faits.

On confond régulièrement les deux — et cette confusion est là où les projets d'IA échouent.

Affinage

Enseigne la tâche : votre terminologie, vos formats de documents, le ton, la structure de sortie, le comportement de refus. Il ne mémorise pas les faits de façon fiable — l'utiliser comme réservoir de connaissances est une erreur de conception que nous refusons de livrer.

Recherche (RAG)

Fournit les faits : la version actuelle de vos politiques, contrats et dossiers, cités jusqu'à la page source. La connaissance se met à jour dès que le document change — sans réentraînement.

L'ablation

Chaque pilote note les quatre volets — base, recherche, affinage, combiné — sur votre jeu d'évaluation. Le tableau indique quel système vaut la peine d'être acheté.

Mesurée, la répartition est nette : dans notre ablation FINMA, l'affinage seul a porté la conformité de format de ~2 % à 100 % tout en laissant la précision réponse-plus-citation à 1,6 % — comportement appris, faits non. Recherche seule : 22,4 %. Combiné : 45,4 %.

La base

Entièrement suisse, ou aussi flexible que votre conformité le permet.

Apertus est notre choix par défaut — le LLM entièrement ouvert et entièrement transparent de la Suisse. Mais la souveraineté n'est pas seulement suisse. Là où votre politique le permet, une base ouverte européenne ou internationale peut gagner votre évaluation tout en tournant entièrement sur votre infrastructure.

← Souveraineté & transparence maximalesCapacité & flexibilité maximales →

Entièrement suisse

Souverain & entièrement transparent

Apertus

Poids ouverts et données d'entraînement ouvertes, origine suisse. Le choix quand chaque couche doit être auditable — secteur public, ou les postures de conformité les plus strictes.

Européen

Basé en UE, poids ouverts

Mistral · Teuken · EuroLLM

Fournisseurs européens, poids ouverts, forte couverture des langues de l'UE. La provenance reste en Europe ; les données d'entraînement ne sont généralement pas publiées.

International

Meilleure performance ouverte

Llama · Qwen · Gemma

Les modèles ouverts les plus forts, quelle que soit l'origine. Capacité et écosystème maximaux — le compromis porte sur la transparence des données d'entraînement et, pour certains, le pays d'origine.

Chaque option tourne de la même façon : poids ouverts, sur votre infrastructure, vos données ne partent jamais. Vers la droite, on achète capacité et écosystème ; vers la gauche, transparence de la provenance. La position de votre organisation est une décision de conformité et d'achat — et au sein du niveau choisi, l'évaluation décide encore quel modèle gagne.

L'EU AI Act autorise-t-il un modèle comme Qwen ?

Version courte : le règlement classe selon le risque d'usage et impose des obligations de transparence au fournisseur d'un modèle à usage général — il ne restreint pas un modèle de base selon son pays d'origine. Faire tourner un modèle ouvert sur votre propre infrastructure garde vos données dans votre juridiction, peu importe où les poids ont été entraînés.

Ce qui peut écarter un modèle, c'est votre propre politique d'achat ou de gouvernance des données : plusieurs organismes publics suisses et européens restreignent la technologie d'origine chinoise par politique interne, pas par le règlement. C'est une décision que nous cadrons avec vous — et c'est précisément pour cela que l'option entièrement suisse existe. Pas un conseil juridique ; nous travaillons aux côtés de vos équipes conformité et juridique.

Le catalogue

Les modèles de base sur lesquels nous construisons.

Une liste de travail, groupée par origine. Tailles et matériel sont des faits ; performance et vitesse sont qualitatives — le vrai classement vient toujours de l'évaluation sur votre tâche.

Suisse — souveraineté maximale

Apertus

EPFL · ETH Zurich · CSCS (Suisse)

Entièrement ouvert
Tailles
8B · 70B
Matériel
8B → workstation · 70B → nœud

Le LLM souverain de la Suisse — la seule base ici à publier ses données d'entraînement et sa recette, pas seulement ses poids. Multilingue par construction, y compris le suisse allemand et le romanche.

Idéal pour: Secteur public, Q&R régulé, traduction — partout où l'auditabilité complète est l'exigence

Performance & vitesse: Fort sur les tâches étroites affinées et les langues nationales suisses ; en retrait des plus grands modèles internationaux sur le travail général ouvert

+ Atout
Traçabilité complète des données, inspectable par un auditeur ; origine et juridiction suisses

△ Compromis
Écosystème plus jeune et moins de tailles que les acteurs établis

Europe — basé en UE, poids ouverts

Mistral

Mistral AI (France)

Poids ouverts
Tailles
8B · ~24B · plus grand
Matériel
8B → workstation · 24B → un seul GPU 24–48 Go

Famille française ouverte et efficace, avec des versions permissives (Apache-2.0) et une forte couverture des langues européennes.

Idéal pour: Travail documentaire multilingue UE, rédaction et résumé avec un budget matériel serré

Performance & vitesse: Excellente capacité par paramètre ; vainqueur fréquent d'évaluation sur les tâches multilingues européennes

+ Atout
Basé en UE, licences permissives, très forte performance pour la taille

△ Compromis
Données d'entraînement non publiées ; les plus grands niveaux ne sont pas tous ouverts

Teuken · EuroLLM

OpenGPT-X / consortiums UE (Europe)

Ouvert · financé par l'UE
Tailles
7B · 9B
Matériel
→ workstation

Modèles européens financés sur fonds publics, entraînés pour une large couverture des langues de l'UE — les 24 langues officielles — avec une documentation exceptionnellement ouverte.

Idéal pour: Déploiements souverains UE voulant une provenance de recherche publique européenne et une large couverture linguistique

Performance & vitesse: Couverture multilingue solide à petite taille ; écosystème plus réduit et moins de points de contrôle affinés que Mistral

+ Atout
Provenance de la recherche publique européenne ; large couverture des langues officielles

△ Compromis
Plus petit et moins éprouvé que les leaders du marché

International — meilleure performance ouverte

Llama

Meta (États-Unis)

Poids ouverts · licence communautaire
Tailles
8B · 70B · plus grand
Matériel
8B → workstation · 70B → nœud

La famille ouverte de Meta — l'outillage et l'écosystème communautaire les plus matures de tout modèle ouvert.

Idéal pour: Bases de référence généralistes et outillage agentique où la maturité de l'écosystème compte

Performance & vitesse: Forte capacité générale sur toutes les tailles ; un concurrent d'évaluation fiable

+ Atout
Écosystème, outillage et support d'affinage inégalés

△ Compromis
Origine américaine ; une licence communautaire avec restrictions d'usage ; données d'entraînement non publiques

Qwen

Alibaba (Chine)

Poids ouverts (Apache-2.0)
Tailles
7B–72B dense · 235B MoE
Matériel
8B → workstation · 32B → un seul GPU · 72B / MoE → nœud

Parmi les modèles ouverts les plus forts en raisonnement, code et travail multilingue, avec la plus large gamme de tailles — dont des mixtures d'experts économes en mémoire.

Idéal pour: Les tâches ouvertes les plus exigeantes où la capacité prime et où la politique le permet

Performance & vitesse: Niveau de pointe ouvert sur les benchmarks de raisonnement et multilingues ; les variantes MoE tournent plus vite qu'un modèle dense de même taille totale

+ Atout
Meilleure performance ouverte, licences permissives, une taille pour chaque budget matériel

△ Compromis
Origine chinoise — certaines politiques d'achat publiques suisses et européennes l'excluent ; données d'entraînement non publiques

Gemma

Google (États-Unis)

Poids ouverts
Tailles
2B · 9B · 27B
Matériel
→ workstation (toutes tailles)

La famille ouverte compacte de Google, réglée pour une forte qualité aux petites et moyennes tailles tenant sur un seul GPU.

Idéal pour: Charges mono-GPU et en périphérie sensibles à la latence

Performance & vitesse: Qualité par paramètre compétitive dans la gamme petite et moyenne

+ Atout
Petit, rapide, facile à faire tourner sur du matériel modeste

△ Compromis
Origine américaine ; plafonné à 27B ; données d'entraînement non publiques

Dimensionner le matériel derrière tout cela est une discipline à part — voir la quantification pour comment un 70B tient dans ~40 Go et un 8B en moins de 5 Go, et le runtime souverain pour les formes de déploiement.

L'économie

Un ordre de grandeur moins cher à exploiter — et plus rapide.

Les petits modèles ne rentrent pas seulement dans votre enveloppe de conformité. Ils rentrent dans votre budget — en francs et en millisecondes.

Coût de service : faire tourner un modèle 7–8B coûte environ un ordre de grandeur de moins qu'un modèle de classe 70B — la différence entre un GPU de classe workstation et un nœud multi-GPU, entre un bon de commande et un cycle d'achat.

Latence : chaque appel d'API cloud paie une taxe d'aller-retour — sauts réseau, TLS, mise en file derrière d'autres locataires — avant même que vos tokens n'atteignent un GPU ; les premiers tokens n'arrivent souvent qu'après plusieurs centaines de millisecondes. Un petit modèle dans votre propre rack évite entièrement cette taxe, et son prefill et son decode plus rapides s'y ajoutent — c'est ce qui rend les pipelines documentaires à fort volume et les assistants interactifs instantanés.

Le multiplicateur de souveraineté : chaque paramètre dont vous n'avez pas besoin est de la conformité que vous n'avez pas à acheter. Un petit modèle spécialisé par tâche tourne sur une seule machine — la forme workstation dans le runtime souverain — ce qui ouvre les déploiements air-gapped et en périphérie (atelier, clinique, service terrain) où les plateformes hébergées et les API américaines ne peuvent structurellement pas suivre.

Les limites

Quand un petit modèle est le mauvais choix.

Un expert qui ne vous dit pas quand son outil préféré perd n'est pas un expert. Les petits modèles perdent ici :

Assistance ouverte

« Répondre à tout sur tout » récompense l'échelle. Si vous avez besoin d'un assistant de conversation général sur des connaissances publiques, un modèle de pointe s'en sort mieux.

Vaste connaissance du monde

Les petits modèles en savent moins. La recherche comble l'écart seulement là où votre corpus a la réponse — elle ne peut pas récupérer ce que personne n'a écrit.

Raisonnement profond multi-étapes

Les longues chaînes de raisonnement inédit favorisent encore les modèles plus grands. Le volume routinier va au petit ; la queue difficile escalade vers un modèle local plus grand.

Travail non sensible et à faible volume

Si les données peuvent sortir et que le volume est trivial, un abonnement API est plus simple. Nous le dirons lors de l'appel de cadrage.

La ligne de partage n'est pas une opinion — c'est le jeu d'évaluation. C'est pourquoi chaque engagement commence par en construire un : la livraison guidée par l'évaluation.

FAQ

Questions sur les petits modèles.

Un modèle 8B est-il vraiment assez bon pour du texte juridique ou clinique en allemand ?
Pour une tâche cadrée, généralement oui — mais nous ne vous demandons jamais de le croire sur parole. Chaque engagement commence par construire un jeu d'évaluation à partir de vos propres documents et y mesurer le modèle de base, le RAG, l'affinage et la combinaison. Si le petit modèle ne franchit pas la barre convenue d'emblée, vous le voyez dans le rapport avant de dépenser en production. L'Apertus-8B affiné du Canton du Tessin fait tourner la traduction cantonale en production à 94 % de précision — le schéma est réel, mais l'évaluation décide pour votre tâche.
Pouvez-vous utiliser une base non suisse comme Mistral ou Qwen — et l'EU AI Act l'autorise-t-il ?
Oui. Apertus est notre choix par défaut parce qu'il est entièrement suisse et la seule base à publier ses données d'entraînement — mais si votre politique l'autorise, un modèle européen comme Mistral ou international comme Qwen peut entrer dans l'évaluation et être livré s'il gagne, tournant toujours sur votre propre infrastructure avec des poids qui vous appartiennent. Sur l'AI Act précisément : il classe les systèmes selon le risque d'usage et impose des devoirs de transparence au fournisseur du modèle — il ne restreint pas un modèle de base selon le pays d'origine. Le vrai verrou est généralement votre propre politique d'achat et de gouvernance des données, que nous cadrons avec vous. Pas un conseil juridique — nous travaillons aux côtés de vos équipes conformité et juridique.
Et le travail à forte charge de raisonnement ?
Le raisonnement profond en plusieurs étapes sur des questions ouvertes est là où la taille du modèle paie encore. Notre réponse est architecturale, pas idéologique — un petit modèle gère le volume routinier, et les requêtes qu'il ne peut pas traiter avec confiance escaladent vers un modèle ouvert plus grand tournant sur la même infrastructure. Rien n'escalade vers une API cloud. La page du runtime souverain décrit le fonctionnement de ce routeur.
L'affinage ne devient-il pas obsolète à chaque nouveau modèle de base meilleur ?
Les actifs coûteux survivent aux changements de modèle. Votre jeu d'évaluation, vos données d'entraînement soignées et votre corpus de recherche se reportent tous inchangés ; ré-exécuter un affinage LoRA sur un modèle de base plus récent est une affaire de jours, pas une reconstruction. C'est aussi pourquoi nous restons agnostiques au modèle — Apertus, Mistral, Llama ou Qwen, celui qui gagne sur votre jeu d'évaluation au sein du niveau que votre conformité autorise.

Un petit modèle franchirait-il votre barre ?

Un workflow, vos documents, notre harnais. Nous construirons le jeu d'évaluation et vous montrerons l'ablation — dans votre juridiction.