Concepts · Évaluation
Si nous ne pouvons pas le mesurer, nous ne le livrons pas.
Chaque fournisseur d'IA promet de la qualité. Nous la définissons avec vous comme un nombre, sur vos documents, avant de construire — et y conditionnons la mise en service. Cette page explique la mécanique derrière cette promesse.
Une ablation reproductible en quatre volets d'Apertus-8B sur des Q&R relatives aux circulaires FINMA suisses — exactement l'évaluation décrite ci-dessous, exécutée sur des données publiques.
Étape un
Le jeu d'évaluation précède le modèle.
Construit à partir de vos documents, avec vos experts, dans vos langues — c'est le contrat face auquel le système est construit.
Nous nous asseyons avec vos experts métier et extrayons à quoi ressemble « fait correctement » : de vrais intrants de votre workflow — contrats, sinistres, notes, courriers — associés à des réponses de référence et évalués selon des critères que vous validez. Typiquement 50–300 tâches couvrant vos types de documents, vos langues (DE/FR/IT selon les besoins) et vos cas limites connus, y compris les plus ingrats : fax scannés, fichiers multilingues, les exceptions que votre équipe traite en pilote automatique.
Ce jeu est délibérément construit avant le début de la modélisation, afin qu'il ne puisse pas être discrètement ajusté vers ce que le modèle fait bien par hasard. Il reste le vôtre — versionné, documenté et réutilisable face à tout modèle ou fournisseur futur, y compris celui qui nous remplacera.
Étape deux
L'ablation en quatre volets.
Un tableau qui tue le battage dans les deux sens — le nôtre inclus.
Modèle de base
Le modèle ouvert, non modifié. Le plancher honnête — et parfois une surprise : s'il franchit déjà la barre, vous ne devriez pas payer pour l'affinage.
+ Recherche
Modèle de base ancré dans votre corpus. Montre ce qu'apporte un meilleur accès à vos documents — généralement le plus grand saut à lui seul.
+ Affinage
Modèle entraîné sur votre tâche sans recherche. Montre ce qu'apporte le comportement appris : format, terminologie, ton, discipline de refus.
Les deux
Le candidat de production. Si D n'est pas nettement meilleur que B et C, le rapport le dit et vous achetez le système le moins cher.
Sur l'exemple concret FINMA, ce tableau se lit 0 → 22,4 → 1,6 → 45,4 % sur la barre de production de A à D : la recherche seule fait un cinquième du chemin, l'affinage seul presque nulle part, et seule la combinaison double la recherche. La même ablation couvre le choix du modèle — Apertus vs. Llama vs. Mistral sur votre jeu, et versions en pleine précision vs. quantifiées — de sorte que chaque décision architecturale de votre système remonte à un écart mesuré, pas à une préférence. (Pourquoi nous sommes stricts sur ce que l'affinage peut et ne peut pas faire : petits modèles, mesurés.)
Étape trois
Des métriques qui mordent, des garde-fous avec des tests.
« Ça semble bien » n'est pas une métrique. Un score de benchmark issu de la tâche d'un autre non plus.
Les métriques de tâche collent au travail : précision par correspondance exacte pour les champs extraits, scores par grille pour la rédaction, précision de la réponse plus fidélité de la citation pour les Q&R — une réponse correcte avec une source fabriquée compte comme un échec, parce que dans le travail régulé c'en est un.
Les garde-fous sont testés comme des fonctionnalités : traitement des PII, refus hors périmètre, résistance à l'injection de prompt et contraintes de sortie obtiennent chacun des cas de test adverses dans le jeu d'évaluation. Un garde-fou non testé est un vœu.
Le point de décision : la barre est convenue dans la proposition. Au-dessus, mise en service. En dessous, une analyse d'écart documentée et une décision — le combler, ou arrêter. Dans les deux cas, vous le savez avant de dépenser l'argent de la production.
En production
L'évaluation ne s'arrête pas à la mise en service.
Les modèles dérivent, les documents changent, les utilisateurs trouvent les failles. Le jeu d'évaluation continue de veiller.
Notation continue
Des échantillons de production sont notés face aux mêmes métriques à une cadence fixe, de sorte que les régressions de qualité apparaissent comme des nombres sur un tableau de bord — pas comme des plaintes trois mois plus tard.
Dérive & changement de données
Nouveaux types de documents, nouvelle formulation de politique, nouveaux cas limites sont ajoutés au jeu d'évaluation dès leur apparition. Le jeu grandit avec votre réalité ; le système est revalidé face à lui.
Tout versionné
Jeux d'évaluation, versions de modèle et leurs scores sont versionnés ensemble. Chaque réponse journalisée remonte à la version du modèle et à la version d'évaluation qui l'ont produite — aussi longtemps que votre politique de rétention conserve le journal. Cette traçabilité est ce que vos auditeurs demanderont.
FAQ
Questions sur l'évaluation.
Quelle taille doit avoir un jeu d'évaluation ?
Qui définit ce que signifie « correct » ?
Que se passe-t-il si le système n'atteint pas la barre ?
Définissez la barre avec nous.
Apportez un workflow et les experts qui le connaissent. Nous façonnerons le jeu d'évaluation et les métriques lors de l'appel de cadrage.