Aller au contenu

Concepts · Évaluation

Si nous ne pouvons pas le mesurer, nous ne le livrons pas.

Chaque fournisseur d'IA promet de la qualité. Nous la définissons avec vous comme un nombre, sur vos documents, avant de construire — et y conditionnons la mise en service. Cette page explique la mécanique derrière cette promesse.

Voir un exemple concret →

Une ablation reproductible en quatre volets d'Apertus-8B sur des Q&R relatives aux circulaires FINMA suisses — exactement l'évaluation décrite ci-dessous, exécutée sur des données publiques.

Étape un

Le jeu d'évaluation précède le modèle.

Construit à partir de vos documents, avec vos experts, dans vos langues — c'est le contrat face auquel le système est construit.

Nous nous asseyons avec vos experts métier et extrayons à quoi ressemble « fait correctement » : de vrais intrants de votre workflow — contrats, sinistres, notes, courriers — associés à des réponses de référence et évalués selon des critères que vous validez. Typiquement 50–300 tâches couvrant vos types de documents, vos langues (DE/FR/IT selon les besoins) et vos cas limites connus, y compris les plus ingrats : fax scannés, fichiers multilingues, les exceptions que votre équipe traite en pilote automatique.

Ce jeu est délibérément construit avant le début de la modélisation, afin qu'il ne puisse pas être discrètement ajusté vers ce que le modèle fait bien par hasard. Il reste le vôtre — versionné, documenté et réutilisable face à tout modèle ou fournisseur futur, y compris celui qui nous remplacera.

Étape deux

L'ablation en quatre volets.

Un tableau qui tue le battage dans les deux sens — le nôtre inclus.

A

Modèle de base

Le modèle ouvert, non modifié. Le plancher honnête — et parfois une surprise : s'il franchit déjà la barre, vous ne devriez pas payer pour l'affinage.

B

+ Recherche

Modèle de base ancré dans votre corpus. Montre ce qu'apporte un meilleur accès à vos documents — généralement le plus grand saut à lui seul.

C

+ Affinage

Modèle entraîné sur votre tâche sans recherche. Montre ce qu'apporte le comportement appris : format, terminologie, ton, discipline de refus.

D

Les deux

Le candidat de production. Si D n'est pas nettement meilleur que B et C, le rapport le dit et vous achetez le système le moins cher.

Sur l'exemple concret FINMA, ce tableau se lit 0 → 22,4 → 1,6 → 45,4 % sur la barre de production de A à D : la recherche seule fait un cinquième du chemin, l'affinage seul presque nulle part, et seule la combinaison double la recherche. La même ablation couvre le choix du modèle — Apertus vs. Llama vs. Mistral sur votre jeu, et versions en pleine précision vs. quantifiées — de sorte que chaque décision architecturale de votre système remonte à un écart mesuré, pas à une préférence. (Pourquoi nous sommes stricts sur ce que l'affinage peut et ne peut pas faire : petits modèles, mesurés.)

Étape trois

Des métriques qui mordent, des garde-fous avec des tests.

« Ça semble bien » n'est pas une métrique. Un score de benchmark issu de la tâche d'un autre non plus.

Les métriques de tâche collent au travail : précision par correspondance exacte pour les champs extraits, scores par grille pour la rédaction, précision de la réponse plus fidélité de la citation pour les Q&R — une réponse correcte avec une source fabriquée compte comme un échec, parce que dans le travail régulé c'en est un.

Les garde-fous sont testés comme des fonctionnalités : traitement des PII, refus hors périmètre, résistance à l'injection de prompt et contraintes de sortie obtiennent chacun des cas de test adverses dans le jeu d'évaluation. Un garde-fou non testé est un vœu.

Le point de décision : la barre est convenue dans la proposition. Au-dessus, mise en service. En dessous, une analyse d'écart documentée et une décision — le combler, ou arrêter. Dans les deux cas, vous le savez avant de dépenser l'argent de la production.

En production

L'évaluation ne s'arrête pas à la mise en service.

Les modèles dérivent, les documents changent, les utilisateurs trouvent les failles. Le jeu d'évaluation continue de veiller.

Notation continue

Des échantillons de production sont notés face aux mêmes métriques à une cadence fixe, de sorte que les régressions de qualité apparaissent comme des nombres sur un tableau de bord — pas comme des plaintes trois mois plus tard.

Dérive & changement de données

Nouveaux types de documents, nouvelle formulation de politique, nouveaux cas limites sont ajoutés au jeu d'évaluation dès leur apparition. Le jeu grandit avec votre réalité ; le système est revalidé face à lui.

Tout versionné

Jeux d'évaluation, versions de modèle et leurs scores sont versionnés ensemble. Chaque réponse journalisée remonte à la version du modèle et à la version d'évaluation qui l'ont produite — aussi longtemps que votre politique de rétention conserve le journal. Cette traçabilité est ce que vos auditeurs demanderont.

FAQ

Questions sur l'évaluation.

Quelle taille doit avoir un jeu d'évaluation ?
Plus petit que vous ne le craignez, plus grand qu'une démo. Cinquante tâches soigneusement choisies avec des réponses de référence séparent déjà « ça marche » de « ça impressionne » ; 150–300 permettent des ventilations par catégorie — types de documents, langues, cas limites — assez grandes pour agir. Nous rapportons des intervalles de confiance à côté des scores — sur des échantillons de cette taille, un écart de deux points est du bruit, et nous préférons vous le dire que vous le vendre. Vos experts métier y passent des heures, pas des semaines, et le jeu devient un actif durable qui survit à tout modèle particulier.
Qui définit ce que signifie « correct » ?
Vos experts, par écrit, avant que quoi que ce soit ne soit construit — des critères par type de tâche, validés (les types de métriques à l'étape trois). Nous refusons les critères de succès vagues parce que c'est ainsi que les pilotes finissent « réussis » et inutilisés.
Que se passe-t-il si le système n'atteint pas la barre ?
Le rapport le dit, avec les catégories d'échec détaillées — et la feuille de route de production explique ce qui comblerait l'écart et ce que cela coûterait, ou recommande d'arrêter. Un pilote à périmètre fixe qui peut se terminer par un « non » documenté est précisément ce qui donne de la valeur à son « oui ».

Définissez la barre avec nous.

Apportez un workflow et les experts qui le connaissent. Nous façonnerons le jeu d'évaluation et les métriques lors de l'appel de cadrage.