Exemple concret · Évaluation
L'affinage d'un petit modèle aide-t-il vraiment ?
Pas une opinion — une mesure. Nous avons pris Apertus-8B et exécuté la même ablation en quatre volets que nous menons au début de chaque pilote, sur une tâche dont la réponse peut être notée exactement : répondre à des questions sur les circulaires FINMA suisses avec une citation du numéro de marge exact sur lequel elle repose. Le résultat : l'affinage plus la recherche double la barre de production — 22,4 % à 45,4 %.
Le dispositif
Quatre systèmes, un modèle ouvert.
Le même Apertus-8B, quantifié à l'identique en 4 bits, servi à l'identique. La seule variable est ce que nous avons ajouté.
Base
Le modèle ouvert, tel que livré.
+ Recherche
Modèle de base avec recherche BM25 sur les circulaires.
Affiné
Ajusté par LoRA sur la tâche, sans recherche.
Affiné + recherche
Le système complet.
Deux choses sont notées, toutes deux de façon déterministe — sans juge LLM : la réponse est-elle correcte, et a-t-elle cité le bon Rz dans la bonne circulaire. La barre de production, c'est les deux à la fois — une bonne réponse avec une citation fausse ou manquante est un échec, parce que dans le travail régulé c'en est un.
Le résultat
L'affinage plus la recherche double la barre de production.
183 questions vérifiées par des humains (101 allemand, 82 anglais, 10 circulaires). Les crochets sont des intervalles de confiance à 95 %.
| Métrique | A · base | B · +RAG | C · affiné | D · affiné+RAG |
|---|---|---|---|---|
| Réponse + citation (barre de production) | 0.0% | 22.4% | 1.6% | 45.4% |
| Réponse correcte | 37.2% | 63.4% | 44.8% | 80.9% |
| Citation correcte | 1.1% | 39.9% | 2.2% | 50.3% |
| Émet le format requis | 2.2% | 0.0% | 100% | 100% |
Ce qu'apporte chaque couche
L'ablation empêche quiconque — nous compris — de faire du vent.
Chaque carte ci-dessous rattache un mécanisme à un chiffre du tableau ci-dessus.
La recherche rend la citation possible
La citation correcte passe de ~1 % à ~40–50 % uniquement quand la recherche est activée. Un modèle ne peut pas citer un numéro de marge qu'il n'a jamais vu — d'où les deux volets sans recherche proches de zéro sur la barre de production, aussi bien entraînés soient-ils.
L'affinage rend la sortie utilisable
Le modèle de base connaît souvent la réponse (63 % avec RAG) mais n'émet le format requis, exploitable par machine, que 2 % du temps — 0 % dès que la recherche remplit le contexte et le distrait. L'affiné réussit le format 100 % du temps. Cet écart est l'essentiel de B → D.
Les deux se cumulent
La recherche seule ajoute 22,4 points ; l'affinage seul en ajoute 1,6. Ensemble, ils ajoutent 45,4 — près du double de la somme des parties. Cette interaction est le résultat, et c'est pourquoi nous mesurons avant de construire.
Cela ressemble à ceci
Même question, même texte récupéré.
Le modèle de base n'est pas bête — il est peu fiable dans la forme. La fiabilité de la forme est ce qui sépare une démo d'un système.
Q. Pour les banques, maisons de titres et groupes financiers, à partir de quelle exigence minimale de fonds propres les exigences pleinement qualitatives et quantitatives s'appliquent-elles ? (référence : CHF 10 milliards, Rz 6, FINMA-RS 2010/01)
CHF 10 milliards
Bonne réponse, aucune citation → échoue
ANSWER: CHF 10 milliards SOURCE: FINMA-RS 2010/01 Rz 6
Passe
Les limites honnêtes
Ce que cela ne prétend pas.
Une évaluation à laquelle vous pouvez vous fier est une évaluation qui nomme ses points faibles.
45 %, c'est un plancher, pas un plafond. Un petit modèle, 4 bits, une seule exécution LoRA modeste sur ~500 exemples, une recherche BM25 délibérément simple. Chacun de ces éléments est un levier qu'un vrai pilote actionne.
Les réponses structurées sont le point faible. Affiné+RAG obtient ~47–50 % sur les nombres, durées et oui/non, mais 27 % sur les questions à liste d'éléments multiples. L'extraction d'ensembles complets est la cible évidente suivante.
La méthode est le produit, pas le chiffre. Votre tâche, vos documents, cette ablation exacte — exécutée avant que vous vous engagiez en production, afin que la décision go/no-go repose sur la mesure, pas sur une promesse.
FAQ
À propos de ce rapport.
Est-ce sur les données de vos clients ?
Pourquoi 45 % en titre et pas quelque chose de plus élevé ?
Comment est-ce noté — y a-t-il un juge LLM ?
Vous voulez cela sur votre tâche ?
Apportez un workflow et les documents qui le sous-tendent. Nous construirons le jeu d'évaluation et exécuterons cette ablation — sur vos données, dans votre juridiction.