Exemple concret · Évaluation
Affiner un petit modèle pour le droit suisse des contrats.
Un deuxième exemple concret — même méthode que le rapport FINMA, un domaine différent : répondre à des questions sur le Code des obligations suisse (CO) avec une citation de l'article exact. Y compris une vraie erreur rencontrée en chemin, et comment l'ablation l'a attrapée.
Le dispositif
Quatre systèmes, un modèle ouvert.
Le même Apertus-8B, quantifié à l'identique en 4 bits, servi à l'identique. La seule variable, ce sont les poids. Noté de façon déterministe — sans juge LLM.
Base
Le modèle ouvert, tel que livré.
+ Recherche
Modèle de base avec recherche BM25 sur la loi.
Affiné
Ajusté par LoRA sur la tâche, sans recherche.
Affiné + recherche
Le système complet.
La barre de production, c'est les deux à la fois — la réponse correcte et le bon article cité. Une bonne réponse avec une citation fausse ou manquante est un échec, parce que dans le travail juridique c'en est un.
Le résultat
L'affinage plus la recherche est le meilleur système.
172 questions vérifiées par des humains (98 allemand, 74 français, 10 thèmes de droit des contrats). Les crochets sont des intervalles de confiance à 95 %.
| Métrique | A · base | B · +RAG | C · affiné | D · affiné+RAG |
|---|---|---|---|---|
| Réponse + citation (barre de production) | 4.1% | 38.4% | 2.9% | 52.3% |
| Réponse correcte | 39.0% | 54.7% | 46.5% | 70.3% |
| Citation correcte | 7.0% | 69.8% | 5.8% | 62.2% |
| Émet le format requis | 1.2% | 0.0% | 89.5% | 70.9% |
L'erreur qui méritait d'être publiée
Nous n'avons pas atteint 52 % du premier coup.
Le premier affinage a été entraîné de la manière évidente — sur des questions et leur réponse + citation, sans contexte récupéré. Seul, il paraissait excellent. Avec la recherche ajoutée, il s'est effondré.
Q. Une convention préalable excluant la responsabilité pour faute grave est-elle valable ? (référence : non, art. 100)
ANSWER: nein
Bonne réponse, aucune citation → échoue
ANSWER: nein SOURCE: OR Art. 100
Passe
La cause est un décalage de distribution entre entraînement et inférence : un modèle qui sera servi avec recherche doit être entraîné avec recherche. Nous avons reconstruit le jeu d'affinage pour que chaque exemple apparaisse à la fois brut et avec contexte récupéré — l'article de référence garanti présent — réentraîné, et la barre de production est passée de 8,1 % à 52,3 %. C'est exactement le type d'échec que l'ablation d'un pilote attrape avant qu'il n'atteigne la production. Nous mesurons pour ne pas le livrer.
Les limites honnêtes
Ce que cela ne prétend pas.
Une évaluation à laquelle vous pouvez vous fier est une évaluation qui nomme ses points faibles.
Les questions à réponse-liste notent près de zéro, dans chaque volet. Extraire un ensemble complet de plusieurs éléments et le citer est la sous-tâche la plus difficile ici et la cible évidente suivante — le même point faible que le rapport FINMA a signalé.
Le français est derrière l'allemand (D : 42 % FR vs 60 % DE), suivant le mélange d'entraînement (271 DE vs 123 FR éléments). Des données plus équilibrées comblent l'écart ; le chiffre est honnête sur les faiblesses actuelles du modèle.
La conformité de format est de 71 %, pas 100 %. L'affinage conscient de la recherche laisse encore tomber la citation sur certains éléments — bien mieux que les 16 % naïfs, pas parfait. C'est un plancher : un jeu d'entraînement plus grand et plus équilibré le fait monter davantage.
FAQ
À propos de ce rapport.
Est-ce la même méthode que le rapport FINMA ?
Pourquoi publier une erreur que vous avez commise ?
Comment est-ce noté — y a-t-il un juge LLM ?
Vous voulez cela sur votre tâche ?
Apportez un workflow et les documents qui le sous-tendent. Nous construirons le jeu d'évaluation et exécuterons cette ablation — y compris les modes d'échec qu'elle attrape — sur vos données, dans votre juridiction.