Aller au contenu

Exemple concret · Évaluation

Affiner un petit modèle pour le droit suisse des contrats.

Un deuxième exemple concret — même méthode que le rapport FINMA, un domaine différent : répondre à des questions sur le Code des obligations suisse (CO) avec une citation de l'article exact. Y compris une vraie erreur rencontrée en chemin, et comment l'ablation l'a attrapée.

Le dispositif

Quatre systèmes, un modèle ouvert.

Le même Apertus-8B, quantifié à l'identique en 4 bits, servi à l'identique. La seule variable, ce sont les poids. Noté de façon déterministe — sans juge LLM.

A

Base

Le modèle ouvert, tel que livré.

B

+ Recherche

Modèle de base avec recherche BM25 sur la loi.

C

Affiné

Ajusté par LoRA sur la tâche, sans recherche.

D

Affiné + recherche

Le système complet.

La barre de production, c'est les deux à la fois — la réponse correcte et le bon article cité. Une bonne réponse avec une citation fausse ou manquante est un échec, parce que dans le travail juridique c'en est un.

Le résultat

L'affinage plus la recherche est le meilleur système.

172 questions vérifiées par des humains (98 allemand, 74 français, 10 thèmes de droit des contrats). Les crochets sont des intervalles de confiance à 95 %.

Réponse correcte Réponse + citation (barre de production)
A · Base
39%
4.1%
B · + Recherche
54.7%
38.4%
C · Affiné
46.5%
2.9%
D · Affiné + recherche le système complet
70.3%
52.3%
0%25%50%75%100%
La barre de production (rouge) est quasi nulle sans recherche (A, C), atteint 38,4 % avec la recherche seule (B), et culmine à 52,3 % seulement quand l'affinage et la recherche se combinent (D) — la même forme que le résultat FINMA, sur un autre corpus de droit.
Métrique A · base B · +RAG C · affiné D · affiné+RAG
Réponse + citation (barre de production) 4.1% 38.4% 2.9% 52.3%
Réponse correcte 39.0% 54.7% 46.5% 70.3%
Citation correcte 7.0% 69.8% 5.8% 62.2%
Émet le format requis 1.2% 0.0% 89.5% 70.9%

L'erreur qui méritait d'être publiée

Nous n'avons pas atteint 52 % du premier coup.

Le premier affinage a été entraîné de la manière évidente — sur des questions et leur réponse + citation, sans contexte récupéré. Seul, il paraissait excellent. Avec la recherche ajoutée, il s'est effondré.

Affinage naïf + RAG
8.1%pire que B
Conscient de la recherche + RAG
52.3%
Le volet D sur la barre de production. Le modèle naïf — à qui l'on montrait des passages récupérés jamais vus à l'entraînement — est revenu à des réponses laconiques et a laissé tomber la ligne de citation, notant en dessous du modèle de base avec recherche (38,4 %). La conformité de format à l'entraînement sous recherche est tombée à 16 %.

Q. Une convention préalable excluant la responsabilité pour faute grave est-elle valable ? (référence : non, art. 100)

Affinage naïf + RAG
ANSWER: nein

Bonne réponse, aucune citation → échoue

Conscient de la recherche + RAG
ANSWER: nein
SOURCE: OR Art. 100

Passe

La cause est un décalage de distribution entre entraînement et inférence : un modèle qui sera servi avec recherche doit être entraîné avec recherche. Nous avons reconstruit le jeu d'affinage pour que chaque exemple apparaisse à la fois brut et avec contexte récupéré — l'article de référence garanti présent — réentraîné, et la barre de production est passée de 8,1 % à 52,3 %. C'est exactement le type d'échec que l'ablation d'un pilote attrape avant qu'il n'atteigne la production. Nous mesurons pour ne pas le livrer.

Les limites honnêtes

Ce que cela ne prétend pas.

Une évaluation à laquelle vous pouvez vous fier est une évaluation qui nomme ses points faibles.

Les questions à réponse-liste notent près de zéro, dans chaque volet. Extraire un ensemble complet de plusieurs éléments et le citer est la sous-tâche la plus difficile ici et la cible évidente suivante — le même point faible que le rapport FINMA a signalé.

Le français est derrière l'allemand (D : 42 % FR vs 60 % DE), suivant le mélange d'entraînement (271 DE vs 123 FR éléments). Des données plus équilibrées comblent l'écart ; le chiffre est honnête sur les faiblesses actuelles du modèle.

La conformité de format est de 71 %, pas 100 %. L'affinage conscient de la recherche laisse encore tomber la citation sur certains éléments — bien mieux que les 16 % naïfs, pas parfait. C'est un plancher : un jeu d'entraînement plus grand et plus équilibré le fait monter davantage.

FAQ

À propos de ce rapport.

Est-ce la même méthode que le rapport FINMA ?
Oui — délibérément. Même ablation en quatre volets, même notation déterministe, même modèle de base, sur un secteur différent (juridique) et un type de document différent (une loi, pas des circulaires). Reproduire le résultat sur un second corpus de droit est le but : la méthode se généralise.
Pourquoi publier une erreur que vous avez commise ?
Parce que c'est la partie la plus utile. Notre premier affinage a été entraîné sans contexte de recherche et s'est effondré lorsque la recherche a été ajoutée — pire que le modèle de base. C'est exactement le type d'échec que l'ablation d'un vrai pilote est conçue pour attraper avant qu'il n'atteigne la production. Nous l'avons corrigé en entraînant le modèle tel qu'il est servi ; le rapport montre les deux.
Comment est-ce noté — y a-t-il un juge LLM ?
Aucun juge LLM nulle part. Le Code des obligations numérote chaque disposition, de sorte qu'une citation correcte est exactement vérifiable. La précision de la réponse est une correspondance de chaîne/nombre face à une réponse de référence vérifiée ; la citation est une correspondance exacte du numéro d'article. Chaque chiffre est recalculé à partir d'enregistrements d'exécution figés.

Vous voulez cela sur votre tâche ?

Apportez un workflow et les documents qui le sous-tendent. Nous construirons le jeu d'évaluation et exécuterons cette ablation — y compris les modes d'échec qu'elle attrape — sur vos données, dans votre juridiction.