Aller au contenu

Exemple concret · État & secteur public

L'affinage aide-t-il sur la protection des données suisse ?

Pas une opinion — une mesure. Nous avons pris Apertus-8B et exécuté la même ablation en quatre volets que nous menons au début de chaque pilote, sur une tâche dont la réponse peut être notée exactement : répondre à des questions sur la loi suisse révisée sur la protection des données avec une citation de l'article exact sur lequel elle repose. Le résultat : l'affinage plus la recherche porte la barre de production de 37,0 % à 54,3 %.

Le dispositif

Quatre systèmes, un modèle ouvert.

Le même Apertus-8B, quantifié à l'identique en 4 bits, servi à l'identique. La seule variable est ce que nous avons ajouté.

A

Base

Le modèle ouvert, tel que livré.

B

+ Recherche

Modèle de base avec recherche BM25 sur la loi.

C

Affiné

Ajusté par LoRA sur la tâche, sans recherche.

D

Affiné + recherche

Le système complet.

Deux choses sont notées, toutes deux de façon déterministe — sans juge LLM : la réponse est-elle correcte, et a-t-elle cité le bon article. La barre de production, c'est les deux à la fois — une bonne réponse avec une citation fausse ou manquante est un échec, parce que dans le travail régulé c'en est un.

Le résultat

L'affinage plus la recherche est le système gagnant.

46 questions vérifiées (32 allemand, 14 français). Les crochets dans le rapport sont des intervalles de confiance à 95 %.

Réponse correcte Réponse + citation (barre de production) Système complet (D)
A · Base
50%
4.3%
B · + Recherche
82.6%
37%
C · Affiné
32.6%
0%
D · Affiné + recherche le système complet
60.9%
54.3%
0%25%50%75%100%
Lisez la ligne de la barre de production : quasi nulle sans recherche (A, C), 37,0 % avec la recherche seule (B), et seuls l'affinage et la recherche ensemble atteignent 54,3 % (D, en rouge).
Métrique A · base B · +RAG C · affiné D · affiné+RAG
Réponse + citation (barre de production) 4.3% 37.0% 0.0% 54.3%
Réponse correcte 50.0% 82.6% 32.6% 60.9%
Citation correcte 4.3% 45.7% 2.2% 82.6%
Émet le format requis 2% 0% 100% 93%

Ce qu'apporte chaque couche

L'ablation empêche quiconque — nous compris — de faire du vent.

Chaque carte rattache un mécanisme à un chiffre du tableau ci-dessus.

La recherche rend la citation possible

La citation correcte grimpe de 4,3 % à 45,7 % uniquement quand la recherche est activée. Un petit modèle ne peut pas citer un numéro d'article qu'il n'a jamais vu — d'où les deux volets sans recherche proches de zéro sur la barre de production, aussi bien entraînés soient-ils.

L'affinage rend la sortie utilisable

Le modèle de base connaît souvent la réponse (82,6 % avec RAG) mais n'émet le format à deux lignes requis, exploitable par machine, que 2 % du temps. L'affinage le rend fiable (93 %) et porte la citation sous recherche à 82,6 %.

L'affinage seul ne suffit pas

Le volet C — affiné, sans recherche — atteint 100 % de format mais seulement 2,2 % de citation et 32,6 % de réponse : le modèle apprend à répondre, pas les faits exacts. Le système gagnant est la combinaison, le volet D à 54,3 %.

Les limites honnêtes

Ce que cela ne prétend pas.

Une évaluation à laquelle vous pouvez vous fier nomme ses points faibles.

54,3 %, c'est un plancher, pas un plafond. Un petit modèle, 4 bits, une seule exécution LoRA modeste, une recherche BM25 délibérément simple, un jeu d'évaluation vérifié compact (n=46). Chacun de ces éléments est un levier qu'un vrai pilote actionne.

L'affinage seul peut régresser. La précision de réponse du volet C est en dessous du modèle de base — preuve que l'affinage sans recherche est le mauvais outil pour les tâches à citation exacte. Nous le publions plutôt que de le cacher.

La méthode est le produit, pas le chiffre. Votre tâche, vos documents, cette ablation exacte — exécutée avant que vous vous engagiez en production, afin que le go/no-go repose sur la mesure, pas sur une promesse.

FAQ

À propos de ce rapport.

Est-ce sur nos données ?
Non — délibérément. Cela tourne entièrement sur le texte Fedlex public et figé de la LPD pour que quiconque puisse le reproduire. Dans un pilote, la méthode identique tourne sur vos documents, dans votre environnement, et le rapport reste le vôtre.
Pourquoi l'affinage seul (volet C) échoue-t-il ?
Parce qu'un petit modèle ne peut pas rappeler de façon fiable les numéros d'articles exacts depuis ses paramètres. L'affinage enseigne le format réponse/citation et quel article régit quel sujet, mais la citation exacte a toujours besoin d'avoir le texte récupéré sous les yeux. C'est pourquoi le système gagnant est l'affinage plus la recherche, pas l'un ou l'autre seul.
Y a-t-il un juge LLM ?
Aucun juge LLM nulle part. La LPD numérote ses articles ; une citation correcte est exactement vérifiable. La précision de la réponse est une correspondance de chaîne/nombre face à une réponse de référence vérifiée ; la citation est une correspondance exacte d'article. Chaque chiffre est recalculé à partir d'enregistrements d'exécution figés avec des intervalles de Wilson à 95 %.

Vous voulez cela sur votre tâche ?

Apportez un workflow et les documents qui le sous-tendent. Nous construirons le jeu d'évaluation et exécuterons cette ablation — sur vos données, dans votre juridiction.