Aller au contenu

Exemple concret · Industrie manufacturière

L'affinage aide-t-il sur le droit de la sécurité des produits ?

Pas une opinion — une mesure. Nous avons pris Apertus-8B et exécuté la même ablation en quatre volets que nous menons au début de chaque pilote, sur une tâche dont la réponse peut être notée exactement : répondre à des questions sur la loi suisse sur la sécurité des produits avec une citation de l'article exact sur lequel elle repose. Le résultat : l'affinage plus la recherche porte la barre de production de 45,0 % à 60,0 %.

Le dispositif

Quatre systèmes, un modèle ouvert.

Le même Apertus-8B, quantifié à l'identique en 4 bits, servi à l'identique. La seule variable est ce que nous avons ajouté.

A

Base

Le modèle ouvert, tel que livré.

B

+ Recherche

Modèle de base avec recherche BM25 sur la loi.

C

Affiné

Ajusté par LoRA sur la tâche, sans recherche.

D

Affiné + recherche

Le système complet.

Deux choses sont notées, toutes deux de façon déterministe — sans juge LLM : la réponse est-elle correcte, et a-t-elle cité le bon article. La barre de production, c'est les deux à la fois — une bonne réponse avec une citation fausse ou manquante est un échec, parce que dans le travail régulé c'en est un.

Le résultat

L'affinage plus la recherche est le système gagnant.

20 questions vérifiées (14 allemand, 6 français). Les crochets dans le rapport sont des intervalles de confiance à 95 %.

Réponse correcte Réponse + citation (barre de production) Système complet (D)
A · Base
50%
15%
B · + Recherche
90%
45%
C · Affiné
65%
10%
D · Affiné + recherche le système complet
65%
60%
0%25%50%75%100%
Lisez la ligne de la barre de production : quasi nulle sans recherche (A, C), 45,0 % avec la recherche seule (B), et seuls l'affinage et la recherche ensemble atteignent 60,0 % (D, en rouge).
Métrique A · base B · +RAG C · affiné D · affiné+RAG
Réponse + citation (barre de production) 15.0% 45.0% 10.0% 60.0%
Réponse correcte 50.0% 90.0% 65.0% 65.0%
Citation correcte 15.0% 50.0% 15.0% 85.0%
Émet le format requis 10% 0% 95% 95%

Ce qu'apporte chaque couche

L'ablation empêche quiconque — nous compris — de faire du vent.

Chaque carte rattache un mécanisme à un chiffre du tableau ci-dessus.

La recherche rend la citation possible

La citation correcte grimpe de 15,0 % à 50,0 % uniquement quand la recherche est activée. Un petit modèle ne peut pas citer un numéro d'article qu'il n'a jamais vu — d'où les deux volets sans recherche proches de zéro sur la barre de production, aussi bien entraînés soient-ils.

L'affinage rend la sortie utilisable

Le modèle de base connaît souvent la réponse (90,0 % avec RAG) mais n'émet le format à deux lignes requis, exploitable par machine, que 10 % du temps. L'affinage le rend fiable (95 %) et porte la citation sous recherche à 85,0 %.

L'affinage seul ne suffit pas

Le volet C — affiné, sans recherche — atteint 95 % de format mais seulement 15,0 % de citation et 65,0 % de réponse : le modèle apprend à répondre, pas les faits exacts. Le système gagnant est la combinaison, le volet D à 60,0 %.

Les limites honnêtes

Ce que cela ne prétend pas.

Une évaluation à laquelle vous pouvez vous fier nomme ses points faibles.

60,0 %, c'est un plancher, pas un plafond. Un petit modèle, 4 bits, une seule exécution LoRA modeste, une recherche BM25 délibérément simple, un jeu d'évaluation vérifié compact (n=20). Chacun de ces éléments est un levier qu'un vrai pilote actionne.

L'affinage seul peut régresser. La précision de réponse du volet C est en dessous du modèle de base — preuve que l'affinage sans recherche est le mauvais outil pour les tâches à citation exacte. Nous le publions plutôt que de le cacher.

La méthode est le produit, pas le chiffre. Votre tâche, vos documents, cette ablation exacte — exécutée avant que vous vous engagiez en production, afin que le go/no-go repose sur la mesure, pas sur une promesse.

FAQ

À propos de ce rapport.

Est-ce sur nos données ?
Non — délibérément. Cela tourne entièrement sur le texte Fedlex public et figé de la LSPro pour que quiconque puisse le reproduire. Dans un pilote, la méthode identique tourne sur vos dossiers techniques et votre documentation CE, dans votre environnement, et le rapport reste le vôtre.
22 articles, n'est-ce pas trop peu pour compter ?
C'est une loi compacte, et nous la rapportons comme telle — un jeu d'évaluation plus petit et un affinage plus petit. Le point est que la même méthode se transfère proprement à un domaine réglementaire réduit et autonome, avec la même notation déterministe et le même harnais ouvert.
Y a-t-il un juge LLM ?
Aucun juge LLM nulle part. La LSPro numérote ses articles ; une citation correcte est exactement vérifiable. La précision de la réponse est une correspondance de chaîne/nombre face à une réponse de référence vérifiée ; la citation est une correspondance exacte d'article. Chaque chiffre est recalculé à partir d'enregistrements d'exécution figés avec des intervalles de Wilson à 95 %.

Vous voulez cela sur votre tâche ?

Apportez un workflow et les documents qui le sous-tendent. Nous construirons le jeu d'évaluation et exécuterons cette ablation — sur vos données, dans votre juridiction.