Aller au contenu

Exemple concret · Santé & Pharma

L'affinage aide-t-il sur la réglementation des produits thérapeutiques ?

Pas une opinion — une mesure. Nous avons pris Apertus-8B et exécuté la même ablation en quatre volets que nous menons au début de chaque pilote, sur une tâche dont la réponse peut être notée exactement : répondre à des questions sur la loi suisse sur les produits thérapeutiques avec une citation de l'article exact sur lequel elle repose. Le résultat : l'affinage plus la recherche porte la barre de production de 22,7 % à 68,2 %.

Le dispositif

Quatre systèmes, un modèle ouvert.

Le même Apertus-8B, quantifié à l'identique en 4 bits, servi à l'identique. La seule variable est ce que nous avons ajouté.

A

Base

Le modèle ouvert, tel que livré.

B

+ Recherche

Modèle de base avec recherche BM25 sur la loi.

C

Affiné

Ajusté par LoRA sur la tâche, sans recherche.

D

Affiné + recherche

Le système complet.

Deux choses sont notées, toutes deux de façon déterministe — sans juge LLM : la réponse est-elle correcte, et a-t-elle cité le bon article. La barre de production, c'est les deux à la fois — une bonne réponse avec une citation fausse ou manquante est un échec, parce que dans le travail régulé c'en est un.

Le résultat

L'affinage plus la recherche est le système gagnant.

22 questions vérifiées (14 allemand, 8 français). Les crochets dans le rapport sont des intervalles de confiance à 95 %.

Réponse correcte Réponse + citation (barre de production) Système complet (D)
A · Base
54.5%
4.5%
B · + Recherche
81.8%
22.7%
C · Affiné
59.1%
0%
D · Affiné + recherche le système complet
81.8%
68.2%
0%25%50%75%100%
Lisez la ligne de la barre de production : quasi nulle sans recherche (A, C), 22,7 % avec la recherche seule (B), et seuls l'affinage et la recherche ensemble atteignent 68,2 % (D, en rouge).
Métrique A · base B · +RAG C · affiné D · affiné+RAG
Réponse + citation (barre de production) 4.5% 22.7% 0.0% 68.2%
Réponse correcte 54.5% 81.8% 59.1% 81.8%
Citation correcte 13.6% 27.3% 4.5% 72.7%
Émet le format requis 0% 0% 100% 100%

Ce qu'apporte chaque couche

L'ablation empêche quiconque — nous compris — de faire du vent.

Chaque carte rattache un mécanisme à un chiffre du tableau ci-dessus.

La recherche rend la citation possible

La citation correcte grimpe de 13,6 % à 27,3 % uniquement quand la recherche est activée. Un petit modèle ne peut pas citer un numéro d'article qu'il n'a jamais vu — d'où les deux volets sans recherche proches de zéro sur la barre de production, aussi bien entraînés soient-ils.

L'affinage rend la sortie utilisable

Le modèle de base connaît souvent la réponse (81,8 % avec RAG) mais n'émet le format à deux lignes requis, exploitable par machine, que 0 % du temps. L'affinage le rend fiable (100 %) et porte la citation sous recherche à 72,7 %.

L'affinage seul ne suffit pas

Le volet C — affiné, sans recherche — atteint 100 % de format mais seulement 4,5 % de citation et 59,1 % de réponse : le modèle apprend à répondre, pas les faits exacts. Le système gagnant est la combinaison, le volet D à 68,2 %.

Les limites honnêtes

Ce que cela ne prétend pas.

Une évaluation à laquelle vous pouvez vous fier nomme ses points faibles.

68,2 %, c'est un plancher, pas un plafond. Un petit modèle, 4 bits, une seule exécution LoRA modeste, une recherche BM25 délibérément simple, un jeu d'évaluation vérifié compact (n=22). Chacun de ces éléments est un levier qu'un vrai pilote actionne.

L'affinage seul peut régresser. La précision de réponse du volet C est en dessous du modèle de base — preuve que l'affinage sans recherche est le mauvais outil pour les tâches à citation exacte. Nous le publions plutôt que de le cacher.

La méthode est le produit, pas le chiffre. Votre tâche, vos documents, cette ablation exacte — exécutée avant que vous vous engagiez en production, afin que le go/no-go repose sur la mesure, pas sur une promesse.

FAQ

À propos de ce rapport.

Est-ce sur nos données ?
Non — délibérément. Cela tourne entièrement sur le texte Fedlex public et figé de la LPTh pour que quiconque puisse le reproduire. Dans un pilote, la méthode identique tourne sur vos dossiers et SOP, dans votre environnement, et le rapport reste le vôtre.
Pourquoi l'affinage seul (volet C) échoue-t-il ?
Parce qu'un petit modèle ne peut pas rappeler de façon fiable les numéros d'articles exacts depuis ses paramètres. L'affinage enseigne le format réponse/citation et quel article régit quel sujet, mais la citation exacte a toujours besoin d'avoir le texte récupéré sous les yeux. Le système gagnant est l'affinage plus la recherche, pas l'un ou l'autre seul.
Y a-t-il un juge LLM ?
Aucun juge LLM nulle part. La LPTh numérote ses articles ; une citation correcte est exactement vérifiable. La précision de la réponse est une correspondance de chaîne/nombre face à une réponse de référence vérifiée ; la citation est une correspondance exacte d'article. Chaque chiffre est recalculé à partir d'enregistrements d'exécution figés avec des intervalles de Wilson à 95 %.

Vous voulez cela sur votre tâche ?

Apportez un workflow et les documents qui le sous-tendent. Nous construirons le jeu d'évaluation et exécuterons cette ablation — sur vos données, dans votre juridiction.