Exemple concret · Santé & Pharma
L'affinage aide-t-il sur la réglementation des produits thérapeutiques ?
Pas une opinion — une mesure. Nous avons pris Apertus-8B et exécuté la même ablation en quatre volets que nous menons au début de chaque pilote, sur une tâche dont la réponse peut être notée exactement : répondre à des questions sur la loi suisse sur les produits thérapeutiques avec une citation de l'article exact sur lequel elle repose. Le résultat : l'affinage plus la recherche porte la barre de production de 22,7 % à 68,2 %.
Le dispositif
Quatre systèmes, un modèle ouvert.
Le même Apertus-8B, quantifié à l'identique en 4 bits, servi à l'identique. La seule variable est ce que nous avons ajouté.
Base
Le modèle ouvert, tel que livré.
+ Recherche
Modèle de base avec recherche BM25 sur la loi.
Affiné
Ajusté par LoRA sur la tâche, sans recherche.
Affiné + recherche
Le système complet.
Deux choses sont notées, toutes deux de façon déterministe — sans juge LLM : la réponse est-elle correcte, et a-t-elle cité le bon article. La barre de production, c'est les deux à la fois — une bonne réponse avec une citation fausse ou manquante est un échec, parce que dans le travail régulé c'en est un.
Le résultat
L'affinage plus la recherche est le système gagnant.
22 questions vérifiées (14 allemand, 8 français). Les crochets dans le rapport sont des intervalles de confiance à 95 %.
| Métrique | A · base | B · +RAG | C · affiné | D · affiné+RAG |
|---|---|---|---|---|
| Réponse + citation (barre de production) | 4.5% | 22.7% | 0.0% | 68.2% |
| Réponse correcte | 54.5% | 81.8% | 59.1% | 81.8% |
| Citation correcte | 13.6% | 27.3% | 4.5% | 72.7% |
| Émet le format requis | 0% | 0% | 100% | 100% |
Ce qu'apporte chaque couche
L'ablation empêche quiconque — nous compris — de faire du vent.
Chaque carte rattache un mécanisme à un chiffre du tableau ci-dessus.
La recherche rend la citation possible
La citation correcte grimpe de 13,6 % à 27,3 % uniquement quand la recherche est activée. Un petit modèle ne peut pas citer un numéro d'article qu'il n'a jamais vu — d'où les deux volets sans recherche proches de zéro sur la barre de production, aussi bien entraînés soient-ils.
L'affinage rend la sortie utilisable
Le modèle de base connaît souvent la réponse (81,8 % avec RAG) mais n'émet le format à deux lignes requis, exploitable par machine, que 0 % du temps. L'affinage le rend fiable (100 %) et porte la citation sous recherche à 72,7 %.
L'affinage seul ne suffit pas
Le volet C — affiné, sans recherche — atteint 100 % de format mais seulement 4,5 % de citation et 59,1 % de réponse : le modèle apprend à répondre, pas les faits exacts. Le système gagnant est la combinaison, le volet D à 68,2 %.
Les limites honnêtes
Ce que cela ne prétend pas.
Une évaluation à laquelle vous pouvez vous fier nomme ses points faibles.
68,2 %, c'est un plancher, pas un plafond. Un petit modèle, 4 bits, une seule exécution LoRA modeste, une recherche BM25 délibérément simple, un jeu d'évaluation vérifié compact (n=22). Chacun de ces éléments est un levier qu'un vrai pilote actionne.
L'affinage seul peut régresser. La précision de réponse du volet C est en dessous du modèle de base — preuve que l'affinage sans recherche est le mauvais outil pour les tâches à citation exacte. Nous le publions plutôt que de le cacher.
La méthode est le produit, pas le chiffre. Votre tâche, vos documents, cette ablation exacte — exécutée avant que vous vous engagiez en production, afin que le go/no-go repose sur la mesure, pas sur une promesse.
FAQ
À propos de ce rapport.
Est-ce sur nos données ?
Pourquoi l'affinage seul (volet C) échoue-t-il ?
Y a-t-il un juge LLM ?
Vous voulez cela sur votre tâche ?
Apportez un workflow et les documents qui le sous-tendent. Nous construirons le jeu d'évaluation et exécuterons cette ablation — sur vos données, dans votre juridiction.