Durchgerechnetes Beispiel · Gesundheit & Pharma
Hilft das Fine-Tuning bei der Schweizer Heilmittelregulierung?
Keine Meinung — eine Messung. Wir nahmen Apertus-8B und führten dieselbe Vier-Wege-Ablation durch, die wir zu Beginn jedes Piloten durchführen, auf einer Aufgabe, deren Antwort sich exakt bewerten lässt: Fragen zum Schweizer Heilmittelgesetz beantworten mit einer Fundstelle auf den exakten Artikel, auf dem sie beruht. Das Ergebnis: Fine-Tuning plus Retrieval bringt die produktive Messlatte von 22,7 % auf 68,2 %.
Der Aufbau
Vier Systeme, ein offenes Modell.
Dasselbe Apertus-8B, identisch auf 4-Bit quantisiert, identisch ausgeliefert. Die einzige Variable ist, was wir hinzugefügt haben.
Basis
Das offene Modell, wie ausgeliefert.
+ Retrieval
Basismodell mit BM25-Retrieval über das Gesetz.
Feinabgestimmt
LoRA-abgestimmt auf die Aufgabe, kein Retrieval.
Feinabgestimmt + Retrieval
Das vollständige System.
Zwei Dinge werden bewertet, beide deterministisch — kein LLM-Richter: Ist die Antwort korrekt, und hat sie den korrekten Artikel zitiert. Die produktive Messlatte ist beides zugleich — eine richtige Antwort mit falscher oder fehlender Fundstelle ist ein Fehler, denn in regulierter Arbeit ist sie einer.
Das Ergebnis
Fine-Tuning plus Retrieval ist das gewinnende System.
22 verifizierte Fragen (14 Deutsch, 8 Französisch). Klammern im Bericht sind 95-%-Konfidenzintervalle.
| Metrik | A · Basis | B · +RAG | C · abgestimmt | D · abgestimmt+RAG |
|---|---|---|---|---|
| Antwort + Fundstelle (produktive Messlatte) | 4.5% | 22.7% | 0.0% | 68.2% |
| Antwort korrekt | 54.5% | 81.8% | 59.1% | 81.8% |
| Fundstelle korrekt | 13.6% | 27.3% | 4.5% | 72.7% |
| Gibt das geforderte Format aus | 0% | 0% | 100% | 100% |
Was jede Schicht bringt
Die Ablation hindert jeden — uns eingeschlossen — am Herumreden.
Jede Karte heftet einen Mechanismus an eine Zahl in der Tabelle oben.
Retrieval ermöglicht die Fundstelle
Die korrekte Fundstelle steigt von 13,6 % auf 27,3 % nur, wenn Retrieval an ist. Ein kleines Modell kann keine Artikelnummer zitieren, die es nie gesehen hat — deshalb liegen beide Arme ohne Retrieval nahe null auf der produktiven Messlatte, wie gut trainiert auch immer.
Fine-Tuning ermöglicht brauchbare Ausgabe
Das Basismodell kennt die Antwort oft (81,8 % mit RAG), gibt das geforderte, maschinenlesbare Zweizeilenformat aber nur 0 % der Zeit aus. Das Fine-Tuning macht es zuverlässig (100 %) und hebt die Fundstelle unter Retrieval auf 72,7 %.
Fine-Tuning allein reicht nicht
Arm C — feinabgestimmt, kein Retrieval — erreicht 100 % Format, aber nur 4,5 % Fundstelle und 59,1 % Antwort: Das Modell lernt, wie es antwortet, nicht die exakten Fakten. Das gewinnende System ist die Kombination, Arm D mit 68,2 %.
Die ehrlichen Grenzen
Was das nicht behauptet.
Eine Evaluation, der Sie vertrauen können, benennt, wo sie schwach ist.
68,2 % ist ein Boden, keine Decke. Ein kleines Modell, 4-Bit, ein einzelner bescheidener LoRA-Lauf, bewusst schlichtes BM25-Retrieval, ein kompaktes verifiziertes Eval-Set (n=22). Jedes davon ist ein Hebel, den ein echter Pilot zieht.
Fine-Tuning allein kann regredieren. Die Antwortgenauigkeit von Arm C liegt unter dem Basismodell — Beweis, dass Fine-Tuning ohne Retrieval das falsche Werkzeug für Exakt-Fundstellen-Aufgaben ist. Wir veröffentlichen das, statt es zu verbergen.
Die Methode ist das Produkt, nicht die Zahl. Ihre Aufgabe, Ihre Dokumente, genau diese Ablation — durchgeführt, bevor Sie sich zur Produktion verpflichten, sodass das Go/No-Go auf Messung beruht, nicht auf einem Versprechen.
FAQ
Über diesen Bericht.
Läuft das auf unseren Daten?
Warum scheitert Fine-Tuning allein (Arm C)?
Gibt es einen LLM-Richter?
Wollen Sie das auf Ihrer Aufgabe?
Bringen Sie einen Workflow und die Dokumente dahinter mit. Wir bauen das Evaluationsset und führen diese Ablation durch — auf Ihren Daten, in Ihrer Jurisdiktion.