Durchgerechnetes Beispiel · Fertigung & Industrie
Hilft das Fine-Tuning beim Schweizer Produktesicherheitsrecht?
Keine Meinung — eine Messung. Wir nahmen Apertus-8B und führten dieselbe Vier-Wege-Ablation durch, die wir zu Beginn jedes Piloten durchführen, auf einer Aufgabe, deren Antwort sich exakt bewerten lässt: Fragen zum Schweizer Produktesicherheitsgesetz beantworten mit einer Fundstelle auf den exakten Artikel, auf dem sie beruht. Das Ergebnis: Fine-Tuning plus Retrieval bringt die produktive Messlatte von 45,0 % auf 60,0 %.
Der Aufbau
Vier Systeme, ein offenes Modell.
Dasselbe Apertus-8B, identisch auf 4-Bit quantisiert, identisch ausgeliefert. Die einzige Variable ist, was wir hinzugefügt haben.
Basis
Das offene Modell, wie ausgeliefert.
+ Retrieval
Basismodell mit BM25-Retrieval über das Gesetz.
Feinabgestimmt
LoRA-abgestimmt auf die Aufgabe, kein Retrieval.
Feinabgestimmt + Retrieval
Das vollständige System.
Zwei Dinge werden bewertet, beide deterministisch — kein LLM-Richter: Ist die Antwort korrekt, und hat sie den korrekten Artikel zitiert. Die produktive Messlatte ist beides zugleich — eine richtige Antwort mit falscher oder fehlender Fundstelle ist ein Fehler, denn in regulierter Arbeit ist sie einer.
Das Ergebnis
Fine-Tuning plus Retrieval ist das gewinnende System.
20 verifizierte Fragen (14 Deutsch, 6 Französisch). Klammern im Bericht sind 95-%-Konfidenzintervalle.
| Metrik | A · Basis | B · +RAG | C · abgestimmt | D · abgestimmt+RAG |
|---|---|---|---|---|
| Antwort + Fundstelle (produktive Messlatte) | 15.0% | 45.0% | 10.0% | 60.0% |
| Antwort korrekt | 50.0% | 90.0% | 65.0% | 65.0% |
| Fundstelle korrekt | 15.0% | 50.0% | 15.0% | 85.0% |
| Gibt das geforderte Format aus | 10% | 0% | 95% | 95% |
Was jede Schicht bringt
Die Ablation hindert jeden — uns eingeschlossen — am Herumreden.
Jede Karte heftet einen Mechanismus an eine Zahl in der Tabelle oben.
Retrieval ermöglicht die Fundstelle
Die korrekte Fundstelle steigt von 15,0 % auf 50,0 % nur, wenn Retrieval an ist. Ein kleines Modell kann keine Artikelnummer zitieren, die es nie gesehen hat — deshalb liegen beide Arme ohne Retrieval nahe null auf der produktiven Messlatte, wie gut trainiert auch immer.
Fine-Tuning ermöglicht brauchbare Ausgabe
Das Basismodell kennt die Antwort oft (90,0 % mit RAG), gibt das geforderte, maschinenlesbare Zweizeilenformat aber nur 10 % der Zeit aus. Das Fine-Tuning macht es zuverlässig (95 %) und hebt die Fundstelle unter Retrieval auf 85,0 %.
Fine-Tuning allein reicht nicht
Arm C — feinabgestimmt, kein Retrieval — erreicht 95 % Format, aber nur 15,0 % Fundstelle und 65,0 % Antwort: Das Modell lernt, wie es antwortet, nicht die exakten Fakten. Das gewinnende System ist die Kombination, Arm D mit 60,0 %.
Die ehrlichen Grenzen
Was das nicht behauptet.
Eine Evaluation, der Sie vertrauen können, benennt, wo sie schwach ist.
60,0 % ist ein Boden, keine Decke. Ein kleines Modell, 4-Bit, ein einzelner bescheidener LoRA-Lauf, bewusst schlichtes BM25-Retrieval, ein kompaktes verifiziertes Eval-Set (n=20). Jedes davon ist ein Hebel, den ein echter Pilot zieht.
Fine-Tuning allein kann regredieren. Die Antwortgenauigkeit von Arm C liegt unter dem Basismodell — Beweis, dass Fine-Tuning ohne Retrieval das falsche Werkzeug für Exakt-Fundstellen-Aufgaben ist. Wir veröffentlichen das, statt es zu verbergen.
Die Methode ist das Produkt, nicht die Zahl. Ihre Aufgabe, Ihre Dokumente, genau diese Ablation — durchgeführt, bevor Sie sich zur Produktion verpflichten, sodass das Go/No-Go auf Messung beruht, nicht auf einem Versprechen.
FAQ
Über diesen Bericht.
Läuft das auf unseren Daten?
Sind 22 Artikel nicht zu wenig, um relevant zu sein?
Gibt es einen LLM-Richter?
Wollen Sie das auf Ihrer Aufgabe?
Bringen Sie einen Workflow und die Dokumente dahinter mit. Wir bauen das Evaluationsset und führen diese Ablation durch — auf Ihren Daten, in Ihrer Jurisdiktion.