Zum Inhalt springen

Durchgerechnetes Beispiel · Fertigung & Industrie

Hilft das Fine-Tuning beim Schweizer Produktesicherheitsrecht?

Keine Meinung — eine Messung. Wir nahmen Apertus-8B und führten dieselbe Vier-Wege-Ablation durch, die wir zu Beginn jedes Piloten durchführen, auf einer Aufgabe, deren Antwort sich exakt bewerten lässt: Fragen zum Schweizer Produktesicherheitsgesetz beantworten mit einer Fundstelle auf den exakten Artikel, auf dem sie beruht. Das Ergebnis: Fine-Tuning plus Retrieval bringt die produktive Messlatte von 45,0 % auf 60,0 %.

Der Aufbau

Vier Systeme, ein offenes Modell.

Dasselbe Apertus-8B, identisch auf 4-Bit quantisiert, identisch ausgeliefert. Die einzige Variable ist, was wir hinzugefügt haben.

A

Basis

Das offene Modell, wie ausgeliefert.

B

+ Retrieval

Basismodell mit BM25-Retrieval über das Gesetz.

C

Feinabgestimmt

LoRA-abgestimmt auf die Aufgabe, kein Retrieval.

D

Feinabgestimmt + Retrieval

Das vollständige System.

Zwei Dinge werden bewertet, beide deterministisch — kein LLM-Richter: Ist die Antwort korrekt, und hat sie den korrekten Artikel zitiert. Die produktive Messlatte ist beides zugleich — eine richtige Antwort mit falscher oder fehlender Fundstelle ist ein Fehler, denn in regulierter Arbeit ist sie einer.

Das Ergebnis

Fine-Tuning plus Retrieval ist das gewinnende System.

20 verifizierte Fragen (14 Deutsch, 6 Französisch). Klammern im Bericht sind 95-%-Konfidenzintervalle.

Antwort korrekt Antwort + Fundstelle (produktive Messlatte) Vollständiges System (D)
A · Basis
50%
15%
B · + Retrieval
90%
45%
C · Feinabgestimmt
65%
10%
D · Feinabgestimmt + Retrieval das vollständige System
65%
60%
0%25%50%75%100%
Lesen Sie die Zeile der produktiven Messlatte: nahezu null ohne Retrieval (A, C), 45,0 % mit Retrieval allein (B), und erst Fine-Tuning und Retrieval zusammen erreichen 60,0 % (D, in Rot).
Metrik A · Basis B · +RAG C · abgestimmt D · abgestimmt+RAG
Antwort + Fundstelle (produktive Messlatte) 15.0% 45.0% 10.0% 60.0%
Antwort korrekt 50.0% 90.0% 65.0% 65.0%
Fundstelle korrekt 15.0% 50.0% 15.0% 85.0%
Gibt das geforderte Format aus 10% 0% 95% 95%

Was jede Schicht bringt

Die Ablation hindert jeden — uns eingeschlossen — am Herumreden.

Jede Karte heftet einen Mechanismus an eine Zahl in der Tabelle oben.

Retrieval ermöglicht die Fundstelle

Die korrekte Fundstelle steigt von 15,0 % auf 50,0 % nur, wenn Retrieval an ist. Ein kleines Modell kann keine Artikelnummer zitieren, die es nie gesehen hat — deshalb liegen beide Arme ohne Retrieval nahe null auf der produktiven Messlatte, wie gut trainiert auch immer.

Fine-Tuning ermöglicht brauchbare Ausgabe

Das Basismodell kennt die Antwort oft (90,0 % mit RAG), gibt das geforderte, maschinenlesbare Zweizeilenformat aber nur 10 % der Zeit aus. Das Fine-Tuning macht es zuverlässig (95 %) und hebt die Fundstelle unter Retrieval auf 85,0 %.

Fine-Tuning allein reicht nicht

Arm C — feinabgestimmt, kein Retrieval — erreicht 95 % Format, aber nur 15,0 % Fundstelle und 65,0 % Antwort: Das Modell lernt, wie es antwortet, nicht die exakten Fakten. Das gewinnende System ist die Kombination, Arm D mit 60,0 %.

Die ehrlichen Grenzen

Was das nicht behauptet.

Eine Evaluation, der Sie vertrauen können, benennt, wo sie schwach ist.

60,0 % ist ein Boden, keine Decke. Ein kleines Modell, 4-Bit, ein einzelner bescheidener LoRA-Lauf, bewusst schlichtes BM25-Retrieval, ein kompaktes verifiziertes Eval-Set (n=20). Jedes davon ist ein Hebel, den ein echter Pilot zieht.

Fine-Tuning allein kann regredieren. Die Antwortgenauigkeit von Arm C liegt unter dem Basismodell — Beweis, dass Fine-Tuning ohne Retrieval das falsche Werkzeug für Exakt-Fundstellen-Aufgaben ist. Wir veröffentlichen das, statt es zu verbergen.

Die Methode ist das Produkt, nicht die Zahl. Ihre Aufgabe, Ihre Dokumente, genau diese Ablation — durchgeführt, bevor Sie sich zur Produktion verpflichten, sodass das Go/No-Go auf Messung beruht, nicht auf einem Versprechen.

FAQ

Über diesen Bericht.

Läuft das auf unseren Daten?
Nein — bewusst. Es läuft vollständig auf dem öffentlichen, gepinnten Fedlex-Text des PrSG, damit es jeder reproduzieren kann. In einem Pilot läuft die identische Methode auf Ihren technischen Unterlagen und Ihrer CE-Dokumentation, in Ihrer Umgebung, und der Bericht bleibt Ihrer.
Sind 22 Artikel nicht zu wenig, um relevant zu sein?
Es ist ein kompaktes Gesetz, und wir berichten es als solches — ein kleineres Eval-Set und ein kleineres Fine-Tuning. Der Punkt ist, dass sich dieselbe Methode sauber auf eine kleine, in sich geschlossene regulatorische Domäne übertragen lässt, mit derselben deterministischen Bewertung und demselben offenen Harness.
Gibt es einen LLM-Richter?
Nirgends ein LLM-Richter. Das PrSG nummeriert seine Artikel; eine korrekte Fundstelle ist exakt prüfbar. Die Antwortgenauigkeit ist String-/Zahlenabgleich gegen eine verifizierte Gold-Antwort; die Fundstelle ist ein exakter Artikelabgleich. Jede Zahl wird aus eingefrorenen Laufprotokollen mit 95-%-Wilson-Intervallen neu berechnet.

Wollen Sie das auf Ihrer Aufgabe?

Bringen Sie einen Workflow und die Dokumente dahinter mit. Wir bauen das Evaluationsset und führen diese Ablation durch — auf Ihren Daten, in Ihrer Jurisdiktion.