Vai al contenuto

Esempio pratico · Manifattura & Industria

L'ottimizzazione aiuta sul diritto della sicurezza dei prodotti?

Non un'opinione — una misura. Abbiamo preso Apertus-8B ed eseguito la stessa ablazione a quattro vie che eseguiamo all'inizio di ogni Pilot, su un compito in cui la risposta può essere valutata esattamente: rispondere a domande sulla legge svizzera sulla sicurezza dei prodotti con una citazione all'articolo esatto su cui si basa. Il risultato: l'ottimizzazione più il retrieval porta l'asticella di produzione dal 45,0 % al 60,0 %.

L'impostazione

Quattro sistemi, un modello aperto.

Lo stesso Apertus-8B, quantizzato in modo identico a 4 bit, servito in modo identico. L'unica variabile è ciò che abbiamo aggiunto.

A

Base

Il modello aperto, così com'è consegnato.

B

+ Retrieval

Modello di base con retrieval BM25 sulla legge.

C

Ottimizzato

Calibrato con LoRA sul compito, senza retrieval.

D

Ottimizzato + retrieval

Il sistema completo.

Due cose vengono valutate, entrambe in modo deterministico — nessun giudice LLM: se la risposta è corretta, e se ha citato l'articolo corretto. L'asticella di produzione è entrambe insieme — una risposta giusta con una citazione errata o mancante è un fallimento, perché nel lavoro regolamentato lo è.

Il risultato

L'ottimizzazione più il retrieval è il sistema vincente.

20 domande verificate (14 tedesco, 6 francese). Le parentesi nel rapporto sono intervalli di confidenza al 95 %.

Risposta corretta Risposta + citazione (asticella di produzione) Sistema completo (D)
A · Base
50%
15%
B · + Retrieval
90%
45%
C · Ottimizzato
65%
10%
D · Ottimizzato + retrieval il sistema completo
65%
60%
0%25%50%75%100%
Leggete la riga dell'asticella di produzione: quasi zero senza retrieval (A, C), 45,0 % con il solo retrieval (B), e solo ottimizzazione e retrieval insieme raggiungono il 60,0 % (D, in rosso).
Metrica A · base B · +RAG C · ottim. D · ottim.+RAG
Risposta + citazione (asticella di produzione) 15.0% 45.0% 10.0% 60.0%
Risposta corretta 50.0% 90.0% 65.0% 65.0%
Citazione corretta 15.0% 50.0% 15.0% 85.0%
Emette il formato richiesto 10% 0% 95% 95%

Cosa apporta ogni livello

L'ablazione impedisce a chiunque — noi inclusi — di fare aria fritta.

Ogni scheda àncora un meccanismo a un numero della tabella qui sopra.

Il retrieval abilita la citazione

La citazione corretta sale dal 15,0 % al 50,0 % solo quando il retrieval è attivo. Un modello piccolo non può citare un numero di articolo che non ha mai visto — perciò entrambi i bracci senza retrieval restano vicini a zero sull'asticella di produzione, per quanto ben addestrati.

L'ottimizzazione abilita un output utilizzabile

Il modello di base conosce spesso la risposta (90,0 % con RAG) ma emette il formato a due righe richiesto, leggibile dalla macchina, solo il 10 % delle volte. L'ottimizzazione lo rende affidabile (95 %) e porta la citazione sotto retrieval all'85,0 %.

La sola ottimizzazione non basta

Il braccio C — ottimizzato, senza retrieval — raggiunge il 95 % di formato ma solo il 15,0 % di citazione e il 65,0 % di risposta: il modello impara come rispondere, non i fatti esatti. Il sistema vincente è la combinazione, il braccio D al 60,0 %.

I limiti onesti

Cosa questo non pretende.

Una valutazione di cui potete fidarvi nomina i propri punti deboli.

60,0 % è un pavimento, non un soffitto. Un modello piccolo, 4 bit, una singola modesta esecuzione LoRA, retrieval BM25 deliberatamente semplice, un set di valutazione verificato compatto (n=20). Ognuno di questi è una leva che un vero Pilot aziona.

La sola ottimizzazione può regredire. L'accuratezza di risposta del braccio C è sotto il modello di base — prova che l'ottimizzazione senza retrieval è lo strumento sbagliato per i compiti a citazione esatta. Lo pubblichiamo anziché nasconderlo.

Il metodo è il prodotto, non il numero. Il vostro compito, i vostri documenti, esattamente questa ablazione — eseguita prima che vi impegniate in produzione, così che il go/no-go poggi sulla misura, non su una promessa.

FAQ

Su questo rapporto.

È sui nostri dati?
No — deliberatamente. Viene eseguita interamente sul testo Fedlex pubblico e fissato della LSPro così che chiunque possa riprodurla. In un Pilot il metodo identico viene eseguito sui vostri fascicoli tecnici e sulla vostra documentazione CE, nel vostro ambiente, e il rapporto resta vostro.
22 articoli non sono troppo pochi per contare?
È una legge compatta, e la riportiamo come tale — un set di valutazione più piccolo e un'ottimizzazione più piccola. Il punto è che lo stesso metodo si trasferisce in modo pulito a un dominio normativo ridotto e autosufficiente, con la stessa valutazione deterministica e lo stesso harness aperto.
C'è un giudice LLM?
Nessun giudice LLM da nessuna parte. La LSPro numera i suoi articoli; una citazione corretta è esattamente verificabile. L'accuratezza della risposta è una corrispondenza di stringa/numero rispetto a una risposta di riferimento verificata; la citazione è una corrispondenza esatta di articolo. Ogni numero è ricalcolato da registrazioni di esecuzione congelate con intervalli di Wilson al 95 %.

Lo volete sul vostro compito?

Portate un workflow e i documenti che lo sostengono. Costruiremo il set di valutazione ed eseguiremo questa ablazione — sui vostri dati, nella vostra giurisdizione.