Vai al contenuto

Esempio pratico · Valutazione

Ottimizzare un modello piccolo per il diritto contrattuale svizzero.

Un secondo esempio pratico — stesso metodo del rapporto FINMA, un dominio diverso: rispondere a domande sul Codice delle obbligazioni svizzero (CO) con una citazione all'articolo esatto. Incluso un errore reale in cui ci siamo imbattuti lungo il percorso, e come l'ablazione lo ha intercettato.

L'impostazione

Quattro sistemi, un modello aperto.

Lo stesso Apertus-8B, quantizzato in modo identico a 4 bit, servito in modo identico. L'unica variabile sono i pesi. Valutato in modo deterministico — nessun giudice LLM.

A

Base

Il modello aperto, così com'è consegnato.

B

+ Retrieval

Modello di base con retrieval BM25 sulla legge.

C

Ottimizzato

Calibrato con LoRA sul compito, senza retrieval.

D

Ottimizzato + retrieval

Il sistema completo.

L'asticella di produzione è entrambe insieme — la risposta corretta e l'articolo corretto citato. Una risposta giusta con una citazione errata o mancante è un fallimento, perché nel lavoro legale lo è.

Il risultato

L'ottimizzazione più il retrieval è il sistema migliore.

172 domande verificate da esseri umani (98 tedesco, 74 francese, 10 temi di diritto contrattuale). Le parentesi sono intervalli di confidenza al 95 %.

Risposta corretta Risposta + citazione (asticella di produzione)
A · Base
39%
4.1%
B · + Retrieval
54.7%
38.4%
C · Ottimizzato
46.5%
2.9%
D · Ottimizzato + retrieval il sistema completo
70.3%
52.3%
0%25%50%75%100%
L'asticella di produzione (rosso) è quasi zero senza retrieval (A, C), raggiunge il 38,4 % con il solo retrieval (B), e culmina al 52,3 % solo quando ottimizzazione e retrieval si combinano (D) — la stessa forma del risultato FINMA, su un diverso corpo di diritto.
Metrica A · base B · +RAG C · ottim. D · ottim.+RAG
Risposta + citazione (asticella di produzione) 4.1% 38.4% 2.9% 52.3%
Risposta corretta 39.0% 54.7% 46.5% 70.3%
Citazione corretta 7.0% 69.8% 5.8% 62.2%
Emette il formato richiesto 1.2% 0.0% 89.5% 70.9%

L'errore che valeva la pena pubblicare

Non abbiamo raggiunto il 52 % al primo tentativo.

La prima ottimizzazione è stata addestrata nel modo ovvio — su domande e la loro risposta + citazione, senza contesto recuperato. Da sola sembrava ottima. Con il retrieval aggiunto, è crollata.

Ottimizzazione ingenua + RAG
8.1%peggio di B
Consapevole del retrieval + RAG
52.3%
Il braccio D sull'asticella di produzione. Il modello ingenuo — a cui venivano mostrati passaggi recuperati mai visti in addestramento — è tornato a risposte concise e ha omesso la riga della citazione, ottenendo un punteggio sotto il modello di base con retrieval (38,4 %). La conformità di formato in addestramento sotto retrieval è scesa al 16 %.

D. Un accordo preventivo che esclude la responsabilità per colpa grave è valido? (riferimento: no, art. 100)

Ottimizzazione ingenua + RAG
ANSWER: nein

Risposta giusta, nessuna citazione → fallisce

Consapevole del retrieval + RAG
ANSWER: nein
SOURCE: OR Art. 100

Supera

La causa è un disallineamento di distribuzione tra addestramento e inferenza: un modello che sarà servito con retrieval deve essere addestrato con retrieval. Abbiamo ricostruito il set di ottimizzazione così che ogni esempio compaia sia in forma semplice sia con contesto recuperato — con l'articolo di riferimento garantito presente — riaddestrato, e l'asticella di produzione è passata dall'8,1 % al 52,3 %. È esattamente il tipo di fallimento che l'ablazione di un Pilot intercetta prima che raggiunga la produzione. Misuriamo per non consegnarlo.

I limiti onesti

Cosa questo non pretende.

Una valutazione di cui potete fidarvi è una che nomina i propri punti deboli.

Le domande a risposta-elenco ottengono quasi zero, in ogni braccio. Estrarre un insieme completo di più elementi e citarlo è il sotto-compito più difficile qui e l'ovvio obiettivo successivo — lo stesso punto debole segnalato dal rapporto FINMA.

Il francese è dietro il tedesco (D: 42 % FR vs 60 % DE), seguendo il mix di addestramento (271 DE vs 123 FR elementi). Dati più bilanciati colmano il divario; il numero è onesto su dove il modello è debole oggi.

La conformità di formato è del 71 %, non del 100 %. L'ottimizzazione consapevole del retrieval omette ancora la citazione su alcuni elementi — molto meglio del 16 % ingenuo, non perfetta. È un pavimento: un set di addestramento più ampio e più bilanciato lo alza ulteriormente.

FAQ

Su questo rapporto.

È lo stesso metodo del rapporto FINMA?
Sì — deliberatamente. Stessa ablazione a quattro vie, stessa valutazione deterministica, stesso modello di base, su un settore diverso (legale) e un tipo di documento diverso (una legge, non circolari). Riprodurre il risultato su un secondo corpo di diritto è il punto: il metodo si generalizza.
Perché pubblicare un errore che avete commesso?
Perché è la parte più utile. La nostra prima ottimizzazione è stata addestrata senza contesto di retrieval ed è crollata quando il retrieval è stato aggiunto — peggio del modello di base. È esattamente il tipo di fallimento che l'ablazione di un vero Pilot è progettata per intercettare prima che raggiunga la produzione. L'abbiamo corretto addestrando il modello nel modo in cui viene servito; il rapporto mostra entrambi.
Come viene valutato — c'è un giudice LLM?
Nessun giudice LLM da nessuna parte. Il Codice delle obbligazioni numera ogni disposizione, così una citazione corretta è esattamente verificabile. L'accuratezza della risposta è una corrispondenza di stringa/numero rispetto a una risposta di riferimento verificata; la citazione è una corrispondenza esatta del numero di articolo. Ogni numero è ricalcolato da registrazioni di esecuzione congelate.

Lo volete sul vostro compito?

Portate un workflow e i documenti che lo sostengono. Costruiremo il set di valutazione ed eseguiremo questa ablazione — inclusi i modi di fallimento che intercetta — sui vostri dati, nella vostra giurisdizione.