Esempio pratico · Valutazione
Ottimizzare un modello piccolo per il diritto contrattuale svizzero.
Un secondo esempio pratico — stesso metodo del rapporto FINMA, un dominio diverso: rispondere a domande sul Codice delle obbligazioni svizzero (CO) con una citazione all'articolo esatto. Incluso un errore reale in cui ci siamo imbattuti lungo il percorso, e come l'ablazione lo ha intercettato.
L'impostazione
Quattro sistemi, un modello aperto.
Lo stesso Apertus-8B, quantizzato in modo identico a 4 bit, servito in modo identico. L'unica variabile sono i pesi. Valutato in modo deterministico — nessun giudice LLM.
Base
Il modello aperto, così com'è consegnato.
+ Retrieval
Modello di base con retrieval BM25 sulla legge.
Ottimizzato
Calibrato con LoRA sul compito, senza retrieval.
Ottimizzato + retrieval
Il sistema completo.
L'asticella di produzione è entrambe insieme — la risposta corretta e l'articolo corretto citato. Una risposta giusta con una citazione errata o mancante è un fallimento, perché nel lavoro legale lo è.
Il risultato
L'ottimizzazione più il retrieval è il sistema migliore.
172 domande verificate da esseri umani (98 tedesco, 74 francese, 10 temi di diritto contrattuale). Le parentesi sono intervalli di confidenza al 95 %.
| Metrica | A · base | B · +RAG | C · ottim. | D · ottim.+RAG |
|---|---|---|---|---|
| Risposta + citazione (asticella di produzione) | 4.1% | 38.4% | 2.9% | 52.3% |
| Risposta corretta | 39.0% | 54.7% | 46.5% | 70.3% |
| Citazione corretta | 7.0% | 69.8% | 5.8% | 62.2% |
| Emette il formato richiesto | 1.2% | 0.0% | 89.5% | 70.9% |
L'errore che valeva la pena pubblicare
Non abbiamo raggiunto il 52 % al primo tentativo.
La prima ottimizzazione è stata addestrata nel modo ovvio — su domande e la loro risposta + citazione, senza contesto recuperato. Da sola sembrava ottima. Con il retrieval aggiunto, è crollata.
D. Un accordo preventivo che esclude la responsabilità per colpa grave è valido? (riferimento: no, art. 100)
ANSWER: nein
Risposta giusta, nessuna citazione → fallisce
ANSWER: nein SOURCE: OR Art. 100
Supera
La causa è un disallineamento di distribuzione tra addestramento e inferenza: un modello che sarà servito con retrieval deve essere addestrato con retrieval. Abbiamo ricostruito il set di ottimizzazione così che ogni esempio compaia sia in forma semplice sia con contesto recuperato — con l'articolo di riferimento garantito presente — riaddestrato, e l'asticella di produzione è passata dall'8,1 % al 52,3 %. È esattamente il tipo di fallimento che l'ablazione di un Pilot intercetta prima che raggiunga la produzione. Misuriamo per non consegnarlo.
I limiti onesti
Cosa questo non pretende.
Una valutazione di cui potete fidarvi è una che nomina i propri punti deboli.
Le domande a risposta-elenco ottengono quasi zero, in ogni braccio. Estrarre un insieme completo di più elementi e citarlo è il sotto-compito più difficile qui e l'ovvio obiettivo successivo — lo stesso punto debole segnalato dal rapporto FINMA.
Il francese è dietro il tedesco (D: 42 % FR vs 60 % DE), seguendo il mix di addestramento (271 DE vs 123 FR elementi). Dati più bilanciati colmano il divario; il numero è onesto su dove il modello è debole oggi.
La conformità di formato è del 71 %, non del 100 %. L'ottimizzazione consapevole del retrieval omette ancora la citazione su alcuni elementi — molto meglio del 16 % ingenuo, non perfetta. È un pavimento: un set di addestramento più ampio e più bilanciato lo alza ulteriormente.
FAQ
Su questo rapporto.
È lo stesso metodo del rapporto FINMA?
Perché pubblicare un errore che avete commesso?
Come viene valutato — c'è un giudice LLM?
Lo volete sul vostro compito?
Portate un workflow e i documenti che lo sostengono. Costruiremo il set di valutazione ed eseguiremo questa ablazione — inclusi i modi di fallimento che intercetta — sui vostri dati, nella vostra giurisdizione.