Esempio pratico · Valutazione
L'ottimizzazione di un modello piccolo aiuta davvero?
Non un'opinione — una misura. Abbiamo preso Apertus-8B ed eseguito la stessa ablazione a quattro vie che eseguiamo all'inizio di ogni Pilot, su un compito in cui la risposta può essere valutata esattamente: rispondere a domande sulle circolari FINMA svizzere con una citazione al numero marginale esatto su cui si basa. Il risultato: l'ottimizzazione più il retrieval raddoppia l'asticella di produzione — dal 22,4 % al 45,4 %.
L'impostazione
Quattro sistemi, un modello aperto.
Lo stesso Apertus-8B, quantizzato in modo identico a 4 bit, servito in modo identico. L'unica variabile è ciò che abbiamo aggiunto.
Base
Il modello aperto, così com'è consegnato.
+ Retrieval
Modello di base con retrieval BM25 sulle circolari.
Ottimizzato
Calibrato con LoRA sul compito, senza retrieval.
Ottimizzato + retrieval
Il sistema completo.
Due cose vengono valutate, entrambe in modo deterministico — nessun giudice LLM: se la risposta è corretta, e se ha citato il Rz corretto nella circolare corretta. L'asticella di produzione è entrambe insieme — una risposta giusta con una citazione errata o mancante è un fallimento, perché nel lavoro regolamentato lo è.
Il risultato
L'ottimizzazione più il retrieval raddoppia l'asticella di produzione.
183 domande verificate da esseri umani (101 tedesco, 82 inglese, 10 circolari). Le parentesi sono intervalli di confidenza al 95 %.
| Metrica | A · base | B · +RAG | C · ottim. | D · ottim.+RAG |
|---|---|---|---|---|
| Risposta + citazione (asticella di produzione) | 0.0% | 22.4% | 1.6% | 45.4% |
| Risposta corretta | 37.2% | 63.4% | 44.8% | 80.9% |
| Citazione corretta | 1.1% | 39.9% | 2.2% | 50.3% |
| Emette il formato richiesto | 2.2% | 0.0% | 100% | 100% |
Cosa apporta ogni livello
L'ablazione impedisce a chiunque — noi inclusi — di fare aria fritta.
Ogni scheda qui sotto àncora un meccanismo a un numero della tabella qui sopra.
Il retrieval abilita la citazione
La citazione corretta passa da ~1 % a ~40–50 % solo quando il retrieval è attivo. Un modello non può citare un numero marginale che non ha mai visto — perciò entrambi i bracci senza retrieval restano vicini a zero sull'asticella di produzione, per quanto ben addestrati.
L'ottimizzazione abilita un output utilizzabile
Il modello di base conosce spesso la risposta (63 % con RAG) ma emette il formato richiesto, leggibile dalla macchina, solo il 2 % delle volte — 0 % quando il retrieval riempie il contesto e lo distrae. L'ottimizzato azzecca il formato il 100 % delle volte. Quel divario è gran parte di B → D.
I due si sommano
Il solo retrieval aggiunge 22,4 punti; la sola ottimizzazione ne aggiunge 1,6. Insieme aggiungono 45,4 — quasi il doppio della somma delle parti. Quell'interazione è il risultato, ed è perché misuriamo prima di costruire.
Si presenta così
Stessa domanda, stesso testo recuperato.
Il modello di base non è stupido — è inaffidabile nella forma. L'affidabilità della forma è ciò che separa una demo da un sistema.
D. Per banche, società di intermediazione mobiliare e gruppi finanziari, a partire da quale requisito minimo di fondi propri si applicano i requisiti pienamente qualitativi e quantitativi? (riferimento: CHF 10 miliardi, Rz 6, FINMA-RS 2010/01)
CHF 10 miliardi
Risposta giusta, nessuna citazione → fallisce
ANSWER: CHF 10 miliardi SOURCE: FINMA-RS 2010/01 Rz 6
Supera
I limiti onesti
Cosa questo non pretende.
Una valutazione di cui potete fidarvi è una che nomina i propri punti deboli.
45 % è un pavimento, non un soffitto. Un modello piccolo, 4 bit, una singola modesta esecuzione LoRA su ~500 esempi, retrieval BM25 deliberatamente semplice. Ognuno di questi è una leva che un vero Pilot aziona.
Le risposte strutturate sono il punto debole. Ottimizzato+RAG ottiene ~47–50 % su numeri, durate e sì/no, ma 27 % sulle domande a elenco di più elementi. L'estrazione di insiemi completi è l'ovvio obiettivo successivo.
Il metodo è il prodotto, non il numero. Il vostro compito, i vostri documenti, esattamente questa ablazione — eseguita prima che vi impegniate in produzione, così che la decisione go/no-go poggi sulla misura, non su una promessa.
FAQ
Su questo rapporto.
È sui dati dei vostri clienti?
Perché 45 % è il titolo e non qualcosa di più alto?
Come viene valutato — c'è un giudice LLM?
Lo volete sul vostro compito?
Portate un workflow e i documenti che lo sostengono. Costruiremo il set di valutazione ed eseguiremo questa ablazione — sui vostri dati, nella vostra giurisdizione.