Vai al contenuto

Esempio pratico · Valutazione

L'ottimizzazione di un modello piccolo aiuta davvero?

Non un'opinione — una misura. Abbiamo preso Apertus-8B ed eseguito la stessa ablazione a quattro vie che eseguiamo all'inizio di ogni Pilot, su un compito in cui la risposta può essere valutata esattamente: rispondere a domande sulle circolari FINMA svizzere con una citazione al numero marginale esatto su cui si basa. Il risultato: l'ottimizzazione più il retrieval raddoppia l'asticella di produzione — dal 22,4 % al 45,4 %.

L'impostazione

Quattro sistemi, un modello aperto.

Lo stesso Apertus-8B, quantizzato in modo identico a 4 bit, servito in modo identico. L'unica variabile è ciò che abbiamo aggiunto.

A

Base

Il modello aperto, così com'è consegnato.

B

+ Retrieval

Modello di base con retrieval BM25 sulle circolari.

C

Ottimizzato

Calibrato con LoRA sul compito, senza retrieval.

D

Ottimizzato + retrieval

Il sistema completo.

Due cose vengono valutate, entrambe in modo deterministico — nessun giudice LLM: se la risposta è corretta, e se ha citato il Rz corretto nella circolare corretta. L'asticella di produzione è entrambe insieme — una risposta giusta con una citazione errata o mancante è un fallimento, perché nel lavoro regolamentato lo è.

Il risultato

L'ottimizzazione più il retrieval raddoppia l'asticella di produzione.

183 domande verificate da esseri umani (101 tedesco, 82 inglese, 10 circolari). Le parentesi sono intervalli di confidenza al 95 %.

Risposta corretta Risposta + citazione (asticella di produzione) Sistema completo (D)
A · Base
37.2%
0%
B · + Retrieval
63.4%
22.4%
C · Ottimizzato
44.8%
1.6%
D · Ottimizzato + retrieval il sistema completo
80.9%
45.4%
0%25%50%75%100%
Leggete la riga dell'asticella di produzione dall'alto in basso: è quasi zero senza retrieval (A, C), raggiunge il 22,4 % con il solo retrieval (B), e solo ottimizzazione e retrieval insieme raggiungono il 45,4 % (D, in rosso). Scomposizione completa qui sotto.
Metrica A · base B · +RAG C · ottim. D · ottim.+RAG
Risposta + citazione (asticella di produzione) 0.0% 22.4% 1.6% 45.4%
Risposta corretta 37.2% 63.4% 44.8% 80.9%
Citazione corretta 1.1% 39.9% 2.2% 50.3%
Emette il formato richiesto 2.2% 0.0% 100% 100%

Cosa apporta ogni livello

L'ablazione impedisce a chiunque — noi inclusi — di fare aria fritta.

Ogni scheda qui sotto àncora un meccanismo a un numero della tabella qui sopra.

Il retrieval abilita la citazione

La citazione corretta passa da ~1 % a ~40–50 % solo quando il retrieval è attivo. Un modello non può citare un numero marginale che non ha mai visto — perciò entrambi i bracci senza retrieval restano vicini a zero sull'asticella di produzione, per quanto ben addestrati.

L'ottimizzazione abilita un output utilizzabile

Il modello di base conosce spesso la risposta (63 % con RAG) ma emette il formato richiesto, leggibile dalla macchina, solo il 2 % delle volte — 0 % quando il retrieval riempie il contesto e lo distrae. L'ottimizzato azzecca il formato il 100 % delle volte. Quel divario è gran parte di B → D.

I due si sommano

Il solo retrieval aggiunge 22,4 punti; la sola ottimizzazione ne aggiunge 1,6. Insieme aggiungono 45,4 — quasi il doppio della somma delle parti. Quell'interazione è il risultato, ed è perché misuriamo prima di costruire.

Si presenta così

Stessa domanda, stesso testo recuperato.

Il modello di base non è stupido — è inaffidabile nella forma. L'affidabilità della forma è ciò che separa una demo da un sistema.

D. Per banche, società di intermediazione mobiliare e gruppi finanziari, a partire da quale requisito minimo di fondi propri si applicano i requisiti pienamente qualitativi e quantitativi? (riferimento: CHF 10 miliardi, Rz 6, FINMA-RS 2010/01)

Base + RAG
CHF 10 miliardi

Risposta giusta, nessuna citazione → fallisce

Ottimizzato + RAG
ANSWER: CHF 10 miliardi
SOURCE: FINMA-RS 2010/01 Rz 6

Supera

I limiti onesti

Cosa questo non pretende.

Una valutazione di cui potete fidarvi è una che nomina i propri punti deboli.

45 % è un pavimento, non un soffitto. Un modello piccolo, 4 bit, una singola modesta esecuzione LoRA su ~500 esempi, retrieval BM25 deliberatamente semplice. Ognuno di questi è una leva che un vero Pilot aziona.

Le risposte strutturate sono il punto debole. Ottimizzato+RAG ottiene ~47–50 % su numeri, durate e sì/no, ma 27 % sulle domande a elenco di più elementi. L'estrazione di insiemi completi è l'ovvio obiettivo successivo.

Il metodo è il prodotto, non il numero. Il vostro compito, i vostri documenti, esattamente questa ablazione — eseguita prima che vi impegniate in produzione, così che la decisione go/no-go poggi sulla misura, non su una promessa.

FAQ

Su questo rapporto.

È sui dati dei vostri clienti?
No — deliberatamente. Viene eseguita interamente su circolari FINMA pubbliche così che chiunque possa riprodurla, e così che possiamo pubblicarla. In un Pilot il metodo identico viene eseguito sui vostri documenti, nel vostro ambiente, e il rapporto resta vostro.
Perché 45 % è il titolo e non qualcosa di più alto?
Perché è onesto. Risposta breve più citazione esatta è un'asticella difficile, e l'impostazione è deliberatamente modesta — un modello 8B a 4 bit, una esecuzione LoRA, retrieval semplice. Il valore del rapporto è il metodo e le differenze tra i bracci, non un numero da classifica.
Come viene valutato — c'è un giudice LLM?
Nessun giudice LLM da nessuna parte. Le circolari FINMA numerano ogni paragrafo normativo (Randziffer, Rz), così una citazione corretta è esattamente verificabile. L'accuratezza della risposta è una corrispondenza di stringa/numero rispetto a una risposta di riferimento verificata; la citazione è una corrispondenza esatta del Rz. Ogni numero è ricalcolato da registrazioni di esecuzione congelate.

Lo volete sul vostro compito?

Portate un workflow e i documenti che lo sostengono. Costruiremo il set di valutazione ed eseguiremo questa ablazione — sui vostri dati, nella vostra giurisdizione.