Esempio pratico · Sanità & Farma
L'ottimizzazione aiuta sulla regolamentazione degli agenti terapeutici?
Non un'opinione — una misura. Abbiamo preso Apertus-8B ed eseguito la stessa ablazione a quattro vie che eseguiamo all'inizio di ogni Pilot, su un compito in cui la risposta può essere valutata esattamente: rispondere a domande sulla legge svizzera sugli agenti terapeutici con una citazione all'articolo esatto su cui si basa. Il risultato: l'ottimizzazione più il retrieval porta l'asticella di produzione dal 22,7 % al 68,2 %.
L'impostazione
Quattro sistemi, un modello aperto.
Lo stesso Apertus-8B, quantizzato in modo identico a 4 bit, servito in modo identico. L'unica variabile è ciò che abbiamo aggiunto.
Base
Il modello aperto, così com'è consegnato.
+ Retrieval
Modello di base con retrieval BM25 sulla legge.
Ottimizzato
Calibrato con LoRA sul compito, senza retrieval.
Ottimizzato + retrieval
Il sistema completo.
Due cose vengono valutate, entrambe in modo deterministico — nessun giudice LLM: se la risposta è corretta, e se ha citato l'articolo corretto. L'asticella di produzione è entrambe insieme — una risposta giusta con una citazione errata o mancante è un fallimento, perché nel lavoro regolamentato lo è.
Il risultato
L'ottimizzazione più il retrieval è il sistema vincente.
22 domande verificate (14 tedesco, 8 francese). Le parentesi nel rapporto sono intervalli di confidenza al 95 %.
| Metrica | A · base | B · +RAG | C · ottim. | D · ottim.+RAG |
|---|---|---|---|---|
| Risposta + citazione (asticella di produzione) | 4.5% | 22.7% | 0.0% | 68.2% |
| Risposta corretta | 54.5% | 81.8% | 59.1% | 81.8% |
| Citazione corretta | 13.6% | 27.3% | 4.5% | 72.7% |
| Emette il formato richiesto | 0% | 0% | 100% | 100% |
Cosa apporta ogni livello
L'ablazione impedisce a chiunque — noi inclusi — di fare aria fritta.
Ogni scheda àncora un meccanismo a un numero della tabella qui sopra.
Il retrieval abilita la citazione
La citazione corretta sale dal 13,6 % al 27,3 % solo quando il retrieval è attivo. Un modello piccolo non può citare un numero di articolo che non ha mai visto — perciò entrambi i bracci senza retrieval restano vicini a zero sull'asticella di produzione, per quanto ben addestrati.
L'ottimizzazione abilita un output utilizzabile
Il modello di base conosce spesso la risposta (81,8 % con RAG) ma emette il formato a due righe richiesto, leggibile dalla macchina, solo lo 0 % delle volte. L'ottimizzazione lo rende affidabile (100 %) e porta la citazione sotto retrieval al 72,7 %.
La sola ottimizzazione non basta
Il braccio C — ottimizzato, senza retrieval — raggiunge il 100 % di formato ma solo il 4,5 % di citazione e il 59,1 % di risposta: il modello impara come rispondere, non i fatti esatti. Il sistema vincente è la combinazione, il braccio D al 68,2 %.
I limiti onesti
Cosa questo non pretende.
Una valutazione di cui potete fidarvi nomina i propri punti deboli.
68,2 % è un pavimento, non un soffitto. Un modello piccolo, 4 bit, una singola modesta esecuzione LoRA, retrieval BM25 deliberatamente semplice, un set di valutazione verificato compatto (n=22). Ognuno di questi è una leva che un vero Pilot aziona.
La sola ottimizzazione può regredire. L'accuratezza di risposta del braccio C è sotto il modello di base — prova che l'ottimizzazione senza retrieval è lo strumento sbagliato per i compiti a citazione esatta. Lo pubblichiamo anziché nasconderlo.
Il metodo è il prodotto, non il numero. Il vostro compito, i vostri documenti, esattamente questa ablazione — eseguita prima che vi impegniate in produzione, così che il go/no-go poggi sulla misura, non su una promessa.
FAQ
Su questo rapporto.
È sui nostri dati?
Perché la sola ottimizzazione (braccio C) fallisce?
C'è un giudice LLM?
Lo volete sul vostro compito?
Portate un workflow e i documenti che lo sostengono. Costruiremo il set di valutazione ed eseguiremo questa ablazione — sui vostri dati, nella vostra giurisdizione.