Concetti · Valutazione
Se non possiamo misurarlo, non lo consegniamo.
Ogni fornitore di IA promette qualità. Noi la definiamo con voi come un numero, sui vostri documenti, prima di costruire — e vi vincoliamo il go-live. Questa pagina spiega la meccanica dietro quella promessa.
Un'ablazione riproducibile a quattro vie di Apertus-8B su Q&A relative alle circolari FINMA svizzere — esattamente la valutazione descritta qui sotto, eseguita su dati pubblici.
Passo uno
Il set di valutazione viene prima del modello.
Costruito dai vostri documenti, con i vostri esperti, nelle vostre lingue — è il contratto rispetto al quale il sistema viene costruito.
Ci sediamo con i vostri esperti di dominio ed estraiamo com'è fatto «svolto correttamente»: input reali dal vostro workflow — contratti, sinistri, note, lettere — abbinati a risposte di riferimento e valutati su criteri che approvate. Tipicamente 50–300 compiti tra i vostri tipi di documento, lingue (DE/FR/IT secondo necessità) e casi limite noti, inclusi quelli scomodi: fax scansionati, file multilingue, le eccezioni che il vostro team gestisce in automatico.
Questo set è costruito deliberatamente prima che inizi la modellazione, così da non poter essere silenziosamente calibrato verso ciò che il modello fa bene per caso. Resta vostro — versionato, documentato e riutilizzabile rispetto a qualsiasi modello o fornitore futuro, incluso il nostro sostituto.
Passo due
L'ablazione a quattro vie.
Una tabella che uccide l'hype in entrambe le direzioni — la nostra inclusa.
Modello di base
Il modello aperto, non modificato. Il pavimento onesto — e a volte una sorpresa: se questo supera già l'asticella, non dovreste pagare per l'ottimizzazione.
+ Retrieval
Modello di base ancorato al vostro corpus. Mostra cosa apporta un migliore accesso ai vostri documenti — di solito il salto singolo più grande.
+ Ottimizzazione
Modello addestrato sul vostro compito senza retrieval. Mostra cosa apporta il comportamento appreso: formato, terminologia, tono, disciplina di rifiuto.
Entrambi
Il candidato di produzione. Se D non è chiaramente migliore di B e C, il rapporto lo dice e acquistate il sistema più economico.
Sull'esempio pratico FINMA, quella tabella si legge 0 → 22,4 → 1,6 → 45,4 % sull'asticella di produzione da A a D: il solo retrieval fa un quinto del percorso, la sola ottimizzazione quasi da nessuna parte, e solo la combinazione raddoppia il retrieval. La stessa ablazione copre la scelta del modello — Apertus vs. Llama vs. Mistral sul vostro set, e versioni a piena precisione vs. quantizzate — così ogni decisione architetturale del vostro sistema risale a una differenza misurata, non a una preferenza. (Perché siamo rigorosi su ciò che l'ottimizzazione può e non può fare: modelli piccoli, misurati.)
Passo tre
Metriche con i denti, guardrail con i test.
«Sembra buono» non è una metrica. Nemmeno un punteggio di benchmark del compito di qualcun altro.
Le metriche di compito si adattano al lavoro: accuratezza a corrispondenza esatta per i campi estratti, punteggi a rubrica per la redazione, accuratezza della risposta più fedeltà della citazione per le Q&A — una risposta corretta con una fonte inventata conta come errore, perché nel lavoro regolamentato lo è.
I guardrail vengono testati come funzionalità: trattamento delle PII, rifiuti fuori perimetro, resistenza al prompt injection e vincoli di output ottengono ciascuno casi di test avversari nel set di valutazione. Un guardrail non testato è un desiderio.
Il gate: l'asticella è concordata nella proposta. Sopra, go-live. Sotto, un'analisi del divario documentata e una decisione — colmarlo, o fermarsi. In entrambi i casi lo sapete prima di spendere il denaro della produzione.
In produzione
La valutazione non finisce al go-live.
I modelli derivano, i documenti cambiano, gli utenti trovano le falle. Il set di valutazione continua a vigilare.
Valutazione continua
Campioni di produzione vengono valutati rispetto alle stesse metriche con cadenza fissa, così le regressioni di qualità emergono come numeri su una dashboard — non come lamentele tre mesi dopo.
Drift & cambiamento dei dati
Nuovi tipi di documento, nuove formulazioni di policy, nuovi casi limite vengono aggiunti al set di valutazione non appena compaiono. Il set cresce con la vostra realtà; il sistema viene rivalidato rispetto ad esso.
Tutto versionato
Set di valutazione, build del modello e i loro punteggi sono versionati insieme. Ogni risposta registrata risale al build del modello e alla versione di valutazione che l'hanno prodotta — finché la vostra policy di conservazione mantiene il log. Quella tracciabilità è ciò che i vostri auditor chiederanno.
FAQ
Domande sulla valutazione.
Quanto grande deve essere un set di valutazione?
Chi definisce cosa significa «corretto»?
Cosa succede se il sistema non raggiunge l'asticella?
Definite l'asticella con noi.
Portate un workflow e gli esperti che lo conoscono. Daremo forma al set di valutazione e alle metriche nella call di definizione del perimetro.