Vai al contenuto

Concetti · Valutazione

Se non possiamo misurarlo, non lo consegniamo.

Ogni fornitore di IA promette qualità. Noi la definiamo con voi come un numero, sui vostri documenti, prima di costruire — e vi vincoliamo il go-live. Questa pagina spiega la meccanica dietro quella promessa.

Vedi un esempio pratico →

Un'ablazione riproducibile a quattro vie di Apertus-8B su Q&A relative alle circolari FINMA svizzere — esattamente la valutazione descritta qui sotto, eseguita su dati pubblici.

Passo uno

Il set di valutazione viene prima del modello.

Costruito dai vostri documenti, con i vostri esperti, nelle vostre lingue — è il contratto rispetto al quale il sistema viene costruito.

Ci sediamo con i vostri esperti di dominio ed estraiamo com'è fatto «svolto correttamente»: input reali dal vostro workflow — contratti, sinistri, note, lettere — abbinati a risposte di riferimento e valutati su criteri che approvate. Tipicamente 50–300 compiti tra i vostri tipi di documento, lingue (DE/FR/IT secondo necessità) e casi limite noti, inclusi quelli scomodi: fax scansionati, file multilingue, le eccezioni che il vostro team gestisce in automatico.

Questo set è costruito deliberatamente prima che inizi la modellazione, così da non poter essere silenziosamente calibrato verso ciò che il modello fa bene per caso. Resta vostro — versionato, documentato e riutilizzabile rispetto a qualsiasi modello o fornitore futuro, incluso il nostro sostituto.

Passo due

L'ablazione a quattro vie.

Una tabella che uccide l'hype in entrambe le direzioni — la nostra inclusa.

A

Modello di base

Il modello aperto, non modificato. Il pavimento onesto — e a volte una sorpresa: se questo supera già l'asticella, non dovreste pagare per l'ottimizzazione.

B

+ Retrieval

Modello di base ancorato al vostro corpus. Mostra cosa apporta un migliore accesso ai vostri documenti — di solito il salto singolo più grande.

C

+ Ottimizzazione

Modello addestrato sul vostro compito senza retrieval. Mostra cosa apporta il comportamento appreso: formato, terminologia, tono, disciplina di rifiuto.

D

Entrambi

Il candidato di produzione. Se D non è chiaramente migliore di B e C, il rapporto lo dice e acquistate il sistema più economico.

Sull'esempio pratico FINMA, quella tabella si legge 0 → 22,4 → 1,6 → 45,4 % sull'asticella di produzione da A a D: il solo retrieval fa un quinto del percorso, la sola ottimizzazione quasi da nessuna parte, e solo la combinazione raddoppia il retrieval. La stessa ablazione copre la scelta del modello — Apertus vs. Llama vs. Mistral sul vostro set, e versioni a piena precisione vs. quantizzate — così ogni decisione architetturale del vostro sistema risale a una differenza misurata, non a una preferenza. (Perché siamo rigorosi su ciò che l'ottimizzazione può e non può fare: modelli piccoli, misurati.)

Passo tre

Metriche con i denti, guardrail con i test.

«Sembra buono» non è una metrica. Nemmeno un punteggio di benchmark del compito di qualcun altro.

Le metriche di compito si adattano al lavoro: accuratezza a corrispondenza esatta per i campi estratti, punteggi a rubrica per la redazione, accuratezza della risposta più fedeltà della citazione per le Q&A — una risposta corretta con una fonte inventata conta come errore, perché nel lavoro regolamentato lo è.

I guardrail vengono testati come funzionalità: trattamento delle PII, rifiuti fuori perimetro, resistenza al prompt injection e vincoli di output ottengono ciascuno casi di test avversari nel set di valutazione. Un guardrail non testato è un desiderio.

Il gate: l'asticella è concordata nella proposta. Sopra, go-live. Sotto, un'analisi del divario documentata e una decisione — colmarlo, o fermarsi. In entrambi i casi lo sapete prima di spendere il denaro della produzione.

In produzione

La valutazione non finisce al go-live.

I modelli derivano, i documenti cambiano, gli utenti trovano le falle. Il set di valutazione continua a vigilare.

Valutazione continua

Campioni di produzione vengono valutati rispetto alle stesse metriche con cadenza fissa, così le regressioni di qualità emergono come numeri su una dashboard — non come lamentele tre mesi dopo.

Drift & cambiamento dei dati

Nuovi tipi di documento, nuove formulazioni di policy, nuovi casi limite vengono aggiunti al set di valutazione non appena compaiono. Il set cresce con la vostra realtà; il sistema viene rivalidato rispetto ad esso.

Tutto versionato

Set di valutazione, build del modello e i loro punteggi sono versionati insieme. Ogni risposta registrata risale al build del modello e alla versione di valutazione che l'hanno prodotta — finché la vostra policy di conservazione mantiene il log. Quella tracciabilità è ciò che i vostri auditor chiederanno.

FAQ

Domande sulla valutazione.

Quanto grande deve essere un set di valutazione?
Più piccolo di quanto temiate, più grande di una demo. Cinquanta compiti scelti con cura con risposte di riferimento separano già «funziona» da «impressiona»; 150–300 offrono suddivisioni per categoria — tipi di documento, lingue, casi limite — abbastanza ampie da agire. Riportiamo gli intervalli di confidenza accanto ai punteggi — su campioni di questa dimensione una differenza di due punti è rumore, e preferiamo dirvelo piuttosto che vendervelo. I vostri esperti di dominio ci dedicano ore, non settimane, e il set diventa un asset duraturo che sopravvive a qualsiasi singolo modello.
Chi definisce cosa significa «corretto»?
I vostri esperti, per iscritto, prima che si costruisca qualsiasi cosa — criteri per tipo di compito, approvati (i tipi di metrica al passo tre). Rifiutiamo criteri di successo vaghi perché è così che i pilot finiscono «riusciti» e inutilizzati.
Cosa succede se il sistema non raggiunge l'asticella?
Il rapporto lo dice, con le categorie di errore dettagliate — e la roadmap di produzione spiega cosa colmerebbe il divario e quanto costerebbe, oppure raccomanda di fermarsi. Un Pilot a perimetro fisso che può concludersi con un «no» documentato è precisamente ciò che rende prezioso il suo «sì».

Definite l'asticella con noi.

Portate un workflow e gli esperti che lo conoscono. Daremo forma al set di valutazione e alle metriche nella call di definizione del perimetro.