Benchmark dei modelli - Documentazione di Entity Enricher

Benchmark dei modelli

Gli scenari di benchmark vi consentono di confrontare i modelli LLM su un'attività di arricchimento reale e ripetibile — un confronto equo — catturando l'output di ciascun modello e il costo totale, così da poter scegliere il modello giusto per il compito.

Perché fare un benchmark?

I modelli differiscono enormemente per accuratezza, affidabilità dell'output strutturato e prezzo. Anziché tirare a indovinare, uno scenario di benchmark esegue lo stesso schema e la stessa entità attraverso molti modelli contemporaneamente e registra ciò che ciascuno ha prodotto e quanto è costato. Il confronto si basa su dati concreti, così da poter fissare il modello più economico che soddisfa i propri standard di qualità.

Come funziona

1
Definire uno scenario

Uno scenario di benchmark è un test di modello salvato e riutilizzabile. Può sottoporre a benchmark l'arricchimento (uno schema, un input di entità fisso, una strategia di arricchimento, le lingue, gli interruttori response-schema / strict-structured-output e gli eventuali allegati), la generazione del campione (una descrizione del tipo di entità che ogni modello trasforma in un JSON di esempio) o la generazione dello schema (un JSON campione fisso che ogni modello converte in uno schema). Contiene inoltre il proprio riferimento gold e il modo in cui i risultati vengono valutati rispetto ad esso (un modello giudice, un modello di embedding e una soglia di rigore — la generazione del campione viene valutata tramite griglia dal solo giudice, senza riferimento). Lo definisca una volta e lo riutilizzi su ogni modello che desidera confrontare.

2
Lo esegua su più modelli

Una volta che lo scenario dispone di un riferimento verificato, eseguitelo sui modelli attivi di un provider oppure su tutti i modelli attivi in vista. Ogni modello viene arricchito in modo indipendente — senza fusione — così da ottenere un risultato pulito e affiancato per ciascun modello. L'avanzamento viene trasmesso in tempo reale e ogni risultato riuscito viene valutato automaticamente rispetto al riferimento al termine dell'esecuzione. Se lo scenario include allegati binari, abilitate Salta i modelli che non possono leggere gli allegati e i modelli privi della capacità di gestione file richiesta vengono segnalati come Saltati anziché produrre errori garantiti.

3
Confronta output e costi

Ogni esecuzione viene salvata con il suo output strutturato, lo stato di esito, i conteggi dei token, il tempo di elaborazione e il costo totale addebitato. Espandete una qualsiasi riga per esaminare l'output JSON o passare al record di enrichment sottostante.

4
Esegui di nuovo per aggiornare

Rieseguire uno scenario sullo stesso modello sovrascrive il risultato precedente, quindi la tabella riflette sempre l'esecuzione più recente. Modificando la configurazione di uno scenario, i risultati precedenti vengono contrassegnati come obsoleti finché non li si riesegue. Impostando Esecuzioni per modello su 2 o 3, ogni modello viene sottoposto a benchmark altrettante volte: la tabella conserva la media di costo, qualità e velocità più uno scarto di coerenza (i modelli variano da un'esecuzione all'altra), con un consumo di crediti all'incirca pari a quel multiplo. Uno scarto ampio dipende spesso da proprietà dello schema che pongono più di una domanda, più che dal modello: il controllo di ambiguità le individua e le corregge.

Leggere i risultati

La tabella dei risultati è pensata per il confronto. Una striscia di riepilogo nella parte superiore evidenzia il tasso di successo e i modelli più economici e più veloci che hanno avuto esito positivo. Ogni colonna — modello, stato, strategia, costo, token e tempo — è ordinabile, quindi un solo clic ordina i modelli per prezzo o latenza. Filtri per nome del modello, stato o strategia per restringere la vista ed espanda qualsiasi riga per leggere l'output strutturato completo o aprire il record di arricchimento sottostante.

Riportare i risultati nel sistema: le origini di punteggio

Un benchmark vale più di una tabella letta una sola volta. Contrassegni uno scenario come fonte di punteggio e i suoi risultati per modello iniziano a guidare la piattaforma: i modelli riportano i punteggi misurati come badge in ogni selettore, i selettori li usano per l'ordinamento e la selezione automatica del modello sceglie il modello che le sue misurazioni classificano come migliore per quel compito. Ne contrassegni diversi e i punteggi vengono mediati: «modello migliore» significa migliore sui suoi schemi, non su una classifica pubblica. Gli amministratori di sistema possono pubblicare uno scenario globale come fallback per le organizzazioni che non ne hanno uno proprio.

Il peso da attribuire a “migliore” lo decide lei: qualità, velocità e costo si combinano secondo un rapporto configurato per tipo di scenario in Impostazioni → Organizzazione → Valori predefiniti (con somma pari a 100, un terzo ciascuno per impostazione predefinita). Un team che ottimizza il costo del batch e un team che ottimizza la qualità delle risposte selezioneranno automaticamente, e legittimamente, modelli diversi dallo stesso benchmark.

Itera: riprova e disattiva

Il benchmarking è iterativo. Selezionate le righe con le caselle di controllo (shift-clic per un intervallo), poi utilizzate il menu ··· per agire su un sottoinsieme senza rieseguire tutto:

Imposta un riferimento gold (necessario per il benchmark)

Ogni scenario contiene un risultato di riferimento — l'output atteso per la sua entità — e uno scenario può essere sottoposto a benchmark solo dopo che il riferimento è stato verificato. Fino ad allora non comparirà in alcun menu di esecuzione. Il riferimento è la base per giudicare la qualità: quanto ci si avvicina ogni modello, campo per campo, e (per elenchi come il cast di un film) quanti degli elementi corretti ha effettivamente trovato. Lo impostate voi — insieme al modello giudice, al modello di embedding e alla rigorosità usata per valutarlo — direttamente nell'editor dello scenario.

Crealo in due modi. Generalo: allega un documento che contiene i valori corretti (una scheda tecnica, una pagina ufficiale), attiva la ricerca web ed esegui alcuni modelli robusti — estraggono la risposta dalla tua fonte anziché dalla memoria, così il risultato si fonda sulla verità, non su supposizioni. Oppure incolla un risultato affidabile che hai già. In entrambi i casi rivedi il JSON, correggi ciò che serve e contrassegnalo come verificato — un'approvazione esplicita che questa è la risposta di riferimento.

Poiché il riferimento è fondato e verificato manualmente una volta, funge anche da metro di misura affidabile riutilizzabile su ogni modello e ogni esecuzione futura.

Dove trovarlo

I benchmark si trovano in Gestione modelli → Benchmark(disponibile per proprietari e amministratori dell'organizzazione). Create e gestite gli scenari lì, oppure avviate un'esecuzione da uno dei quattro punti: il pulsante Benchmark dei modellinella barra degli strumenti (tutti i modelli attivi in vista), l'azione Benchmark dei modelli su qualsiasi riga di provider (i modelli attivi di quel provider), il menu a discesa Benchmark che appare quando selezionate i modelli nel pannello Modelli (i modelli selezionati), oppure l'azione Benchmark del modello su qualsiasi singola riga di modello.

I pulsanti Esegui e Valuta risultati di uno scenario funzionano in modo incrementale per impostazione predefinita: interessano solo i modelli ancora senza risultati più i risultati obsoleti (e i punteggi mancanti o obsoleti durante la valutazione). La finestra di conferma consente di ampliare l’ambito a tutti i modelli attivi per una riesecuzione completa, oppure di restringerlo per escludere le voci obsolete. Il filtro Modelli mostrati della tabella dei risultati può anche elencare i modelli attivi non ancora sottoposti a benchmark.

Costi e fatturazione

Le esecuzioni di benchmark effettuano chiamate LLM reali e detraggono i crediti in base all'utilizzo effettivo, esattamente come un normale arricchimento. La finestra di conferma vi indica quanti modelli state per eseguire prima di qualsiasi spesa. Ogni risultato salvato mostra il proprio costo addebitato, quindi un benchmark funge anche da strumento di confronto dei costi.