Benchmark dei modelli

Gli scenari di benchmark vi consentono di confrontare i modelli LLM su un'attività di arricchimento reale e ripetibile — un confronto equo — catturando l'output di ciascun modello e il costo totale, così da poter scegliere il modello giusto per il compito.

Perché fare un benchmark?

I modelli differiscono enormemente per accuratezza, affidabilità dell'output strutturato e prezzo. Anziché tirare a indovinare, uno scenario di benchmark esegue lo stesso schema e la stessa entità attraverso molti modelli contemporaneamente e registra ciò che ciascuno ha prodotto e quanto è costato. Il confronto si basa su dati concreti, così da poter fissare il modello più economico che soddisfa i propri standard di qualità.

Come funziona

1
Definire uno scenario

Uno scenario di benchmark è un test di modello salvato e riutilizzabile. Può sottoporre a benchmark l'arricchimento (uno schema, un input di entità fisso, una strategia di arricchimento, le lingue, gli interruttori response-schema / strict-structured-output e gli eventuali allegati), la generazione di campioni (una richiesta di campione in testo libero che ogni modello trasforma in un JSON di esempio) oppure la generazione di schemi (da uno a venti campioni di input fissi di un unico tipo di entità, che ogni modello converte in uno schema — importabili, insieme allo schema stesso come bozza di riferimento, da uno schema salvato). Contiene inoltre il proprio riferimento gold e il modo in cui i risultati vengono valutati rispetto a esso (un modello giudice, un modello di embedding e una soglia di severità — la generazione di campioni viene valutata tramite rubrica dal solo giudice, senza riferimento). Lo definisca una volta e lo riutilizzi per ogni modello che desidera confrontare.

2
Lo esegua su più modelli

Una volta che lo scenario dispone di un riferimento verificato, eseguitelo sui modelli attivi di un provider oppure su tutti i modelli attivi in vista. Ogni modello viene arricchito in modo indipendente — senza fusione — così da ottenere un risultato pulito e affiancato per ciascun modello. L'avanzamento viene trasmesso in tempo reale e ogni risultato riuscito viene valutato automaticamente rispetto al riferimento al termine dell'esecuzione. Se lo scenario include allegati binari, abilitate Salta i modelli che non possono leggere gli allegati e i modelli privi della capacità di gestione file richiesta vengono segnalati come Saltati anziché produrre errori garantiti.

3
Confronta output e costi

Ogni esecuzione viene salvata con il suo output strutturato, lo stato di esito, i conteggi dei token, il tempo di elaborazione e il costo totale addebitato. Espandete una qualsiasi riga per esaminare l'output JSON o passare al record di enrichment sottostante.

4
Esegui di nuovo per aggiornare

Rieseguire uno scenario sullo stesso modello sovrascrive il risultato precedente, quindi la tabella riflette sempre l'esecuzione più recente. Modificando la configurazione di uno scenario, i risultati precedenti vengono contrassegnati come obsoleti finché non li si riesegue. Impostando Esecuzioni per modello su 2 o 3, ogni modello viene sottoposto a benchmark altrettante volte: la tabella conserva la media di costo, qualità e velocità più uno scarto di coerenza (i modelli variano da un'esecuzione all'altra), con un consumo di crediti all'incirca pari a quel multiplo. Uno scarto ampio dipende spesso da proprietà dello schema che pongono più di una domanda, più che dal modello: il controllo di ambiguità le individua e le corregge.

Leggere i risultati

La tabella dei risultati è pensata per il confronto. Una striscia di riepilogo nella parte superiore evidenzia il tasso di successo e i modelli più economici e più veloci che hanno avuto esito positivo. Ogni colonna — modello, stato, strategia, costo, token e tempo — è ordinabile, quindi un solo clic ordina i modelli per prezzo o latenza. Filtri per nome del modello, stato o strategia per restringere la vista ed espanda qualsiasi riga per leggere l'output strutturato completo o aprire il record di arricchimento sottostante.

  1. 1Il più economico e il più veloce dell'esecuzione
  2. 2Il punteggio complessivo combina qualità, velocità e costo
  3. 3Qualità, con la dispersione tra le ripetizioni
Uno scenario, sei modelli, gli stessi 35 campi: il punto è la classifica, e il modello più economico e quello più veloce vengono evidenziati perché raramente coincidono.

Riportare i risultati nel sistema: le origini di punteggio

Un benchmark vale più di una tabella letta una sola volta. Contrassegni uno scenario come fonte di punteggio e i suoi risultati per modello iniziano a guidare la piattaforma: i modelli riportano i punteggi misurati come badge in ogni selettore, i selettori li usano per l'ordinamento e la selezione automatica del modello sceglie il modello che le sue misurazioni classificano come migliore per quel compito. Ne contrassegni diversi e i punteggi vengono mediati: «modello migliore» significa migliore sui suoi schemi, non su una classifica pubblica. Gli amministratori di sistema possono pubblicare uno scenario globale come fallback per le organizzazioni che non ne hanno uno proprio.

Il peso da attribuire a “migliore” lo decide lei: qualità, velocità e costo si combinano secondo un rapporto configurato per tipo di scenario in Impostazioni → Organizzazione → Valori predefiniti (con somma pari a 100, un terzo ciascuno per impostazione predefinita). Un team che ottimizza il costo del batch e un team che ottimizza la qualità delle risposte selezioneranno automaticamente, e legittimamente, modelli diversi dallo stesso benchmark.

Disattivato lascia lo scenario come semplice misurazione; La mia organizzazione lo rende la base da cui attinge ogni selettore di modello.

Iterazione: riesecuzione e disattivazione

L'esecuzione dei benchmark è iterativa. Fare clic sulle righe per selezionarle (Ctrl/Cmd+clic per attivare/disattivare, Maiusc+clic per un intervallo, oppure Seleziona tutto nel menu ···), quindi agire su quel sottoinsieme senza rieseguire tutto:

Imposta un riferimento gold (necessario per il benchmark)

Ogni scenario contiene un risultato di riferimento — l'output atteso per la sua entità — e uno scenario può essere sottoposto a benchmark solo dopo che il riferimento è stato verificato. Fino ad allora non comparirà in alcun menu di esecuzione. Il riferimento è la base per giudicare la qualità: quanto ci si avvicina ogni modello, campo per campo, e (per elenchi come il cast di un film) quanti degli elementi corretti ha effettivamente trovato. Lo impostate voi — insieme al modello giudice, al modello di embedding e alla rigorosità usata per valutarlo — direttamente nell'editor dello scenario.

Crealo in due modi. Generalo: allega un documento che contiene i valori corretti (una scheda tecnica, una pagina ufficiale), attiva la ricerca web ed esegui alcuni modelli robusti — estraggono la risposta dalla tua fonte anziché dalla memoria, così il risultato si fonda sulla verità, non su supposizioni. Oppure incolla un risultato affidabile che hai già. In entrambi i casi rivedi il JSON, correggi ciò che serve e contrassegnalo come verificato — un'approvazione esplicita che questa è la risposta di riferimento.

Poiché il riferimento è fondato e verificato manualmente una volta, funge anche da metro di misura affidabile riutilizzabile su ogni modello e ogni esecuzione futura.

Dove trovarlo

I benchmark si trovano in Gestione modelli → Benchmark(disponibile ai proprietari e agli amministratori dell'organizzazione). Da lì è possibile creare e gestire gli scenari, oppure avviare un'esecuzione dalla scheda Modelli con il pulsante Esegui benchmark dei modellinella barra degli strumenti: selezionare uno scenario, quindi scegliere l'ambito, ovvero i provider o i modelli selezionati (il pulsante ne indica il numero), i modelli mai sottoposti a benchmark o sottoposti a benchmark con una configurazione di scenario precedente, oppure tutti i modelli attivi visualizzati.

I pulsanti Esegui e Valuta risultati di uno scenario funzionano in modo incrementale per impostazione predefinita: interessano solo i modelli ancora senza risultati più i risultati obsoleti (e i punteggi mancanti o obsoleti durante la valutazione). La finestra di conferma consente di ampliare l’ambito a tutti i modelli attivi per una riesecuzione completa, oppure di restringerlo per escludere le voci obsolete. Il filtro Modelli mostrati della tabella dei risultati può anche elencare i modelli attivi non ancora sottoposti a benchmark.

Costi e fatturazione

Le esecuzioni di benchmark effettuano chiamate LLM reali e detraggono i crediti in base all'utilizzo effettivo, esattamente come un normale arricchimento. La finestra di conferma vi indica quanti modelli state per eseguire prima di qualsiasi spesa. Ogni risultato salvato mostra il proprio costo addebitato, quindi un benchmark funge anche da strumento di confronto dei costi.