Model-benchmarks - Entity Enricher-documentatie

Model-benchmarks

Met benchmarkscenario's kun je LLM-modellen vergelijken op een echte, herhaalbare verrijkingstaak — appels met appels — waarbij de output en totale kosten van elk model worden vastgelegd, zodat je het juiste model voor de klus kunt kiezen.

Waarom benchmarken?

Modellen verschillen enorm in nauwkeurigheid, betrouwbaarheid van gestructureerde uitvoer en prijs. In plaats van te gokken voert een benchmarkscenario hetzelfde schema en dezelfde entity door meerdere modellen tegelijk uit en legt vast wat elk produceerde en wat het kostte. Je vergelijkt op basis van bewijs en kiest vervolgens definitief het goedkoopste model dat aan je kwaliteitseisen voldoet.

Hoe het werkt

1
Definieer een scenario

Een benchmarkscenario is een opgeslagen, herbruikbare modeltest. Het kan verrijking benchmarken (een schema, een vaste entiteitinvoer, een verrijkingsstrategie, talen, de response-schema / strict-structured-output-schakelaars, en eventuele bijlagen), voorbeeldgeneratie (een beschrijving van een entiteittype die elk model omzet in een voorbeeld-JSON), of schemageneratie (een vaste voorbeeld-JSON die elk model omzet in een schema). Het bevat ook zijn gouden referentie en hoe resultaten daartegen worden beoordeeld (een jurymodel, een embeddingmodel, en een striktheidsdrempel — voorbeeldgeneratie wordt door de jury alleen op basis van een rubric beoordeeld, zonder referentie). Definieer het één keer en hergebruik het voor elk model dat je wilt vergelijken.

2
Voer het uit over meerdere modellen

Zodra het scenario een geverifieerde referentie heeft, voer je het uit tegen de actieve modellen van één provider of elk actief model in beeld. Elk model wordt onafhankelijk verrijkt — geen fusie — zodat je per model een schoon, naast-elkaar-resultaat krijgt. De voortgang wordt live gestreamd en elk geslaagd resultaat wordt automatisch gescoord tegen de referentie wanneer de run afrondt. Als het scenario binaire bijlagen bevat, schakel je Sla modellen over die de bijlagen niet kunnen lezen in, en modellen zonder de vereiste bestandscapaciteit worden gerapporteerd als Overgeslagen in plaats van gegarandeerde mislukkingen te produceren.

3
Vergelijk output & kosten

Elke run wordt opgeslagen met de gestructureerde uitvoer, succesatus, tokenaantallen, verwerkingstijd en totale gefactureerde kosten. Klap een rij uit om de JSON-uitvoer te bekijken of naar het onderliggende verrijkingsrecord te springen.

4
Voer opnieuw uit om te vernieuwen

Een scenario opnieuw uitvoeren op hetzelfde model overschrijfthet vorige resultaat, dus de tabel toont altijd de laatste run. Bewerk je de configuratie van een scenario, dan worden oudere resultaten gemarkeerd als verouderd totdat je ze opnieuw uitvoert. Zet Runs per model op 2 of 3 en elk model wordt zo vaak gebenchmarkt — de tabel houdt het gemiddelde van kosten, kwaliteit en snelheid bij, plus een consistentiespreiding (modellen variëren van run tot run), tegen ongeveer dat veelvoud aan credits. Een grote spreiding komt vaak eerder door schema-eigenschappen die meer dan één vraag stellen dan door het model — de ambiguïteitscontrole vindt en verhelpt die.

De resultaten lezen

De resultatentabel is gebouwd voor vergelijking. Een samenvattingsstrook bovenaan benadrukt het slagingspercentage en de goedkoopste en snelste modellen die geslaagd zijn. Elke kolom — model, status, strategie, kosten, tokens en tijd — is sorteerbaar, dus met één klik rangschik je modellen op prijs of latency. Filter op modelnaam, status of strategie om de weergave te verfijnen, en klap een rij uit om de volledige gestructureerde output te lezen of het onderliggende verrijkingsrecord te openen.

De resultaten terugkoppelen: scorebronnen

Een benchmark is meer waard dan een tabel die je één keer leest. Markeer een scenario als scorebron en de resultaten per model gaan het platform aansturen: modellen dragen je gemeten scores als badges in elke keuzelijst, keuzelijsten sorteren erop, en automatische modelselectie kiest het model dat volgens je eigen metingen het hoogst scoort voor die taak. Markeer er meerdere en de scores worden gemiddeld — zo betekent “beste model” het beste op jouw schema's, niet op een openbaar klassement. Systeembeheerders kunnen een globaal scenario publiceren als terugval voor organisaties die er zelf geen hebben.

Wat “het beste” inhoudt, bepaal je zelf: kwaliteit, snelheid en kosten worden gemengd volgens een verhouding die je per scenariotype instelt onder Instellingen → Organisatie → Standaardwaarden (samen steeds 100, standaard elk een derde). Een team dat op batchkosten optimaliseert en een team dat op antwoordkwaliteit optimaliseert, kiezen terecht automatisch verschillende modellen uit dezelfde benchmark.

Itereren: opnieuw proberen & uitschakelen

Benchmarking is iteratief. Vink rijen aan met de selectievakjes (shift-klik voor een reeks) en gebruik dan het ···-menu om op een deelverzameling te werken zonder alles opnieuw uit te voeren:

Stel een gouden referentie in (vereist om te benchmarken)

Elk scenario bevat een referentieresultaat — de verwachte uitvoer voor zijn entiteit — en een scenario kan pas gebenchmarkt worden zodra die referentie is geverifieerd. Tot dan verschijnt het in geen enkel runmenu. De referentie is de basis om kwaliteit te beoordelen: hoe dicht elk model erbij komt, veld voor veld, en (voor lijsten zoals de cast van een film) hoeveel van de juiste items het daadwerkelijk heeft gevonden. Je stelt die in — samen met het beoordelingsmodel, het embeddingmodel en de striktheid waarmee ertegen wordt beoordeeld — direct in de scenario-editor.

Bouw het op twee manieren. Genereer het: voeg een document toe dat de juiste waarden bevat (een datasheet, een officiële pagina), zet webzoeken aan en draai een paar sterke modellen — ze halen het antwoord uit je bron in plaats van uit hun geheugen, zodat het resultaat op de waarheid berust en niet op giswerk. Of plak een bekend goed resultaat dat je al hebt. Hoe dan ook bekijk je de JSON, corrigeer je waar nodig en markeer je het als geverifieerd — een expliciete bevestiging dat dit het gouden antwoord is.

Omdat de referentie gegrond is en één keer door een mens is gecontroleerd, fungeert die meteen als een betrouwbare maatstaf die je hergebruikt voor elk model en elke toekomstige run.

Waar je het vindt

Benchmarks staan in Modelbeheer → Benchmarks(beschikbaar voor eigenaren en beheerders van de organisatie). Maak en beheer daar scenario's, of start een uitvoering vanaf een van vier plekken: de knop Benchmark models in de werkbalk (alle actieve modellen in beeld), de actie Benchmark models op een providerrij (de actieve modellen van die provider), het Benchmark-dropdownmenu dat verschijnt wanneer je modellen selecteert in het Modellen-paneel (de geselecteerde modellen), of de actie Benchmark model op een enkele modelrij.

De knoppen Run en Resultaten scoren van een scenario werken standaard incrementeel — ze richten zich alleen op de modellen die nog geen resultaat hebben plus verouderde resultaten (en niet-gescoorde of verouderde scores bij het scoren). Via het bevestigingsvenster kun je de reikwijdte verbreden naar elk actief model voor een volledige nieuwe run, of hem versmallen om verouderde items uit te sluiten. Met het filter Getoonde modellen in de resultatentabel kun je ook de actieve modellen weergeven die nog niet gebenchmarkt zijn.

Kosten & facturering

Benchmarkruns doen echte LLM-aanroepen en trekken credits af op basis van het werkelijke gebruik, precies zoals een normale verrijking. Het bevestigingsvenster laat je zien hoeveel modellen je gaat draaien voordat er iets wordt uitgegeven. Elk opgeslagen resultaat toont de in rekening gebrachte kosten, dus een benchmark fungeert ook als een tool voor kostenvergelijking.