Model-benchmarks

Met benchmarkscenario's kun je LLM-modellen vergelijken op een echte, herhaalbare verrijkingstaak — appels met appels — waarbij de output en totale kosten van elk model worden vastgelegd, zodat je het juiste model voor de klus kunt kiezen.

Waarom benchmarken?

Modellen verschillen enorm in nauwkeurigheid, betrouwbaarheid van gestructureerde uitvoer en prijs. In plaats van te gokken voert een benchmarkscenario hetzelfde schema en dezelfde entity door meerdere modellen tegelijk uit en legt vast wat elk produceerde en wat het kostte. Je vergelijkt op basis van bewijs en kiest vervolgens definitief het goedkoopste model dat aan je kwaliteitseisen voldoet.

Hoe het werkt

1
Definieer een scenario

Een benchmarkscenario is een opgeslagen, herbruikbare modeltest. Het kan verrijking benchmarken (een schema, een vaste entiteitsinvoer, een verrijkingsstrategie, talen, de schakelaars voor response-schema / strict structured output, en eventuele bijlagen), voorbeeldgeneratie (een vrijetekstverzoek om een voorbeeld dat elk model omzet in een voorbeeld-JSON), of schemageneratie (één tot twintig vaste invoervoorbeelden van één entiteitstype, die elk model omzet in een schema — importeerbaar vanuit een opgeslagen schema, samen met het schema zelf als referentieconcept). Het bevat ook de gouden referentie en hoe resultaten daartegen worden beoordeeld (een jurymodel, een embeddingmodel en een strengheidsdrempel — voorbeeldgeneratie wordt uitsluitend door de jury op een rubric beoordeeld, zonder referentie). Definieer het één keer en hergebruik het voor elk model dat je wilt vergelijken.

2
Voer het uit over meerdere modellen

Zodra het scenario een geverifieerde referentie heeft, voer je het uit tegen de actieve modellen van één provider of elk actief model in beeld. Elk model wordt onafhankelijk verrijkt — geen fusie — zodat je per model een schoon, naast-elkaar-resultaat krijgt. De voortgang wordt live gestreamd en elk geslaagd resultaat wordt automatisch gescoord tegen de referentie wanneer de run afrondt. Als het scenario binaire bijlagen bevat, schakel je Sla modellen over die de bijlagen niet kunnen lezen in, en modellen zonder de vereiste bestandscapaciteit worden gerapporteerd als Overgeslagen in plaats van gegarandeerde mislukkingen te produceren.

3
Vergelijk output & kosten

Elke run wordt opgeslagen met de gestructureerde uitvoer, succesatus, tokenaantallen, verwerkingstijd en totale gefactureerde kosten. Klap een rij uit om de JSON-uitvoer te bekijken of naar het onderliggende verrijkingsrecord te springen.

4
Voer opnieuw uit om te vernieuwen

Een scenario opnieuw uitvoeren op hetzelfde model overschrijfthet vorige resultaat, dus de tabel toont altijd de laatste run. Bewerk je de configuratie van een scenario, dan worden oudere resultaten gemarkeerd als verouderd totdat je ze opnieuw uitvoert. Zet Runs per model op 2 of 3 en elk model wordt zo vaak gebenchmarkt — de tabel houdt het gemiddelde van kosten, kwaliteit en snelheid bij, plus een consistentiespreiding (modellen variëren van run tot run), tegen ongeveer dat veelvoud aan credits. Een grote spreiding komt vaak eerder door schema-eigenschappen die meer dan één vraag stellen dan door het model — de ambiguïteitscontrole vindt en verhelpt die.

De resultaten lezen

De resultatentabel is gebouwd voor vergelijking. Een samenvattingsstrook bovenaan benadrukt het slagingspercentage en de goedkoopste en snelste modellen die geslaagd zijn. Elke kolom — model, status, strategie, kosten, tokens en tijd — is sorteerbaar, dus met één klik rangschik je modellen op prijs of latency. Filter op modelnaam, status of strategie om de weergave te verfijnen, en klap een rij uit om de volledige gestructureerde output te lezen of het onderliggende verrijkingsrecord te openen.

  1. 1Goedkoopste en snelste van de run
  2. 2Totaal combineert kwaliteit, snelheid en kosten
  3. 3Kwaliteit, met de spreiding over de herhalingen
Eén scenario, zes modellen, dezelfde 35 velden: het gaat om de ranglijst, en het goedkoopste en het snelste model worden apart benoemd, want dat is zelden hetzelfde model.

De resultaten terugkoppelen: scorebronnen

Een benchmark is meer waard dan een tabel die je één keer leest. Markeer een scenario als scorebron en de resultaten per model gaan het platform aansturen: modellen dragen je gemeten scores als badges in elke keuzelijst, keuzelijsten sorteren erop, en automatische modelselectie kiest het model dat volgens je eigen metingen het hoogst scoort voor die taak. Markeer er meerdere en de scores worden gemiddeld — zo betekent “beste model” het beste op jouw schema's, niet op een openbaar klassement. Systeembeheerders kunnen een globaal scenario publiceren als terugval voor organisaties die er zelf geen hebben.

Wat “het beste” inhoudt, bepaal je zelf: kwaliteit, snelheid en kosten worden gemengd volgens een verhouding die je per scenariotype instelt onder Instellingen → Organisatie → Standaardwaarden (samen steeds 100, standaard elk een derde). Een team dat op batchkosten optimaliseert en een team dat op antwoordkwaliteit optimaliseert, kiezen terecht automatisch verschillende modellen uit dezelfde benchmark.

Uit laat het scenario een meting blijven; Mijn organisatie maakt het de basis waaruit elke modelkiezer leest.

Itereren: opnieuw uitvoeren & uitschakelen

Benchmarken is iteratief. Klik op rijen om ze te selecteren (Ctrl/Cmd-klik om te wisselen, shift-klik voor een reeks, of Alles selecteren in het ··· menu) en werk daarna met die selectie zonder alles opnieuw te draaien:

Stel een gouden referentie in (vereist om te benchmarken)

Elk scenario bevat een referentieresultaat — de verwachte uitvoer voor zijn entiteit — en een scenario kan pas gebenchmarkt worden zodra die referentie is geverifieerd. Tot dan verschijnt het in geen enkel runmenu. De referentie is de basis om kwaliteit te beoordelen: hoe dicht elk model erbij komt, veld voor veld, en (voor lijsten zoals de cast van een film) hoeveel van de juiste items het daadwerkelijk heeft gevonden. Je stelt die in — samen met het beoordelingsmodel, het embeddingmodel en de striktheid waarmee ertegen wordt beoordeeld — direct in de scenario-editor.

Bouw het op twee manieren. Genereer het: voeg een document toe dat de juiste waarden bevat (een datasheet, een officiële pagina), zet webzoeken aan en draai een paar sterke modellen — ze halen het antwoord uit je bron in plaats van uit hun geheugen, zodat het resultaat op de waarheid berust en niet op giswerk. Of plak een bekend goed resultaat dat je al hebt. Hoe dan ook bekijk je de JSON, corrigeer je waar nodig en markeer je het als geverifieerd — een expliciete bevestiging dat dit het gouden antwoord is.

Omdat de referentie gegrond is en één keer door een mens is gecontroleerd, fungeert die meteen als een betrouwbare maatstaf die je hergebruikt voor elk model en elke toekomstige run.

Waar je het vindt

Benchmarks vind je in Modelbeheer → Benchmarks(beschikbaar voor eigenaren en beheerders van de organisatie). Maak en beheer daar scenario's, of start een run vanaf het tabblad Modellen met de knop Modellen benchmarkenin de werkbalk: kies een scenario en bepaal daarna de scope — de providers of modellen die je hebt geselecteerd (de knop toont het aantal), de modellen die nooit zijn gebenchmarkt of die onder een oudere scenarioconfiguratie zijn gebenchmarkt, of elk actief model in beeld.

De knoppen Run en Resultaten scoren van een scenario werken standaard incrementeel — ze richten zich alleen op de modellen die nog geen resultaat hebben plus verouderde resultaten (en niet-gescoorde of verouderde scores bij het scoren). Via het bevestigingsvenster kun je de reikwijdte verbreden naar elk actief model voor een volledige nieuwe run, of hem versmallen om verouderde items uit te sluiten. Met het filter Getoonde modellen in de resultatentabel kun je ook de actieve modellen weergeven die nog niet gebenchmarkt zijn.

Kosten & facturering

Benchmarkruns doen echte LLM-aanroepen en trekken credits af op basis van het werkelijke gebruik, precies zoals een normale verrijking. Het bevestigingsvenster laat je zien hoeveel modellen je gaat draaien voordat er iets wordt uitgegeven. Elk opgeslagen resultaat toont de in rekening gebrachte kosten, dus een benchmark fungeert ook als een tool voor kostenvergelijking.