Batchverwerking

Verrijk een onbeperkt aantal entiteiten parallel met realtime voortgangsregistratie, automatische multi-model-fusie en export naar JSON of Excel — alleen begrensd door het gebruiksquotum van je abonnement, niet door een vaste batchgrootte.

Invoermethoden

Rijen komen binnen via de bronbalk boven het raster — drie tabbladen, één tegelijk open. Bij het laden van rijen klapt de balk in tot één regel (“Plakken / CSV · 12 rijen geladen”) zodat het raster zijn hoogte houdt; klik op die regel om een andere set te laden.

  1. 1Plakken / CSV, Bestand en URL — één bron tegelijk open
  2. 2De knop telt de rijen voordat hij ze laadt
  3. 3Gedetecteerd aantal kolommen en koprij
Het scheidingsteken — komma, tab of puntkomma — en de koprij worden tijdens het plakken in de browser bepaald, zodat je een verkeerde gok al ziet voordat er ook maar één rij is geladen.

Plakken / CSV

Plak rijen rechtstreeks uit Excel, Google Sheets of een CSV-export. Komma, tab en puntkomma worden allemaal herkend, een cel tussen aanhalingstekens mag het scheidingsteken bevatten, en een eerste rij met niet-numerieke namen wordt als kolomkoppen gelezen.

Bestand

Sleep een .csv-, .tsv- of .json-bestand op het tabblad, of kies er een van schijf. Een JSON-bestand mag een array van objecten of één enkel object bevatten; de kolommen zijn de vereniging van hun sleutels, dus ook ongelijke records worden geladen.

URL

Haal entiteiten op van elk REST-endpoint. Wat er terugkomt wordt gelezen als een lijst van vrije objecten, en de kolomverzameling is de vereniging van hun sleutels.

Ondersteunde authenticatie:

GeenBearer-tokenAPI-sleutelheaderBasic Auth

Als de API een object retourneert, controleert het systeem sleutels als data, results, items op een ingesloten array.

Entity-selectie en -validatie

Nadat je entiteiten hebt geladen, verschijnen ze in een selecteerbare lijst met validatiestatus. Je kunt kiezen welke entiteiten je in de batch opneemt:

Meervoudige selectie— Vink rijen één voor één aan, of het vakje in de header voor alle rijen; met Ctrl+A selecteer je alles wat het huidige filter toont. Als je op een rij klikt, opent het resultaatpaneel in plaats van dat de selectie verandert.
Inline bewerken— Dubbelklik op een invoercel om een waarde ter plekke te corrigeren — elke kolom die je data meebracht is bewerkbaar, niet alleen de zoeksleutels van het schema.
Validatie— Je rijen hoeven de veldnamen van het schema niet te gebruiken — de modellen lezen ze zoals ze zijn. Het enige waarop het raster oordeelt, is leegte: een rij zonder enige waarde wordt gemarkeerd, grijs weergegeven en buiten de run gelaten. Kies een classificatiemodel om entiteiten van het verkeerde type automatisch te laten verwijderen.
Selectieve verwerking— Alleen geselecteerde entiteiten worden voor verrijking verzonden. Deselecteer entiteiten die je niet wilt verwerken.
Contractcontrole per rij— De server controleert elke rij tegen het invoercontract van het schema voordat er iets wordt uitgegeven, en meldt elke foutieve rij in plaats van te stoppen bij de eerste — zo herstel je de hele batch in één keer.
  1. 1Vinkvakjes per rij bepalen waaraan de run zijn budget besteedt
  2. 2De lege rij wordt hier gemarkeerd — en uit de run gehaald
  3. 312 geselecteerd — maar slechts 11 zijn uitvoerbaar
Rij 11 heeft geen naam, alleen een land en een ticker, en wordt toch verrijkt: een ontbrekende zoeksleutel kunnen de modellen omzeilen, een lege rij niet. Invoer, validatie en runstatus vormen hier één rij, geen drie aparte lijsten.

Configuratie

De zijbalk weerspiegelt de configuratieopties voor enkelvoudige verrijking:

OptieBeschrijving
SchemaDoelschema dat de structuur van de enrichment-output bepaalt
StrategieEnkele doorloop, expertisedomeinen of multi-expertise (parallelle aanroepen per domein)
ModellenEen of meer AI-modellen om per entiteit uit te voeren. Meerdere modellen maken automatische fusie mogelijk.
TalenTalen voor meertalige veldverrijking (bijv. Engels + Frans)
ClassificatieOptioneel snel model voor verificatie van het entiteitstype vóór verrijking
ArbitrageModel voor LLM-gebaseerde conflictoplossing tijdens fusion. Indien niet ingesteld, wordt een op regels gebaseerde merge gebruikt.

Kostenraming

De geschatte kosten staan in de runbalk, naast de knop die ze uitgeeft. Ze worden berekend op basis van het aantal eigenschappen in je schema, de tokenprijzen van de geselecteerde modellen en het aantal entiteiten dat je hebt geselecteerd. Bij automatische modelselectie wordt het model pas gekozen wanneer de run start, dus het getoonde bedrag is een mediaan van de modellen die gekozen kunnen worden. Een bevestigingsvenster verschijnt wanneer de run een echt risico met zich meebrengt — er wordt naar een gekoppelde database geschreven, de schatting is hoog of er worden geselecteerde rijen overgeslagen — en dus niet bij elke run.

  1. 1Twee modellen: elk één aanroep, per entiteit
  2. 2De schatting, opnieuw berekend zodra de selectie verandert
  3. 311 entiteiten, niet de 12 die geladen zijn — de lege rij valt af
De knop vermeldt wat er gaat draaien, zodat je het aantal en de prijs samen leest. Onder het telefoon-breekpunt vouwen de kiezers samen in “Meer opties” en blijft de schatting naast de knop staan.

Parallelle uitvoering

Alle geselecteerde entities worden tegelijkertijd verwerkt. Elke entity doorloopt onafhankelijk de volledige enrichment-pipeline:

Pijplijn per entiteit

  1. Classificatie (optioneel) — Een snel model verifieert het entiteitstype. In batch-modus pauzeren mismatches de taak niet; context wordt doorgegeven.
  2. Verrijking met meerdere modellen — Elk geselecteerd model verrijkt de entiteit parallel, elk binnen het snelheidsbudget van zijn sleutel.
  3. Auto-fusion (wanneer 2+ modellen slagen) — Resultaten worden automatisch samengevoegd met conflictdetectie en -oplossing.

Snelheidsregulering

Alle entiteiten delen het snelheidsbudget van elke API-sleutel en elk model — de verzoeken en tokens per minuut die de provider die sleutel toekent, uitgelezen uit zijn responses of aangeleerd na een afwijzing. Bij 20 entiteiten en 2 modellen worden de aanroepen naar een model dat 15 verzoeken per minuut toestaat over de minuut gespreid, terwijl het andere model zijn eigen tempo aanhoudt, zodat de batch zonder 429-fouten wordt afgerond.

Realtime voortgang

Als je een run start, verschijnt er een runbalk tussen de werkbalk en het raster, gevoed door Server-Sent Events (SSE): één voortgangsbalk voor de batch, klaar / mislukt / overgeslagen als aparte tellers in plaats van één samengevoegd getal, verstreken tijd met een ETA op basis van de rijen die al afgerond zijn, en de uitgaven tot nu toe afgezet tegen de schatting vooraf. Er opent niets over het raster — de rijen blijven waar je ze achterliet, en elke rij draagt zijn eigen status in de kolom Status, naast de Tijd en de Kosten die hij kostte.

Niet uitgevoerd

De rij heeft nog geen run doorlopen — de cel Status toont een streepje in plaats van zichzelf de hele kolom door te herhalen.

In wachtrij

Toegelaten tot de batch, wacht op ruimte in het snelheidsbudget van de sleutel.

Wordt uitgevoerd

Het label maakt plaats voor een inline balk die telt hoeveel expertisestappen van het totaal klaar zijn.

Klaar

Alle modellen hebben geantwoord. Tijd en Kosten worden ingevuld en de Resultaat-kolommen worden leesbaar.

Mislukt

Geen enkel model leverde een resultaat voor deze rij. Zodra de batch stopt, biedt de balk aan om alleen de mislukte rijen opnieuw te proberen.

Overgeslagen

Weggegooid vóór de verrijking — bijvoorbeeld door een zekere classificatiemismatch — waardoor de rij nooit iets heeft gekost.

Met de chips Done / Failed / Skipped in de werkbalk filter je het raster op die rijen, en met de schakelaar Input / Both / Result zie je dezelfde rijen als wat je hebt verstuurd, wat er terugkwam, of beide naast elkaar.

Annulering en foutafhandeling

Je kunt een lopende batch op elk moment annuleren. Annuleren is coöperatief — entiteiten die al onderweg zijn, voltooien hun huidige LLM-aanroep, maar er starten geen nieuwe aanroepen. Gedeeltelijke resultaten van voltooide entiteiten blijven behouden.

Foutbestendigheid

Batchverwerking is ontworpen om robuust te zijn. Individuele fouten stoppen de batch niet:

  • Als de classificatie voor een entiteit mislukt, gaat de verrijking door zonder context
  • Als één model faalt, gaan de andere modellen voor die entiteit gewoon door
  • Bij twee of meer modellen wordt de automatische samenvoeging alleen uitgevoerd voor entiteiten waarbij elk model is geslaagd — een onvolledige entiteit levert geen samengevoegd resultaat op en er bereikt niets je database totdat het ontbrekende model is hersteld door de mislukte expertisedomeinen ervan opnieuw te proberen
  • Als alle modellen falen voor een entiteit, wordt deze als mislukt gemarkeerd terwijl de andere doorgaan
  • Modellen die 'niet gevonden'-fouten teruggeven worden automatisch gedeactiveerd

Exportformaten

Na afronding van de batch exporteer je de resultaten in drie formaten. Voor elke entiteit heeft het fusieresultaat de voorkeur indien beschikbaar; anders wordt het beste modelresultaat gebruikt.

JSON-bestand

Download de volledige resultaten als een gestructureerd JSON-bestand met alle entity-gegevens, model-uitvoer en fusion-metadata.

Klembord

Kopieer de JSON-resultaten rechtstreeks naar je klembord om ze in andere tools of scripts te plakken.

Excel

Een werkmap met drie tabbladen: Results (één rij per entiteit met platgeslagen eigenschappen), Summary (batch-metadata, modellen, kosten) en Conflicts (conflictdetails per entiteit met de redenering achter de oplossing).

Limieten

LimietWaarde
Max. entiteiten per batchGeen vaste limiet — begrensd door het gebruiksquotum van je abonnement
Max. grootte entiteitgegevens50.000 tekens
Max. promptlengte100.000 tekens
Time-out bij URL ophalen30 seconden

Volgende stappen