Generieren Sie strukturierte JSON-Schemas aus Beispieldaten mithilfe von KI, mit automatischer Selbstkorrektur und intelligenter Nachbearbeitung.
Die Schemagenerierung wandelt rohe Entitätsdaten in ein typisiertes, annotiertes JSON-Schema um, das genau definiert, welche Informationen bei der Anreicherung extrahiert werden sollen. Anstatt Schemas manuell zu schreiben, fügen Sie Beispiel-JSON ein und lassen die KI die Struktur analysieren, Typen ableiten, Fachbereiche zuweisen und Verbesserungen vorschlagen.
Die Generierung ist kein einziger großer Prompt. Sie ist eine Folge kleiner Aufrufe mit jeweils genau einem Anliegen, die größtenteils parallel laufen — genau das ermöglicht es kleinen und günstigen Modellen, ein brauchbares Schema zu erzeugen, denn jeder Aufruf beantwortet eine eng umrissene Frage zu Material, das er vollständig überblicken kann.
"8.275 h" wird zu half_life_seconds: 29790), und ein Datum, das kein nativer Typ abbilden kann, wird zu einer ganzzahligen Jahreszahl. Jeder beobachtete Wert muss die Annahme belegen, sonst bleibt die Eigenschaft Text. Gespeichert wird das umgeschriebene Sample.{"en": "...", "fr": "..."}) werden zu einem einzigen mehrsprachigen Wert zusammengefasst.Jeder Schritt wiederholt sich eigenständig (3 Versuche), und seine Antworten summieren sich über die Versuche hinweg, sodass auch ein Modell, das in Fragmenten antwortet, konvergiert. Danach akzeptiert der Schritt das Erreichte und die Lücken werden deterministisch gefüllt — ein schwaches Modell verschlechtert somit die Beschreibungen, statt die Generierung scheitern zu lassen. Nur Identität und Fachgebiets-Routing dürfen den gesamten Lauf scheitern lassen. Jeder Aufruf wird als eigener Prompt abgerechnet und protokolliert, sodass der Datensatz genau zeigt, wofür was ausgegeben wurde.
Sie können statt eines einzigen mehrere Beispiele desselben Entity-Typs übergeben – das Schema deckt dann die Vereinigung ihrer Felder ab, alles, was in einem Beispiel fehlt, wird nullbar, und die über alle Beispiele hinweg gesehenen Werte werden zu echten Beispielwerten. Die Feldnamen müssen übereinstimmen: Beispiele, die unterschiedliche Entity-Typen beschreiben, werden abgelehnt, ebenso Objekte innerhalb eines Arrays, die kein einziges gemeinsames Feld haben, da nichts mehr übrig bliebe, um ihre Zeilen zu identifizieren. Der Beispiel-Editor markiert jeden solchen Unterschied, bevor Sie eine Generierung verbrauchen.
Werte mit einer eigenen Einheit werden in Zahlen umgewandelt, bevor das Schema abgeleitet wird, denn eine Spalte mit "8.275 h" und "85 ms" lässt sich nicht sortieren, nach Bereich filtern oder aggregieren. Die Einheit wandert in den Eigenschaftsnamen (half_life_seconds), ein nicht-numerischer Platzhalter wie "stable" wird zu null, und Datumsangaben vor dem Jahr 1 werden zu einer ganzzahligen Jahresangabe (negativ für v. Chr.), die kein Datumstyp speichern kann und die als Text falsch sortiert. Ihr Beispielbereich wird entsprechend aktualisiert, sodass er stets das vom Schema beschriebene Beispiel zeigt. Alles, was die Umwandlung nicht mit Sicherheit lesen kann, bleibt exakt so, wie Sie es geschrieben haben.
Da jeder Schritt genau eine eng gefasste Frage beantwortet, kann auch die Korrektur eng gefasst sein: Der Validator eines Schritts behält alles Brauchbare aus der Antwort und fragt nur das Fehlende erneut ab. Nichts wird von Grund auf neu erzeugt — eine teilweise korrekte Antwort ist damit ein Fortschritt und kein vergeudeter Versuch.
Die acht Validierungsregeln laufen weiterhin als abschließende Prüfung über das zusammengesetzte Schema – Typkorrektheit, Expertise-Zuweisung, Referenzintegrität, Vollständigkeit. Zu diesem Zeitpunkt sind sie eher ein Sicherheitsnetz als der Korrekturmechanismus. Mehr zu jeder Regel finden Sie im Leitfaden Validierungsregeln.
Ein generiertes Schema ist mehr als eine einfache Typdefinition. Jede Eigenschaft enthält Metadaten, die den Anreicherungsprozess steuern:
JSON-Schema-Typ (string, number, integer, boolean, array, object)
Kontextbezogene Beschreibung, die der KI mitteilt, welche Informationen zu finden sind
Welche Expertendomäne (finanziell, regulatorisch usw.) diesen Wert liefert
Ob dieses Feld Teil dessen ist, was die Instanz identifiziert. Identifizierende Eigenschaften erfüllen zwei Aufgaben zugleich: Sie richten den Anreicherungs-Prompt auf die richtige Entität aus, und anhand von ihnen ordnet die Fusion Array-Elemente einander zu. Eine davon darf dennoch nullable sein — ein Qualifizierer, der ähnlich aussehende Geschwister trennt, bleibt identifizierend, selbst wenn er ganzen Familien tatsächlich fehlt
Wenn die Werte eines Strings aus einer kleinen, konventionellen Menge stammen (Status, Bewertungen, Klassifizierungscodes), schlägt die Generierung die Elemente vor — in der Schreibweise Ihrer Beispiele — als offenes Vokabular, auf das die Anreicherung konvergiert. Werte außerhalb der Liste erscheinen im Editor als Kandidaten, und Sie schließen die Menge, sobald sie nicht mehr wächst; eine geschlossene Menge wird zu einem verbindlichen Vertrag, aus dem die Anreicherung nicht abdriften kann
Ob das Feld null sein darf – nicht nullbare Felder sind für die Aufnahme in die Datenbank erforderlich
Ob das Feld in mehreren Sprachen angereichert werden soll
Ob der ursprüngliche Wert während der Anreicherung unverändert beibehalten werden soll
Realistische Beispielwerte, die die KI zum richtigen Format führen
Maschinell prüfbare Form für String-Werte: Fehlerhafte Antworten werden abgelehnt und erneut angefordert, gespeicherte Werte behalten die kanonische Form. Die Generierung nennt nur ein benanntes Format (date, time, date-time, uuid, email, uri, ipv4, ipv6), das durch ihre Stichproben belegt ist — ein Regex-Muster ist eine Vorhersage über Werte, die noch niemand gesehen hat, und ein falsches lässt jede Anreicherung des Felds scheitern; dieses fügen Sie daher selbst im Editor hinzu
Die KI gruppiert Schema-Eigenschaften anhand ihrer semantischen Bedeutung in Expertisebereiche. Ein Schema für ein Pharmaunternehmen könnte beispielsweise Bereiche wie „Finanzanalyst“, „Regulierungsexperte“ und „Unternehmensinformationen“ enthalten. Diese Bereiche werden von der Multi-Expertise-Strategie genutzt, um parallele, spezialisierte LLM-Aufrufe für tiefergehende Ergebnisse durchzuführen.
Die Anzahl der Fachbereiche wird basierend auf der Eigenschaftsanzahl Ihrer Daten automatisch begrenzt, um eine Überfragmentierung zu verhindern:
Sobald die Fragmente zusammengesetzt sind, klären deterministische Schritte alles, was nicht einem Modell überlassen werden sollte — mit Ihren tatsächlichen Eingabedaten als Beleg:
Ein Feld, das in irgendeinem Beispiel fehlt oder null ist, wird nullable — unabhängig davon, was das Modell geantwortet hat. So ist ein unbekannter Wert eine zulässige Antwort und kein Datenqualitätsfehler. Beispiele können nur erweitern: Eine Handvoll Beispiele belegt das Vorhandensein für genau diese Instanzen, nie für jede Instanz des Typs — deshalb hat auch das Modell eine Stimme, und beide werden mit ODER verknüpft.
Attribute, die nicht nebeneinander bestehen können, werden per Regel aufgelöst statt durch erneutes Nachfragen: „preserve“ setzt sich gegen „multilingual“ und „nullable“ durch, ein erhalten gebliebenes geschlossenes Vokabular hebt „multilingual“ auf, und eine Schlüsseleigenschaft behält nie ein Enum.
Jedes Objekt innerhalb eines Arrays hat garantiert mindestens eine Schlüsseleigenschaft — sie ist die Einheit, auf der die Fusion dedupliziert; ein Array-Element ohne Schlüssel würde das Zusammenführen der Antworten zweier Modelle unmöglich machen.
Alle eindeutigen Fachgebiete werden aus dem Schema für Metriken und die Strategiekonfiguration erfasst.
Ein Schema beschreibt sich selbst in einer Sprache — seine Typnamen, Eigenschaftsbeschreibungen, Fachgebietsbezeichnungen und Vorschläge. Das ist etwas anderes als die Sprachen, in die Sie anreichern. Geben Sie bei der Generierung eine Sprache an, oder lassen Sie sie weg, dann entscheidet die Sprache der Eigenschaftsnamen Ihres Beispiels: Ein französisches Beispiel erzeugt kein englisches Schema mehr. Die Wahl wird gespeichert, sodass spätere KI-Bearbeitungen in derselben Sprache weiterschreiben, statt wieder ins Englische abzudriften.
Zum Start benötigen Sie keine Beispieldaten. Beschreiben Sie das gewünschte Beispiel in einfachen Worten – die Art der Entität, die Eigenschaften, die es enthalten muss, wie groß oder wie tief – wahlweise mit Dokumenten als Grundlage oder mit einer Websuche zum Abgleich mit der Realität – und die Plattform schreibt die Beispiele für Sie. Fordern Sie mehrere an, erhalten Sie mehrere verschiedene Instanzen und nicht eine einzige, nur anders formuliert.
Das erste Sample legt im selben Aufruf auch fest, worum es in den übrigen gehen wird. Fragt man N-mal unabhängig nach „einem Beispiel“, erhält man zuverlässig N-mal dieselbe berühmte Instanz; erst die vorab benannte Gesamtbesetzung macht sie unterschiedlich.
Die übrigen Samples werden parallel gegen die Struktur von Sample 1 als Vertrag erzeugt – sie werden nicht nur gebeten, dazu zu passen –, sodass eine Variante kein Feld umbenennen, hinzufügen oder weglassen kann. Was dennoch doppelt oder fehlerhaft zurückkommt, wird in einer begrenzten Wiederholungswelle erneut angefordert; wird die volle Anzahl nicht erreicht, werden Sie darüber informiert, statt stillschweigend weniger zu erhalten.
Alles in Ihrer Anfrage wird berücksichtigt – ein Größenbudget schlägt den Drang des Generators zur Vollständigkeit, eine von Ihnen gewünschte Struktur schlägt seine Standardvorgabe – oder die Antwort nennt Ihnen, was nicht berücksichtigt werden konnte und warum; nichts wird stillschweigend verworfen. Eines ist keine Anfrage: Wie viele Samples Sie erhalten, legt die Sample-Anzahl fest, und jedes Sample ist genau eine Instanz – die Bitte um „drei Samples“ im Text ergibt nie eine Liste, die in ein einziges Objekt verpackt ist. Ist die Anfrage tatsächlich mehrdeutig (eine Art von Entität mit mehreren Lesarten, zwei unvereinbare Geltungsbereiche), fragt der Generator bei Ihnen nach, bevor er die Generierung aufwendet, statt zu raten. Die Sprache steht standardmäßig auf auto und wird aus den Worten Ihrer eigenen Anfrage abgeleitet, danach aus einem etwaigen angehängten Dokument.
Lesen Sie einen Eigenschaftsnamen im Kontext seines übergeordneten Objekts und zählen Sie, nach wie vielen verschiedenen Dingen er fragen könnte. Eines ist eindeutig. Bei zwei oder mehr entscheidet sich jedes Modell für ein anderes, und die Spalte vermischt am Ende Antworten auf verschiedene Fragen – annual_revenue bei einem Unternehmen kann die Gruppe oder die Entität meinen, brutto oder netto, in einer von mehreren Währungen. Gar keines – ein Name für etwas, das dieses übergeordnete Objekt schlicht nicht besitzt – ist schlimmer: Da es nichts nachzuschlagen gibt, erfindet das Modell einen Wert.
Die Generierung geht doppelt dagegen vor: Der Prompt selbst fordert Namen, die nur eine Lesart zulassen, und ein Nachlauf über das fertige Schema kennzeichnet jene, bei denen das noch nicht der Fall ist. In diesem Stadium ist die Abhilfe eine Umbenennung – die Beschreibungen wurden aus den Namen erzeugt, eine Beschreibung kann den Namen, aus dem sie stammt, also nicht eindeutig machen, und noch hängt nichts vom Schema ab. Die Beispiel-Generierung führt dieselbe Prüfung am Beispiel durch und wendet die Umbenennungen an, bevor Sie es überhaupt zu sehen bekommen. Fließtext – eine Beschreibung, eine Zusammenfassung, Notizen – wird nie markiert: Die Formulierung variiert, aber die gestellte Frage ist klar.
Markierte Eigenschaften erhalten im Workflow-Editor ein Badge „mehrdeutig“, das die Lesarten auflistet, die der Name zulässt. Sobald das Schema live ist, besteht die Abhilfe stattdessen in einer neu formulierten Beschreibung, die eine Bedeutung festlegt, ohne den Datenvertrag zu brechen. Das vollständige Bewertungsraster und die zugehörigen Abhilfen finden Sie im Leitfaden Mehrdeutigkeitsprüfung.
Wenn Sie eine Beispiel-Entität aus einer Beschreibung generieren, können Sie „Websuche verwenden“ aktivieren, damit das Modell aktuelle Fakten im Web nachschlägt, statt sich allein auf seine Trainingsdaten zu stützen. Das liefert frischere, genauere Beispielwerte — besonders bei schnelllebigen Angaben wie Preisen, Mitarbeiterzahlen oder aktuellen Releases. Die Option ist nur für Modelle verfügbar, deren Provider eine integrierte Websuche unterstützt, und Suchaufrufe werden vom Provider wie jede andere Modellnutzung abgerechnet.
Nach der Generierung können Sie Schemas mit Anweisungen in natürlicher Sprache ändern. Geben Sie einen Befehl ein, und die KI wendet die Änderung an, während Ihre bestehende Schemastruktur erhalten bleibt. Jede Bearbeitung erzeugt außerdem 5 Vorschläge für weitere Verbesserungen.
Fügen Sie ein Integer-Feld employee_count hinzuErstellen Sie ein verschachteltes Adressobjekt mit Stadt und LandFranzösische Beschreibungen zu allen Textfeldern hinzufügenEine Referenz auf das Mutterunternehmen mit $defs definierenMarkieren Sie das Website-Feld als nullableKI-Bearbeitungen werden mit einer Teilmenge der Generierungsregeln validiert (Typprüfung, Referenzintegrität, Expertise-Konsistenz), ohne einen Vergleich mit den Eingabedaten, da Sie Felder absichtlich hinzufügen oder entfernen können.
Sowohl die Schemagenerierung als auch die KI-Bearbeitung liefern 5 gezielte Vorschläge, die verschiedene Verbesserungskategorien abdecken:
Vorschläge erscheinen im Workflow Editor als anklickbare Chips – klicken Sie auf einen, um das KI-Bearbeitungsfeld automatisch auszufüllen und anzuwenden.