Jede Anreicherung, die eine semantische ID auflöst, verwendet entweder ein Konzept wieder, das Ihre Organisation bereits kennt, oder legt ein neues an. Auf der Seite Semantische IDs wird dieses wachsende Vokabular sichtbar: Sie können darin blättern, messen, wie nah zwei Einträge sich wirklich sind, Begriffe von Hand hinzufügen, die Fragen beantworten, die der Identitätsprüfer Ihnen überlässt, Nicht-mehr-Benötigtes ausmustern und das Ganze auf ein anderes Embedding-Modell umziehen.
Sie finden sie in der Seitenleiste unter /semantic-ids, und sie ist erst dann nützlich, wenn Ihre Organisation über ein Embedding-Modell und mindestens ein Schema mit einer semantischen ID verfügt — Konzepte werden durch Anreicherungen erzeugt, nicht durch die Seite.
Jede Zeile steht für ein Konzept: sein kanonischer Text (der Identitätstext, durch den es ursprünglich entstanden ist), sein Konzepttyp (der Raum, in dem es existiert — standardmäßig der Name des Entitätstyps), wie viele Datensätze es verwenden und wann es erstellt wurde. Filtern Sie nach Text, nach beliebig vielen Konzepttypen, nach den Schemas, die in sie schreiben, oder nach einer Mindestnutzung, um die Einträge zu finden, die Ihre Aufmerksamkeit verdienen. Die Auswahl von Schemas ist eine Abkürzung für deren Konzepttypen — und da ein Typ gemeinsam genutzt wird, werden dabei auch die Konzepte angezeigt, die ein anderes Schema in demselben Typ erstellt hat. Ansicht exportieren lädt genau das herunter, was die Filter gerade anzeigen.
Ähnlichkeit wird nur innerhalb eines Raums gemessen. Vektoren sind nur innerhalb desselben Konzepttyps und Embedding-Modells vergleichbar. Zeilen außerhalb des Raums des ausgewählten Konzepts zeigen —, was „nicht vergleichbar“ bedeutet — niemals „0 %“.
Manchmal kennen Sie das Vokabular schon, bevor die Daten eintreffen – eine Liste von Gerichten, Status oder Produktfamilien. Die Leiste Kuratieren ist genau dafür gemacht, eine solche Liste einzutippen: Legen Sie den Bereich einmal auf einen Konzepttyp fest – der Bereich wandert in die Seitenadresse, sodass /semantic-ids/<concept type> ein direkter Link zu genau diesem Ausschnitt ist – und wiederholen Sie dann Wert eintippen → Prüfen → Hinzufügen. Enter prüft, ein zweites Enter fügt hinzu, und das Feld leert sich und behält den Fokus – ein Vokabular mit fünfzig Begriffen ist so in wenigen Minuten getippt, ganz ohne Maus.
Die Prüfung ist ein Testlauf der echten Auflösungskette — derselben, die auch eine Anreicherung durchläuft — ihr Urteil ist also keine Schätzung. Und da Sie für dieses Urteil bereits bezahlt haben, dient es zugleich als Duplikatsperre: Wenn ein vorhandenes Konzept Ihren Text auf oder über dem Schwellenwert abdeckt, bleibt Konzept hinzufügen deaktiviert.
Diese Ablehnung ist Absicht: Ein Zwilling oberhalb des Schwellenwerts könnte eine Auflösung nie gewinnen und würde künftige Treffer unvorhersehbar auf die beiden Einträge verteilen. Der Schieberegler Schwellenwert neben dem Feld legt fest, wo diese Grenze für Ihre Prüfungen liegt — höher für strengere Prüfungen, niedriger, um aggressiver zusammenzuführen.
Das Vokabular muss auch nicht bei einer Anreicherung beginnen: Mit Neuer Konzepttyp… (in der Symbolleiste der Seite, ab Editor aufwärts) benennen Sie einen Typ und wählen das Embedding-Modell, in dem seine Konzepte liegen werden — standardmäßig das Modell Ihrer Organisation. Die Kuratierungsleiste ist sofort darauf eingegrenzt, und der Typ wird mit dem ersten Konzept, das Sie hinzufügen, Teil des Vokabulars; ein bereits vorhandener Typ behält sein Modell, denn für das Verschieben eines Vokabulars zwischen Modellen ist die Migration da.
Nichts landet in Prüfung, nur weil es ähnlich aussieht. Jedes Paar hier ist etwas, das der Identitätsprüfer entschieden und Ihnen überlassen hat: Er konnte es nicht sagen (Unsicher), er fand zwei Ihrer Konzepte gleichwertig zu einem eingehenden Text (Sieht doppelt aus), oder er hat zwei getrennt, die fast identisch messen (Getrennt gehalten) — Letzteres wird Ihnen vorgelegt, damit Sie bestätigen können, dass er den naheliegenden Kandidaten nicht übersehen hat. Jede Zeile enthält den eigenen Satz des Prüfers, der erklärt, was den Ausschlag gab.
Vergleichen → springt mit ausgewähltem Konzept zurück zur Tabelle, sodass Sie vor der Entscheidung sehen, was sonst noch in der Nähe liegt. Zusammenführen… überführt das eine in das andere — die Schreibweisen des unterlegenen Konzepts werden zu Aliassen des verbleibenden, sodass das Paar überall zusammenläuft und zusammen bleibt. Verwerfen schließt die Frage, wenn es sich wirklich um zwei verschiedene Dinge handelt. Die Nutzungszahlen zeigen, welches der beiden die Daten tatsächlich bevorzugen.
Im rechten Bereich sehen Sie die ID des Konzepts (kopierbar — darüber verknüpft Ihre Datenbank), seinen normalisierten Text, das dahinterliegende Embedding-Modell sowie die Datensätze, die darauf aufgelöst wurden. Das ausgewählte Konzept ist Teil der Seitenadresse: Die URL in Ihrer Adressleiste führt also direkt dorthin zurück — teilbar mit Kolleginnen und Kollegen oder gut in einem Ticket aufgehoben. Zwei Ansichten zeigen es im Kontext seiner Nachbarn.
Werden 1536 Dimensionen auf 3 zusammengedrückt, können die Abstände nicht erhalten bleiben, und die Darstellung übertreibt, wie dicht die Cluster sind. Beide Ansichten färben jeden Punkt nach derselben Ähnlichkeitsskala — lesen Sie also die Farbe, nicht den Abstand. Die erste Karte einer Sitzung braucht einige Sekunden für den Aufbau, alle weiteren erscheinen sofort.
Jeder verknüpfte Datensatz zeigt den Wert, mit dem er hier aufgelöst wurde. Ein — bedeutet, dass die ID bereits in der Eingabe vorlag und durchgereicht wurde, es also nie einen Vergleich gab — der kostenlose, eindeutige Weg, der im Leitfaden zu semantischen IDs beschrieben ist.
Importieren & auflösen führt eine ganze CSV-Spalte durch dieselbe Kaskade und vermerkt bei jeder Zeile, was mit ihr geschehen würde – es gibt keine Beschränkung der Dateigröße; große Dateien werden in Batches zu je 1000 aufgelöst, mit Live-Fortschritt. Die Datei wird in Ihrem Browser geparst – gesendet werden nur die Werte selbst.
| Ergebnis | Was das bedeutet |
|---|---|
exact | Derselbe Text existiert normalisiert bereits — kostenlos, ohne Modellaufruf. |
matched | Eine andere Formulierung wurde oberhalb des Schwellenwerts auf ein vorhandenes Konzept aufgelöst. |
would_mint | Nichts war nah genug; eine Anreicherung würde hier ein neues Konzept anlegen. |
minted | Derselbe Fall mit aktivierter Erstellung — das Konzept existiert nun (nur für Eigentümer). |
Der Konzepttyp wird eingetippt, nicht ausgewählt. Eine Datei ist ein völlig normaler Weg, ein Vokabular zu beginnen: Das Feld schlägt daher die bereits vorhandenen Räume vor, akzeptiert aber auch einen Namen, den es noch nicht gibt – und zeigtneu an, wenn es sich um einen solchen handelt. Ein neuer Name wirft die eine Frage auf, die sich später nicht mehr stellen lässt: in welchem Embedding-Modell seine Konzepte leben werden. Beantworten Sie sie hier, und der Raum wird mit dem ersten Wert erstellt, den der Import anlegt; danach ist der Wechsel eines Vokabulars zwischen Modellen eine Migration.
Zwei Dinge verhindern, dass aus einem Versehen ein zweites Vokabular wird: Tippen Sie den Namen eines bereits vorhandenen Raums, wird dieser ausgewählt – unabhängig von der Groß- und Kleinschreibung –, und ein Name, der nur ein bis zwei Buchstaben von einem bestehenden abweicht, wird mit einer Ein-Klick-Korrektur angezeigt. Bei einem wirklich neuen Raum gibt es nichts zum Vergleichen: Ein reiner Abgleichlauf meldet daher „jeder Wert würde erstellt“, ohne eine einzige Zeile einzubetten – und kostet nichts.
Die aufgelösten Zeilen lassen sich als eigene CSV-Datei herunterladen, sodass ein Import auch rein als Prüfung dienen kann: Welche unserer 900 Lieferantennamen sind bereits bekannt, und welche würden eine neue Identität eröffnen? Exporte funktionieren umgekehrt und benennen die Datei nach den verwendeten Filtern, sodass ein ganzer Ordner davon selbsterklärend bleibt.
Löschen ist hier auf eine Weise sicher, wie es die meisten Datenlöschungen nicht sind: Das Vokabular baut sich selbst wieder auf, denn die nächste Anreicherung erzeugt einfach neu, was sie braucht. Was nicht zurückkehrt, ist die Konvergenz mit den bereits gespeicherten IDs — und der Dialog sagt Ihnen das mit konkreten Zahlen, bevor Sie bestätigen.
Nach einer solchen Änderung ist es die riskante Wahl, die alten Konzepte zu behalten, nicht die vorsichtige: Identitäten, die aus den neuen Schlüsseln gebildet werden, können weiterhin innerhalb des Schwellenwerts der alten Vektoren landen und still von ihnen aufgesogen werden — zurück bleiben IDs, die weder das eine noch das andere bedeuten.
Vektoren aus zwei verschiedenen Modellen sind nicht vergleichbar – ein Modellwechsel bedeutet daher, dass jedes Konzept neu eingebettet werden muss. Sobald Konzepte vorhanden sind, ist diese Migration der einzige zulässige Weg dafür — und genau deshalb ändert sich die Embedding-Modell-Einstellung der Organisation nicht von selbst.
Die Vorschau meldet, was die Neuberechnung der Embeddings kostet und welche Konzeptpaare voraussichtlich kollidieren — also im neuen Raum innerhalb des Schwellenwerts zueinander landen und fortan gemeinsam aufgelöst werden. Sie misst die realistischen Kandidaten statt jedes einzelne Paar und weist darauf hin.
Anreicherungen werden weiterhin im alten Raum aufgelöst, während daneben die neuen Vektoren aufgebaut werden; zwischenzeitlich erzeugte Konzepte erfasst ein späterer Durchlauf. Die Umstellung erfolgt am Ende in einem einzigen Schritt, der zugleich das Standard-Embedding-Modell Ihrer Organisation umschaltet. Ein Abbruch ist unbedenklich — ein erneuter Start setzt dort fort, wo er aufgehört hat.
Prüfungen, Hinzufügungen und Importe werden wie jede andere Embedding-Nutzung abgerechnet, und exakte Treffer kosten nichts, weil sie nie ein Modell erreichen. Durchsuchen, Vergleichen, der Orbit, die 3D-Karte, Exportieren und Löschen sind kostenlos. Die interaktiven Ausgaben eines Tages werden zu einer einzigen Zeile in Ihrer Credit-Historie zusammengefasst, damit das Journal lesbar bleibt, statt sich mit Bruchteilen von Cents zu füllen.