Page des ID sémantiques — Organisez votre vocabulaire de concepts - Documentation Entity Enricher

La page des ID sémantiques

Chaque enrichissement qui résout un ID sémantique réutilise un concept que votre organisation connaît déjà ou en crée un nouveau. La page ID sémantiques est l'endroit où ce vocabulaire grandissant devient observable : parcourez-le, mesurez la proximité réelle de deux entrées, ajoutez des termes à la main, traquez les quasi-doublons passés sous le seuil, retirez ce dont vous ne voulez plus et transférez l'ensemble vers un autre modèle d'embedding.

Ouvrir la page

Elle se trouve à /semantic-ids dans la barre latérale, et n'est utile que lorsque votre organisation dispose d'un modèle d'embedding et d'au moins un schéma portant un ID sémantique — les concepts sont créés par les enrichissements, pas par la page.

Qui peut faire quoi

  • Éditeur — parcourir, comparer, exporter, vérifier un texte, ajouter un concept, supprimer des concepts.
  • Propriétaire / admin — peuvent aussi créer des concepts via un import, vider des types de concepts entiers et migrer le modèle d'embedding.

Lire le tableau des concepts

Chaque ligne correspond à un concept : son texte canonique (le texte d'identité qui l'a créé), son type de concept (l'espace dans lequel il vit — le nom du type d'entité par défaut), le nombre d'enregistrements qui l'utilisent et sa date de création. Filtrez par texte, par un nombre quelconque de types de concepts ou par usage minimum pour repérer les entrées qui méritent votre attention ; Exporter la vue télécharge exactement ce que les filtres affichent.

La page ID sémantiques : tableau des concepts à gauche, concept sélectionné à droite
Sélectionner une ligne transforme la colonne Similarité en une mesure par rapport à celle-ci, et ouvre ce concept à droite.

La similarité n'est mesurée qu'au sein d'un seul espace. Les vecteurs ne sont comparables qu'à l'intérieur d'un même type de concept et d'un même modèle d'embedding. Les lignes situées hors de l'espace du concept sélectionné affichent , ce qui signifie « non comparable » — jamais « 0 % ».

Ajouter des termes : la boucle de curation

Parfois, vous connaissez le vocabulaire avant l'arrivée des données — une liste de plats, de statuts, de familles de produits. La barre Curation est conçue pour saisir cette liste : limitez-la une fois à un type de concept — la portée est inscrite dans l'adresse de la page, donc /semantic-ids/<type de concept> est un lien direct vers cette sélection — puis répétez saisir une valeur → Vérifier → Ajouter. Entrée vérifie, un second Entrée ajoute, et le champ se vide tout en gardant le focus : un vocabulaire de cinquante termes se saisit en quelques minutes sans toucher la souris.

La barre de curation indiquant qu'une valeur saisie n'a aucune correspondance et peut être ajoutée
Aucun concept ne résout ce texte au-dessus du seuil : Ajouter un concept est donc actif. Le tableau classe désormais tous les concepts selon leur similarité avec ce que vous avez saisi.

Vérifier est un essai à blanc de la véritable échelle de résolution — celle-là même qu'exécute un enrichissement — son verdict n'est donc pas une estimation. Et comme vous avez déjà payé ce verdict, il sert aussi de garde-fou contre les doublons : lorsqu'un concept existant couvre votre texte au seuil ou au-delà, Ajouter un concept reste désactivé.

La barre de curation indiquant qu'une valeur saisie est déjà connue, l'ajout étant désactivé
Une correspondance exacte ne coûte absolument rien — aucun appel au modèle. Une correspondance approchante signale à la place le concept en place et son score.

Ce refus est délibéré : un jumeau situé au-dessus du seuil ne pourrait jamais l'emporter lors d'une résolution, et répartirait les correspondances futures de façon imprévisible entre les deux entrées. Le curseur Seuil placé à côté du champ détermine où se situe cette limite pour vos vérifications — augmentez-le pour être plus strict, abaissez-le pour fusionner plus agressivement.

Le vocabulaire n’est pas non plus obligé de partir d’un enrichissement : Nouveau type de concept… (dans la barre d’outils de la page, rôle éditeur et supérieur) nomme un type et choisit le modèle d’embedding dans lequel vivront ses concepts — par défaut celui de votre organisation. La barre de curation lui est aussitôt limitée, et le type rejoint le vocabulaire avec le premier concept que vous ajoutez ; un type déjà existant conserve son modèle, puisque déplacer un vocabulaire d’un modèle à un autre est précisément le rôle de la migration.

Traquer les doublons sous le seuil

Tout ce qui dépasse le seuil a déjà été fusionné pour vous. Les cas intéressants se situent juste en dessous — assez proches pour être suspects, pas assez pour avoir fusionné. La vue Doublons liste exactement cette bande, et le curseur l'élargit ou la resserre.

La vue des doublons listant les paires de concepts dont la similarité se situe juste sous le seuil
Même plage de similarité, deux verdicts très différents : deux noms pour un même plat de turbot, et deux desserts au chocolat réellement distincts. La page trouve les candidats ; à vous de trancher.

Comparer → revient au tableau avec ce concept sélectionné, pour voir ce qui se trouve à proximité avant de trancher. Une paire que vous jugez réellement en double renseigne sur le seuil de la propriété qui la produit : abaissez-le dans l'éditeur de schéma et les enrichissements suivants fusionneront la paire d'eux-mêmes. Le nombre d'utilisations indique lequel des deux les données privilégient.

Inspecter un concept

Le panneau de droite affiche l’ID du concept (copiable — c’est sur lui que votre base de données effectue ses jointures), son texte normalisé, le modèle d’embedding sous-jacent et les enregistrements qui y ont été résolus. Le concept sélectionné fait partie de l’adresse de la page : l’URL affichée dans votre barre d’adresse est donc un lien direct vers celui-ci — à partager avec un collègue ou à conserver dans un ticket. Deux vues le situent parmi ses voisins.

La vue orbitale : les concepts voisins placés à un rayon égal à leur similarité, le seuil étant tracé sous forme de cercle en pointillés
Orbite — la distance au centre est la similarité, si bien que l'anneau en pointillés est le seuil lui-même : tout ce qui se trouve à l'intérieur se résoudrait vers ce concept.
La carte 3D des concepts : une projection UMAP de l'ensemble de l'espace des concepts, colorée selon la similarité mesurée
Carte des concepts (3D) — une vue optionnelle de l'espace entier. La couleur est la mesure ; la position ne fait que suggérer la forme des grappes, d'où l'absence de sphère de seuil.

Pourquoi la position n’est pas la vérité

Aplatir 1536 dimensions en 3 ne peut pas préserver les distances, et la disposition exagère la compacité des grappes. Les deux vues colorent chaque point selon la même échelle de similarité : lisez donc la couleur, pas l'écart. La première carte d'une session met quelques secondes à se disposer ; les suivantes sont instantanées.

Enregistrements liés

Chaque enregistrement lié affiche le score auquel il s'est résolu ici. Un signifie que l'ID est arrivé dans l'entrée et a été transmis tel quel : rien n'a donc jamais été comparé — la voie gratuite et sans ambiguïté décrite dans le guide des ID sémantiques.

Importer et exporter un vocabulaire

Importer et résoudre traite toute une colonne CSV avec la même cascade et annote chaque ligne avec ce qui lui arriverait — il n'y a aucune limite de taille de fichier ; les gros fichiers sont résolus par lots de 1000 avec progression en direct. Le fichier est analysé dans votre navigateur — seules les valeurs elles-mêmes sont envoyées.

La boîte de dialogue d'import indiquant le résultat ligne par ligne pour un CSV de valeurs : exact, correspondance, serait créé
Une exécution en correspondance seule n'écrit rien : c'est donc un aperçu fidèle de ce que votre prochain enrichissement ferait avec les mêmes valeurs.
RésultatCe que cela signifie
exactLe même texte, normalisé, existe déjà — gratuit, sans appel au modèle.
matchedUne formulation différente s'est résolue vers un concept existant au-dessus du seuil.
would_mintRien n'était assez proche ; un enrichissement créerait ici un nouveau concept.
mintedLe même cas, avec la création activée — le concept existe désormais (propriétaire uniquement).

Les lignes résolues se téléchargent dans leur propre CSV : un import peut donc aussi servir de simple audit — parmi nos 900 noms de fournisseurs, lesquels sont déjà connus, et lesquels ouvriraient une nouvelle identité ? Les exports fonctionnent dans l'autre sens et nomment le fichier d'après les filtres utilisés, si bien qu'un dossier d'exports reste explicite.

Supprimer des concepts

La suppression est sûre comme peu de suppressions de données le sont : le vocabulaire se reconstruit de lui-même, car le prochain enrichissement recrée simplement ce dont il a besoin. Ce qui ne revient pas, c'est la convergence avec les ID que vous avez déjà enregistrés, et la boîte de dialogue vous l'indique avec des chiffres réels avant que vous confirmiez.

La boîte de dialogue de confirmation de suppression indiquant combien d'enregistrements, de schémas et de bases de données synchronisées sont concernés
Les enregistrements conservent l'ID qu'ils portent déjà ; de nouveaux enrichissements de la même chose en généreront un différent. Les bases de données en aval y voient une nouvelle ligne.

Après un tel changement, conserver les anciens concepts est le choix risqué, et non le choix prudent : des identités composées à partir des nouvelles clés peuvent tout de même se retrouver à l'intérieur du seuil des anciens vecteurs et être silencieusement absorbées par eux, vous laissant avec des ID qui ne désignent ni l'un ni l'autre.

Changer le modèle d'embedding

Les vecteurs issus de deux modèles différents ne sont pas comparables : changer de modèle impose de recalculer l’embedding de chaque concept. Une fois les concepts créés, cette migration est le seul moyen autorisé de le faire — et c’est la raison pour laquelle le paramètre de modèle d’embedding de l’organisation refuse de changer de lui-même.

La boîte de dialogue de migration du modèle d'embedding, avec le modèle source, son nombre de concepts et un sélecteur de cible
Un seul espace d'embedding à la fois. Les ID de concepts ne changent jamais : les enregistrements, les entités, les exports et les Database Sync restent donc valides tout du long.

D'abord un essai à blanc

L'aperçu indique ce que coûtera le ré-embedding, et quelles paires de concepts risquent d'entrer en collision — se retrouver à portée du seuil l'une de l'autre dans le nouvel espace et commencer à se résoudre ensemble. Il mesure les candidats réalistes plutôt que toutes les paires, et le précise.

Aucune pause, aucune fenêtre à surveiller

Les enrichissements continuent de se résoudre dans l'ancien espace pendant que les nouveaux vecteurs sont construits à côté ; les concepts créés entre-temps sont repris par une passe ultérieure. La bascule se fait en une seule étape à la fin, qui change aussi le modèle d'embedding par défaut de votre organisation. L'interrompre est sans danger — en relançant, le processus reprend là où il s'était arrêté.

Ce que coûte la page

Les vérifications, ajouts et imports sont facturés comme tout autre usage d'embedding, et les correspondances exactes ne coûtent rien puisqu'elles n'atteignent jamais un modèle. La navigation, la comparaison, l'orbite, la carte 3D, l'export et la suppression sont gratuits. Une journée de dépenses interactives est regroupée en une seule ligne dans votre historique de crédits, afin que le registre reste lisible au lieu de se remplir de fractions de centime.