Página de ID semánticos — Depure su vocabulario de conceptos - Documentación de Entity Enricher

La página de ID semánticos

Cada enriquecimiento que resuelve un ID semántico reutiliza un concepto que su organización ya conoce o crea uno nuevo. La página IDs semánticos es donde ese vocabulario creciente se convierte en algo que puede observar: explórelo, mida cuán próximas están realmente dos entradas, añada términos a mano, busque los casi duplicados que quedaron por debajo del umbral, retire lo que ya no quiera y traslade todo el conjunto a otro modelo de embedding.

Abrir la página

Se encuentra en /semantic-ids en la barra lateral y solo resulta útil cuando su organización dispone de un modelo de embeddings y de al menos un esquema con un ID semántico: los conceptos los crean los enriquecimientos, no la página.

Quién puede hacer qué

  • Editor — explorar, comparar, exportar, comprobar un texto, añadir un concepto, eliminar conceptos.
  • Propietario / administrador — además, puede crear conceptos mediante una importación, vaciar tipos de concepto completos y migrar el modelo de embeddings.

Leer la tabla de conceptos

Cada fila es un concepto: su texto canónico (el texto de identidad que lo creó por primera vez), su tipo de concepto (el espacio en el que reside — por defecto, el nombre del tipo de entidad), cuántos registros lo usan y cuándo se creó. Filtre por texto, por cualquier número de tipos de concepto o por un uso mínimo para encontrar las entradas que merecen su atención; Exportar vista descarga exactamente lo que muestran los filtros.

La página IDs semánticos: la tabla de conceptos a la izquierda, el concepto seleccionado a la derecha
Al seleccionar una fila, la columna Similitud pasa a medir con respecto a ella y ese concepto se abre a la derecha.

La similitud se mide únicamente dentro de un mismo espacio. Los vectores solo son comparables dentro del mismo tipo de concepto y el mismo modelo de embedding. Las filas ajenas al espacio del concepto seleccionado muestran , que significa «no comparable» — nunca «0 %».

Añadir términos: el ciclo de curación

A veces conoce el vocabulario antes de que lleguen los datos: una lista de platos, estados o familias de productos. La barra Curar está pensada para escribir esa lista: acótela a un tipo de concepto una sola vez — el ámbito pasa a la dirección de la página, de modo que /semantic-ids/<tipo de concepto> es un enlace directo a esa parte — y luego repita escriba un valor → Comprobar → Añadir. Enter comprueba y un segundo Enter añade, y el campo se vacía y mantiene el foco, así que un vocabulario de cincuenta términos son unos minutos de escritura sin tocar el ratón.

La barra de depuración indicando que un valor escrito no tiene coincidencias y puede añadirse
Ningún concepto resuelve este texto por encima del umbral, por lo que Añadir concepto queda habilitado. La tabla ordena ahora todos los conceptos según su similitud con lo que ha escrito.

Comprobar es una ejecución en seco de la escalera de resolución real — la misma que ejecuta un enriquecimiento — por lo que su veredicto no es una estimación. Y como ya ha pagado por ese veredicto, sirve además de protección contra duplicados: cuando un concepto existente cubre su texto en el umbral o por encima de él, Añadir concepto permanece desactivado.

La barra de depuración indicando que un valor escrito ya se conoce, con la opción de añadir deshabilitada
Un acierto exacto no cuesta absolutamente nada — ninguna llamada al modelo. Una coincidencia cercana informa, en su lugar, del concepto existente y su puntuación.

Ese rechazo es intencionado: un gemelo por encima del umbral nunca ganaría una resolución y repartiría de forma impredecible las coincidencias futuras entre las dos entradas. El control deslizante Umbral situado junto al campo determina dónde está esa línea en sus comprobaciones: súbalo para ser más estricto o bájelo para fusionar de forma más agresiva.

El vocabulario tampoco tiene por qué partir de un enriquecimiento: Nuevo tipo de concepto… (en la barra de herramientas de la página, del rol editor en adelante) da nombre a un tipo y elige el modelo de embedding en el que residirán sus conceptos — de forma predeterminada, el modelo de su organización. La barra de curación se limita a él de inmediato y el tipo se incorpora al vocabulario con el primer concepto que añada; un tipo que ya existe conserva su modelo, ya que mover un vocabulario entre modelos es justamente la función de la migración.

Buscar duplicados por debajo del umbral

Todo lo que supera el umbral ya se ha fusionado por usted. Los casos interesantes están justo por debajo — lo bastante cerca para resultar sospechosos, no lo bastante para haberse fusionado. La vista Duplicados muestra exactamente esa franja, y el control deslizante la amplía o la reduce.

La vista de duplicados enumerando pares de conceptos cuya similitud queda justo por debajo del umbral
La misma franja, dos veredictos muy distintos: dos nombres para un mismo plato de rodaballo y dos postres de chocolate realmente diferentes. La página encuentra los candidatos; usted decide.

Comparar → vuelve a la tabla con ese concepto seleccionado, para que vea qué más hay cerca antes de decidir. Un par que usted considere un duplicado real es una señal sobre el umbral de la propiedad que lo produce: redúzcalo en el editor de esquemas y los futuros enriquecimientos fusionarán el par por sí solos. Los recuentos de uso le indican cuál de los dos prefieren realmente los datos.

Inspeccionar un concepto

El panel derecho muestra el ID del concepto (copiable — es el valor por el que hace el join su base de datos), su texto normalizado, el modelo de embedding que lo respalda y los registros que se resolvieron a él. El concepto seleccionado forma parte de la dirección de la página, por lo que la URL de la barra de direcciones es un enlace directo a él — se puede compartir con un colega o conservar en un ticket. Dos vistas lo sitúan entre sus vecinos.

La vista de órbita: los conceptos vecinos se sitúan a un radio igual a su similitud, con el umbral dibujado como un círculo discontinuo
Órbita — la distancia al centro es la similitud, de modo que el anillo discontinuo es el propio umbral: todo lo que quede dentro se resolvería a este concepto.
El mapa de conceptos en 3D: una disposición UMAP de todo el espacio de conceptos, coloreada según la similitud medida
Mapa de conceptos (3D) — una disposición opcional de todo el espacio. El color es la medida; la posición solo sugiere la forma de los grupos, y por eso no se dibuja ninguna esfera de umbral.

Por qué la posición no es la verdad

Aplanar 1536 dimensiones en 3 no puede preservar las distancias, y la disposición exagera lo compactos que son los grupos. Ambas vistas pintan cada punto con la misma escala de similitud, así que fíjese en el color, no en la separación. El primer mapa de una sesión tarda unos segundos en componerse; los siguientes son instantáneos.

Registros vinculados

Cada registro vinculado muestra la puntuación con la que se resolvió aquí. Un significa que el ID llegó en la entrada y se transmitió tal cual, por lo que nunca se comparó nada — la vía gratuita e inequívoca descrita en la guía de IDs semánticos.

Importar y exportar un vocabulario

Importar y resolver ejecuta toda una columna del CSV a través de la misma cadena y anota en cada fila lo que ocurriría con ella — no hay límite de tamaño de archivo; los archivos grandes se resuelven en lotes de 1000 con progreso en vivo. El archivo se analiza en su navegador — solo se envían los valores.

El diálogo de importación mostrando el resultado por fila de un CSV de valores: exacto, coincidente, se crearía
Una ejecución de solo coincidencia no escribe nada, por lo que es una vista previa fiel de lo que haría su próximo enriquecimiento con los mismos valores.
ResultadoQué significa
exactEl mismo texto, normalizado, ya existe: gratis, sin llamada al modelo.
matchedUna redacción distinta se resolvió a un concepto existente por encima del umbral.
would_mintNada estaba lo bastante cerca; aquí un enriquecimiento crearía un concepto nuevo.
mintedEl mismo caso, con la creación activada: el concepto ya existe (solo el propietario).

Las filas resueltas se descargan en su propio CSV, por lo que una importación también puede usarse únicamente como auditoría: ¿cuáles de nuestros 900 nombres de proveedor ya se conocen y cuáles abrirían una identidad nueva? Las exportaciones funcionan al revés y nombran el archivo según los filtros con los que se generaron, así que una carpeta llena de ellas se explica por sí sola.

Eliminar conceptos

Eliminar aquí es seguro de un modo en que no lo son la mayoría de las eliminaciones de datos: el vocabulario se reconstruye solo, porque el siguiente enriquecimiento vuelve a crear lo que necesita. Lo que no vuelve es la convergencia con los IDs que ya guardó, y el diálogo se lo indica con cifras reales antes de que confirme.

El diálogo de confirmación de eliminación mostrando cuántos registros, esquemas y bases de datos sincronizadas se ven afectados
Los registros conservan el ID que ya tienen; los nuevos enriquecimientos de lo mismo generarán uno distinto. Las bases de datos posteriores lo verán como una fila nueva.

Tras un cambio así, conservar los conceptos antiguos es la opción arriesgada, no la prudente: las identidades compuestas con las nuevas claves aún pueden caer dentro del umbral de los vectores antiguos y ser absorbidas por ellos sin aviso, dejándole IDs que no significan ni una cosa ni la otra.

Cambiar el modelo de embedding

Los vectores de dos modelos distintos no son comparables, por lo que cambiar de modelo implica volver a generar los embeddings de todos los conceptos. Una vez que existen conceptos, esta migración es la única forma autorizada de hacerlo, y es el motivo por el que la configuración del modelo de embeddings de la organización no se modifica por sí sola.

El diálogo de migración de modelo de embeddings mostrando el modelo de origen, su número de conceptos y un selector de destino
Un espacio de embeddings cada vez. Los ID de concepto nunca cambian, por lo que los registros, las entidades, las exportaciones y las sincronizaciones de base de datos siguen siendo válidos en todo momento.

Primero, una ejecución en seco

La vista previa indica cuánto costará volver a generar los embeddings y qué pares de conceptos es probable que colisionen: queden dentro del umbral el uno del otro en el nuevo espacio y empiecen a resolverse juntos. Mide los candidatos realistas en lugar de todos los pares, y así lo indica.

Sin pausas ni ventanas que vigilar

Los enriquecimientos siguen resolviéndose en el espacio antiguo mientras los nuevos vectores se construyen junto a él; los conceptos creados entretanto se recogen en una pasada posterior. El cambio se produce en un único paso al final, que también sustituye el modelo de embedding predeterminado de su organización. Interrumpirlo es inofensivo — al empezar de nuevo, se continúa donde se detuvo.

Cuánto cuesta esta página

Las comprobaciones, las adiciones y las importaciones se facturan como cualquier otro uso de embeddings, y los aciertos exactos no cuestan nada porque nunca llegan a un modelo. Explorar, comparar, la órbita, el mapa 3D, exportar y eliminar son gratuitos. El gasto interactivo de un día se agrupa en una sola línea de su historial de créditos, de modo que el registro sigue siendo legible en lugar de llenarse de fracciones de céntimo.