La página de ID semánticos

Cada enriquecimiento que resuelve un ID semántico reutiliza un concepto que su organización ya conoce o crea uno nuevo. La página IDs semánticos es donde ese vocabulario creciente se convierte en algo que puede consultar: explórelo, mida cuán cerca están realmente dos entradas, añada términos a mano, responda a las preguntas que le deja el juez de identidad, retire lo que ya no quiera y migre todo el conjunto a otro modelo de embeddings.

Abrir la página

Se encuentra en /semantic-ids en la barra lateral y solo resulta útil cuando su organización dispone de un modelo de embeddings y de al menos un esquema con un ID semántico: los conceptos los crean los enriquecimientos, no la página.

Quién puede hacer qué

  • •Editor — explorar, comparar, exportar, comprobar un texto, añadir un concepto, eliminar conceptos.
  • •Propietario / administrador: además, puede crear conceptos mediante una importación (abriendo con ellos un tipo de concepto nuevo, si eso es lo que el archivo necesita), vaciar tipos de concepto completos y migrar el modelo de embeddings.

Leer la tabla de conceptos

Cada fila es un concepto: su texto canónico (el texto de identidad que lo creó por primera vez), su tipo de concepto (el espacio en el que reside — de forma predeterminada, el nombre del tipo de entidad), cuántos registros lo usan y cuándo se creó. Filtre por texto, por cualquier número de tipos de concepto, por los esquemas que escriben en ellos o por un uso mínimo para encontrar las entradas que merecen su atención. Seleccionar esquemas es un atajo para sus tipos de concepto y, dado que un tipo es compartido, también muestra los conceptos que otro esquema creó en ese mismo tipo. Exportar vista descarga exactamente lo que muestran los filtros.

  1. 1Número de alias en la fila canónica
  2. 2Una grafía absorbida por el juez de identidad
El chip +1 es el número de alias: un concepto, varias grafías, un único total de uso. Una forma que el juez ha absorbido lleva auto — al juez se le paga una sola vez por cada forma de superficie, para siempre.
Al seleccionar una fila, la columna Similitud pasa a medir con respecto a ella y ese concepto se abre a la derecha.

La similitud se mide únicamente dentro de un mismo espacio. Los vectores solo son comparables dentro del mismo tipo de concepto y el mismo modelo de embedding. Las filas ajenas al espacio del concepto seleccionado muestran —, que significa «no comparable» — nunca «0 %».

Añadir términos: el ciclo de curación

A veces conoce el vocabulario antes de que lleguen los datos: una lista de platos, estados o familias de productos. La barra Curar está pensada para escribir esa lista: acótela a un tipo de concepto una sola vez — el ámbito pasa a la dirección de la página, de modo que /semantic-ids/<tipo de concepto> es un enlace directo a esa parte — y luego repita escriba un valor → Comprobar → Añadir. Enter comprueba y un segundo Enter añade, y el campo se vacía y mantiene el foco, así que un vocabulario de cincuenta términos son unos minutos de escritura sin tocar el ratón.

Ningún concepto resuelve este texto por encima del umbral, por lo que Añadir concepto queda habilitado. La tabla ordena ahora todos los conceptos según su similitud con lo que ha escrito.

Comprobar es una ejecución en seco de la escalera de resolución real — la misma que ejecuta un enriquecimiento — por lo que su veredicto no es una estimación. Y como ya ha pagado por ese veredicto, sirve además de protección contra duplicados: cuando un concepto existente cubre su texto en el umbral o por encima de él, Añadir concepto permanece desactivado.

Un acierto exacto no cuesta absolutamente nada — ninguna llamada al modelo. Una coincidencia cercana informa, en su lugar, del concepto existente y su puntuación.

Ese rechazo es intencionado: un gemelo por encima del umbral nunca ganaría una resolución y repartiría de forma impredecible las coincidencias futuras entre las dos entradas. El control deslizante Umbral situado junto al campo determina dónde está esa línea en sus comprobaciones: súbalo para ser más estricto o bájelo para fusionar de forma más agresiva.

El vocabulario tampoco tiene por qué partir de un enriquecimiento: Nuevo tipo de concepto… (en la barra de herramientas de la página, del rol editor en adelante) da nombre a un tipo y elige el modelo de embedding en el que residirán sus conceptos — de forma predeterminada, el modelo de su organización. La barra de curación se limita a él de inmediato y el tipo se incorpora al vocabulario con el primer concepto que añada; un tipo que ya existe conserva su modelo, ya que mover un vocabulario entre modelos es justamente la función de la migración.

El modelo de embedding es la única pregunta que no puede plantearse más tarde: un tipo conserva el modelo con el que se creó, y cambiarlo es una migración.

La cola de revisión

Nada llega a Revisión por el mero hecho de parecerse. Cada par que ve aquí es algo que el juez de identidad decidió y le dejó a usted: no pudo determinarlo (Dudoso), encontró dos conceptos suyos equivalentes a un mismo texto entrante (Parece duplicado) o separó dos que miden casi idéntico (Separados); este último caso se le ofrece para que confirme que no pasó por alto el candidato obvio. Cada fila incluye la frase del propio juez explicando qué lo decidió.

Dos veredictos muy distintos, uno junto al otro: dos nombres para un mismo plato de rodaballo y dos postres de chocolate realmente diferentes. El juez encuentra las preguntas; usted las responde.

Comparar → vuelve a la tabla con ese concepto seleccionado, para que vea qué más hay cerca antes de decidir. Fusionar… integra uno en el otro: las grafías del perdedor pasan a ser alias del ganador, de modo que el par converge en todas partes y sigue convergiendo. Descartar cierra la cuestión cuando realmente son dos cosas distintas. Los recuentos de uso le indican cuál de los dos prefieren realmente los datos.

El impacto se cuantifica antes de que confirme: los registros redirigidos y los cambios en la base de datos que la fusión pone en cola aguas abajo.

Inspeccionar un concepto

El panel derecho muestra el ID del concepto (copiable — es el valor por el que hace el join su base de datos), su texto normalizado, el modelo de embedding que lo respalda y los registros que se resolvieron a él. El concepto seleccionado forma parte de la dirección de la página, por lo que la URL de la barra de direcciones es un enlace directo a él — se puede compartir con un colega o conservar en un ticket. Dos vistas lo sitúan entre sus vecinos.

Órbita — la distancia al centro es la similitud, de modo que el anillo discontinuo es el propio umbral: todo lo que quede dentro se resolvería a este concepto.
Mapa de conceptos (3D) — una disposición opcional de todo el espacio. El color es la medida; la posición solo sugiere la forma de los grupos, y por eso no se dibuja ninguna esfera de umbral.

Por qué la posición no es la verdad

Aplanar 1536 dimensiones en 3 no puede preservar las distancias, y la disposición exagera lo compactos que son los grupos. Ambas vistas pintan cada punto con la misma escala de similitud, así que fíjese en el color, no en la separación. El primer mapa de una sesión tarda unos segundos en componerse; los siguientes son instantáneos.

Registros vinculados

Cada registro vinculado muestra la puntuación con la que se resolvió aquí. Un — significa que el ID llegó en la entrada y se transmitió tal cual, por lo que nunca se comparó nada — la vía gratuita e inequívoca descrita en la guía de IDs semánticos.

Importar y exportar un vocabulario

Importar y resolver ejecuta toda una columna del CSV a través de la misma cadena y anota en cada fila lo que ocurriría con ella — no hay límite de tamaño de archivo; los archivos grandes se resuelven en lotes de 1000 con progreso en vivo. El archivo se analiza en su navegador — solo se envían los valores.

Una ejecución de solo coincidencia no escribe nada, por lo que es una vista previa fiel de lo que haría su próximo enriquecimiento con los mismos valores.
ResultadoQué significa
exactEl mismo texto, normalizado, ya existe: gratis, sin llamada al modelo.
matchedUna redacción distinta se resolvió a un concepto existente por encima del umbral.
would_mintNada estaba lo bastante cerca; aquí un enriquecimiento crearía un concepto nuevo.
mintedEl mismo caso, con la creación activada: el concepto ya existe (solo el propietario).

El tipo de concepto se escribe, no se elige. Un archivo es una forma perfectamente normal de iniciar un vocabulario, así que el campo sugiere los espacios que ya tiene y a la vez acepta un nombre que no tiene, e indicanuevo cuando así es. Un nombre nuevo plantea la única pregunta que no puede hacerse más tarde: en qué modelo de embeddings vivirán sus conceptos. Respóndala aquí y el espacio se creará con el primer valor que acuñe la importación; después, mover un vocabulario de un modelo a otro es una migración.

Dos cosas evitan que un desliz se convierta en un segundo vocabulario: escribir el nombre de un espacio que ya tiene lo selecciona, sea cual sea el uso de mayúsculas, y un nombre que esté a una o dos letras de uno existente se señala con una corrección en un clic. Frente a un espacio realmente nuevo no hay nada con lo que comparar, así que una ejecución de solo coincidencia responde “se crearían todos los valores” sin generar embeddings de una sola fila, y no cobra nada por ello.

Las filas resueltas se descargan en su propio CSV, por lo que una importación también puede usarse únicamente como auditoría: ¿cuáles de nuestros 900 nombres de proveedor ya se conocen y cuáles abrirían una identidad nueva? Las exportaciones funcionan al revés y nombran el archivo según los filtros con los que se generaron, así que una carpeta llena de ellas se explica por sí sola.

Eliminar conceptos

Eliminar aquí es seguro de un modo en que no lo son la mayoría de las eliminaciones de datos: el vocabulario se reconstruye solo, porque el siguiente enriquecimiento vuelve a crear lo que necesita. Lo que no vuelve es la convergencia con los IDs que ya guardó, y el diálogo se lo indica con cifras reales antes de que confirme.

Cada tipo designa el espacio de embeddings en el que vive — dos tipos sobre modelos distintos nunca se comparan, por eso el recuento se desglosa así.
Los registros conservan el ID que ya tienen; los nuevos enriquecimientos de lo mismo generarán uno distinto. Las bases de datos posteriores lo verán como una fila nueva.

Tras un cambio así, conservar los conceptos antiguos es la opción arriesgada, no la prudente: las identidades compuestas con las nuevas claves aún pueden caer dentro del umbral de los vectores antiguos y ser absorbidas por ellos sin aviso, dejándole IDs que no significan ni una cosa ni la otra.

Cambiar el modelo de embedding

Los vectores de dos modelos distintos no son comparables, por lo que cambiar de modelo implica volver a generar los embeddings de todos los conceptos. Una vez que existen conceptos, esta migración es la única forma autorizada de hacerlo, y es el motivo por el que la configuración del modelo de embeddings de la organización no se modifica por sí sola.

Un espacio de embeddings cada vez. Los ID de concepto nunca cambian, por lo que los registros, las entidades, las exportaciones y las sincronizaciones de base de datos siguen siendo válidos en todo momento.

Primero, una ejecución en seco

La vista previa indica cuánto costará volver a generar los embeddings y qué pares de conceptos es probable que colisionen: queden dentro del umbral el uno del otro en el nuevo espacio y empiecen a resolverse juntos. Mide los candidatos realistas en lugar de todos los pares, y así lo indica.

Sin pausas ni ventanas que vigilar

Los enriquecimientos siguen resolviéndose en el espacio antiguo mientras los nuevos vectores se construyen junto a él; los conceptos creados entretanto se recogen en una pasada posterior. El cambio se produce en un único paso al final, que también sustituye el modelo de embedding predeterminado de su organización. Interrumpirlo es inofensivo — al empezar de nuevo, se continúa donde se detuvo.

Cuánto cuesta esta página

Las comprobaciones, las adiciones y las importaciones se facturan como cualquier otro uso de embeddings, y los aciertos exactos no cuestan nada porque nunca llegan a un modelo. Explorar, comparar, la órbita, el mapa 3D, exportar y eliminar son gratuitos. El gasto interactivo de un día se agrupa en una sola línea de su historial de créditos, de modo que el registro sigue siendo legible en lugar de llenarse de fracciones de céntimo.