Cada enriquecimiento que resuelve un ID semántico reutiliza un concepto que su organización ya conoce o crea uno nuevo. La página IDs semánticos es donde ese vocabulario creciente se convierte en algo que puede consultar: explórelo, mida cuán cerca están realmente dos entradas, añada términos a mano, responda a las preguntas que le deja el juez de identidad, retire lo que ya no quiera y migre todo el conjunto a otro modelo de embeddings.
Se encuentra en /semantic-ids en la barra lateral y solo resulta útil cuando su organización dispone de un modelo de embeddings y de al menos un esquema con un ID semántico: los conceptos los crean los enriquecimientos, no la página.
Cada fila es un concepto: su texto canónico (el texto de identidad que lo creó por primera vez), su tipo de concepto (el espacio en el que reside — de forma predeterminada, el nombre del tipo de entidad), cuántos registros lo usan y cuándo se creó. Filtre por texto, por cualquier número de tipos de concepto, por los esquemas que escriben en ellos o por un uso mínimo para encontrar las entradas que merecen su atención. Seleccionar esquemas es un atajo para sus tipos de concepto y, dado que un tipo es compartido, también muestra los conceptos que otro esquema creó en ese mismo tipo. Exportar vista descarga exactamente lo que muestran los filtros.
La similitud se mide únicamente dentro de un mismo espacio. Los vectores solo son comparables dentro del mismo tipo de concepto y el mismo modelo de embedding. Las filas ajenas al espacio del concepto seleccionado muestran —, que significa «no comparable» — nunca «0 %».
A veces conoce el vocabulario antes de que lleguen los datos: una lista de platos, estados o familias de productos. La barra Curar está pensada para escribir esa lista: acótela a un tipo de concepto una sola vez — el ámbito pasa a la dirección de la página, de modo que /semantic-ids/<tipo de concepto> es un enlace directo a esa parte — y luego repita escriba un valor → Comprobar → Añadir. Enter comprueba y un segundo Enter añade, y el campo se vacía y mantiene el foco, así que un vocabulario de cincuenta términos son unos minutos de escritura sin tocar el ratón.
Comprobar es una ejecución en seco de la escalera de resolución real — la misma que ejecuta un enriquecimiento — por lo que su veredicto no es una estimación. Y como ya ha pagado por ese veredicto, sirve además de protección contra duplicados: cuando un concepto existente cubre su texto en el umbral o por encima de él, Añadir concepto permanece desactivado.
Ese rechazo es intencionado: un gemelo por encima del umbral nunca ganaría una resolución y repartiría de forma impredecible las coincidencias futuras entre las dos entradas. El control deslizante Umbral situado junto al campo determina dónde está esa línea en sus comprobaciones: súbalo para ser más estricto o bájelo para fusionar de forma más agresiva.
El vocabulario tampoco tiene por qué partir de un enriquecimiento: Nuevo tipo de concepto… (en la barra de herramientas de la página, del rol editor en adelante) da nombre a un tipo y elige el modelo de embedding en el que residirán sus conceptos — de forma predeterminada, el modelo de su organización. La barra de curación se limita a él de inmediato y el tipo se incorpora al vocabulario con el primer concepto que añada; un tipo que ya existe conserva su modelo, ya que mover un vocabulario entre modelos es justamente la función de la migración.
Nada llega a Revisión por el mero hecho de parecerse. Cada par que ve aquí es algo que el juez de identidad decidió y le dejó a usted: no pudo determinarlo (Dudoso), encontró dos conceptos suyos equivalentes a un mismo texto entrante (Parece duplicado) o separó dos que miden casi idéntico (Separados); este último caso se le ofrece para que confirme que no pasó por alto el candidato obvio. Cada fila incluye la frase del propio juez explicando qué lo decidió.
Comparar → vuelve a la tabla con ese concepto seleccionado, para que vea qué más hay cerca antes de decidir. Fusionar… integra uno en el otro: las grafías del perdedor pasan a ser alias del ganador, de modo que el par converge en todas partes y sigue convergiendo. Descartar cierra la cuestión cuando realmente son dos cosas distintas. Los recuentos de uso le indican cuál de los dos prefieren realmente los datos.
El panel derecho muestra el ID del concepto (copiable — es el valor por el que hace el join su base de datos), su texto normalizado, el modelo de embedding que lo respalda y los registros que se resolvieron a él. El concepto seleccionado forma parte de la dirección de la página, por lo que la URL de la barra de direcciones es un enlace directo a él — se puede compartir con un colega o conservar en un ticket. Dos vistas lo sitúan entre sus vecinos.
Aplanar 1536 dimensiones en 3 no puede preservar las distancias, y la disposición exagera lo compactos que son los grupos. Ambas vistas pintan cada punto con la misma escala de similitud, así que fíjese en el color, no en la separación. El primer mapa de una sesión tarda unos segundos en componerse; los siguientes son instantáneos.
Cada registro vinculado muestra la puntuación con la que se resolvió aquí. Un — significa que el ID llegó en la entrada y se transmitió tal cual, por lo que nunca se comparó nada — la vía gratuita e inequívoca descrita en la guía de IDs semánticos.
Importar y resolver ejecuta toda una columna del CSV a través de la misma cadena y anota en cada fila lo que ocurriría con ella — no hay límite de tamaño de archivo; los archivos grandes se resuelven en lotes de 1000 con progreso en vivo. El archivo se analiza en su navegador — solo se envían los valores.
| Resultado | Qué significa |
|---|---|
exact | El mismo texto, normalizado, ya existe: gratis, sin llamada al modelo. |
matched | Una redacción distinta se resolvió a un concepto existente por encima del umbral. |
would_mint | Nada estaba lo bastante cerca; aquí un enriquecimiento crearía un concepto nuevo. |
minted | El mismo caso, con la creación activada: el concepto ya existe (solo el propietario). |
El tipo de concepto se escribe, no se elige. Un archivo es una forma perfectamente normal de iniciar un vocabulario, así que el campo sugiere los espacios que ya tiene y a la vez acepta un nombre que no tiene, e indicanuevo cuando así es. Un nombre nuevo plantea la única pregunta que no puede hacerse más tarde: en qué modelo de embeddings vivirán sus conceptos. Respóndala aquí y el espacio se creará con el primer valor que acuñe la importación; después, mover un vocabulario de un modelo a otro es una migración.
Dos cosas evitan que un desliz se convierta en un segundo vocabulario: escribir el nombre de un espacio que ya tiene lo selecciona, sea cual sea el uso de mayúsculas, y un nombre que esté a una o dos letras de uno existente se señala con una corrección en un clic. Frente a un espacio realmente nuevo no hay nada con lo que comparar, así que una ejecución de solo coincidencia responde “se crearían todos los valores” sin generar embeddings de una sola fila, y no cobra nada por ello.
Las filas resueltas se descargan en su propio CSV, por lo que una importación también puede usarse únicamente como auditoría: ¿cuáles de nuestros 900 nombres de proveedor ya se conocen y cuáles abrirían una identidad nueva? Las exportaciones funcionan al revés y nombran el archivo según los filtros con los que se generaron, así que una carpeta llena de ellas se explica por sí sola.
Eliminar aquí es seguro de un modo en que no lo son la mayoría de las eliminaciones de datos: el vocabulario se reconstruye solo, porque el siguiente enriquecimiento vuelve a crear lo que necesita. Lo que no vuelve es la convergencia con los IDs que ya guardó, y el diálogo se lo indica con cifras reales antes de que confirme.
Tras un cambio así, conservar los conceptos antiguos es la opción arriesgada, no la prudente: las identidades compuestas con las nuevas claves aún pueden caer dentro del umbral de los vectores antiguos y ser absorbidas por ellos sin aviso, dejándole IDs que no significan ni una cosa ni la otra.
Los vectores de dos modelos distintos no son comparables, por lo que cambiar de modelo implica volver a generar los embeddings de todos los conceptos. Una vez que existen conceptos, esta migración es la única forma autorizada de hacerlo, y es el motivo por el que la configuración del modelo de embeddings de la organización no se modifica por sí sola.
La vista previa indica cuánto costará volver a generar los embeddings y qué pares de conceptos es probable que colisionen: queden dentro del umbral el uno del otro en el nuevo espacio y empiecen a resolverse juntos. Mide los candidatos realistas en lugar de todos los pares, y así lo indica.
Los enriquecimientos siguen resolviéndose en el espacio antiguo mientras los nuevos vectores se construyen junto a él; los conceptos creados entretanto se recogen en una pasada posterior. El cambio se produce en un único paso al final, que también sustituye el modelo de embedding predeterminado de su organización. Interrumpirlo es inofensivo — al empezar de nuevo, se continúa donde se detuvo.
Las comprobaciones, las adiciones y las importaciones se facturan como cualquier otro uso de embeddings, y los aciertos exactos no cuestan nada porque nunca llegan a un modelo. Explorar, comparar, la órbita, el mapa 3D, exportar y eliminar son gratuitos. El gasto interactivo de un día se agrupa en una sola línea de su historial de créditos, de modo que el registro sigue siendo legible en lugar de llenarse de fracciones de céntimo.