Cada enriquecimiento que resuelve un ID semántico reutiliza un concepto que su organización ya conoce o crea uno nuevo. La página IDs semánticos es donde ese vocabulario creciente se convierte en algo que puede observar: explórelo, mida cuán próximas están realmente dos entradas, añada términos a mano, busque los casi duplicados que quedaron por debajo del umbral, retire lo que ya no quiera y traslade todo el conjunto a otro modelo de embedding.
Se encuentra en /semantic-ids en la barra lateral y solo resulta útil cuando su organización dispone de un modelo de embeddings y de al menos un esquema con un ID semántico: los conceptos los crean los enriquecimientos, no la página.
Cada fila es un concepto: su texto canónico (el texto de identidad que lo creó por primera vez), su tipo de concepto (el espacio en el que reside — por defecto, el nombre del tipo de entidad), cuántos registros lo usan y cuándo se creó. Filtre por texto, por cualquier número de tipos de concepto o por un uso mínimo para encontrar las entradas que merecen su atención; Exportar vista descarga exactamente lo que muestran los filtros.

La similitud se mide únicamente dentro de un mismo espacio. Los vectores solo son comparables dentro del mismo tipo de concepto y el mismo modelo de embedding. Las filas ajenas al espacio del concepto seleccionado muestran —, que significa «no comparable» — nunca «0 %».
A veces conoce el vocabulario antes de que lleguen los datos: una lista de platos, estados o familias de productos. La barra Curar está pensada para escribir esa lista: acótela a un tipo de concepto una sola vez — el ámbito pasa a la dirección de la página, de modo que /semantic-ids/<tipo de concepto> es un enlace directo a esa parte — y luego repita escriba un valor → Comprobar → Añadir. Enter comprueba y un segundo Enter añade, y el campo se vacía y mantiene el foco, así que un vocabulario de cincuenta términos son unos minutos de escritura sin tocar el ratón.

Comprobar es una ejecución en seco de la escalera de resolución real — la misma que ejecuta un enriquecimiento — por lo que su veredicto no es una estimación. Y como ya ha pagado por ese veredicto, sirve además de protección contra duplicados: cuando un concepto existente cubre su texto en el umbral o por encima de él, Añadir concepto permanece desactivado.

Ese rechazo es intencionado: un gemelo por encima del umbral nunca ganaría una resolución y repartiría de forma impredecible las coincidencias futuras entre las dos entradas. El control deslizante Umbral situado junto al campo determina dónde está esa línea en sus comprobaciones: súbalo para ser más estricto o bájelo para fusionar de forma más agresiva.
El vocabulario tampoco tiene por qué partir de un enriquecimiento: Nuevo tipo de concepto… (en la barra de herramientas de la página, del rol editor en adelante) da nombre a un tipo y elige el modelo de embedding en el que residirán sus conceptos — de forma predeterminada, el modelo de su organización. La barra de curación se limita a él de inmediato y el tipo se incorpora al vocabulario con el primer concepto que añada; un tipo que ya existe conserva su modelo, ya que mover un vocabulario entre modelos es justamente la función de la migración.
Todo lo que supera el umbral ya se ha fusionado por usted. Los casos interesantes están justo por debajo — lo bastante cerca para resultar sospechosos, no lo bastante para haberse fusionado. La vista Duplicados muestra exactamente esa franja, y el control deslizante la amplía o la reduce.

Comparar → vuelve a la tabla con ese concepto seleccionado, para que vea qué más hay cerca antes de decidir. Un par que usted considere un duplicado real es una señal sobre el umbral de la propiedad que lo produce: redúzcalo en el editor de esquemas y los futuros enriquecimientos fusionarán el par por sí solos. Los recuentos de uso le indican cuál de los dos prefieren realmente los datos.
El panel derecho muestra el ID del concepto (copiable — es el valor por el que hace el join su base de datos), su texto normalizado, el modelo de embedding que lo respalda y los registros que se resolvieron a él. El concepto seleccionado forma parte de la dirección de la página, por lo que la URL de la barra de direcciones es un enlace directo a él — se puede compartir con un colega o conservar en un ticket. Dos vistas lo sitúan entre sus vecinos.


Aplanar 1536 dimensiones en 3 no puede preservar las distancias, y la disposición exagera lo compactos que son los grupos. Ambas vistas pintan cada punto con la misma escala de similitud, así que fíjese en el color, no en la separación. El primer mapa de una sesión tarda unos segundos en componerse; los siguientes son instantáneos.
Cada registro vinculado muestra la puntuación con la que se resolvió aquí. Un — significa que el ID llegó en la entrada y se transmitió tal cual, por lo que nunca se comparó nada — la vía gratuita e inequívoca descrita en la guía de IDs semánticos.
Importar y resolver ejecuta toda una columna del CSV a través de la misma cadena y anota en cada fila lo que ocurriría con ella — no hay límite de tamaño de archivo; los archivos grandes se resuelven en lotes de 1000 con progreso en vivo. El archivo se analiza en su navegador — solo se envían los valores.

| Resultado | Qué significa |
|---|---|
exact | El mismo texto, normalizado, ya existe: gratis, sin llamada al modelo. |
matched | Una redacción distinta se resolvió a un concepto existente por encima del umbral. |
would_mint | Nada estaba lo bastante cerca; aquí un enriquecimiento crearía un concepto nuevo. |
minted | El mismo caso, con la creación activada: el concepto ya existe (solo el propietario). |
Las filas resueltas se descargan en su propio CSV, por lo que una importación también puede usarse únicamente como auditoría: ¿cuáles de nuestros 900 nombres de proveedor ya se conocen y cuáles abrirían una identidad nueva? Las exportaciones funcionan al revés y nombran el archivo según los filtros con los que se generaron, así que una carpeta llena de ellas se explica por sí sola.
Eliminar aquí es seguro de un modo en que no lo son la mayoría de las eliminaciones de datos: el vocabulario se reconstruye solo, porque el siguiente enriquecimiento vuelve a crear lo que necesita. Lo que no vuelve es la convergencia con los IDs que ya guardó, y el diálogo se lo indica con cifras reales antes de que confirme.

Tras un cambio así, conservar los conceptos antiguos es la opción arriesgada, no la prudente: las identidades compuestas con las nuevas claves aún pueden caer dentro del umbral de los vectores antiguos y ser absorbidas por ellos sin aviso, dejándole IDs que no significan ni una cosa ni la otra.
Los vectores de dos modelos distintos no son comparables, por lo que cambiar de modelo implica volver a generar los embeddings de todos los conceptos. Una vez que existen conceptos, esta migración es la única forma autorizada de hacerlo, y es el motivo por el que la configuración del modelo de embeddings de la organización no se modifica por sí sola.

La vista previa indica cuánto costará volver a generar los embeddings y qué pares de conceptos es probable que colisionen: queden dentro del umbral el uno del otro en el nuevo espacio y empiecen a resolverse juntos. Mide los candidatos realistas en lugar de todos los pares, y así lo indica.
Los enriquecimientos siguen resolviéndose en el espacio antiguo mientras los nuevos vectores se construyen junto a él; los conceptos creados entretanto se recogen en una pasada posterior. El cambio se produce en un único paso al final, que también sustituye el modelo de embedding predeterminado de su organización. Interrumpirlo es inofensivo — al empezar de nuevo, se continúa donde se detuvo.
Las comprobaciones, las adiciones y las importaciones se facturan como cualquier otro uso de embeddings, y los aciertos exactos no cuestan nada porque nunca llegan a un modelo. Explorar, comparar, la órbita, el mapa 3D, exportar y eliminar son gratuitos. El gasto interactivo de un día se agrupa en una sola línea de su historial de créditos, de modo que el registro sigue siendo legible en lugar de llenarse de fracciones de céntimo.