Enriqueça o mesmo tipo de entidade uma e outra vez e continua a redescobrir as mesmas coisas do mundo real — a mesma empresa, o mesmo efeito secundário de um medicamento, a mesma pessoa — descritas com palavras ligeiramente diferentes de cada vez. Um ID semântico é um identificador estável, no âmbito da organização, que o Entity Enricher atribui a um objeto a partir dos seus campos-chave, para que esses quase-duplicados se reduzam a uma identidade pela qual pode agrupar, desduplicar e fazer junções.
A identidade de um objeto é construída a partir dos seus campos-chave — e pode haver um ou vários. Dois exemplos:
nameAparece como Headache, Céphalée e Cephalalgia em diferentes execuções e idiomas. Um campo-chave, três grafias, um conceito real.
nome + paísAcme Inc. · Estados Unidos e Acme Incorporated · Estados Unidos são a mesma empresa — enquanto Acme Inc. · Alemanha é uma diferente. A segunda chave desambigua; é por isso que um objeto pode ter mais do que uma.
A correspondência simples de cadeias de texto falha em todos estes casos; um humano sabe quais são iguais. Os IDs semânticos codificam esse juízo automaticamente.
string num objeto (denominada id por predefinição), que contém um identificador opaco e estável.fabricante) ou cada item de um array (por exemplo, cada side_effect).Depois de o modelo devolver o resultado, o Entity Enricher resolve cada ID semântico em seis passos — do mais barato para o mais caro. Os quatro passos anteriores ao embedding são pura comparação de texto, por isso uma identidade resolvida nessa fase não tem qualquer custo:
null no objeto que o contém e um item dentro de uma lista é removido da lista. A entidade enriquecida em si nunca é removida; fica apenas sem ID.LC-39A unifica todas as formas como o resto do texto foi escrito. Igualmente importante, funciona também no sentido inverso: um código diferente veta uma fusão que o passo de embedding teria aceitado, porque duas coisas com identificadores diferentes são duas coisas, por mais parecidas que sejam.“Boeing” e “The Boeing Company”. Isto apanha exatamente as diferenças de verbosidade que os embeddings medem como muito distantes, e não custa nada: tal como no passo de texto exato, uma correspondência aqui significa nenhuma chamada de embedding e nenhum custo.“Acme Inc.” e“Acme Incorporated” fiquem lado a lado.0.92, ajustável por propriedade), o ID desse conceito é reutilizado. Caso contrário, é gerado um ID totalmente novo e guardado para a próxima vez. Há uma exceção que anula uma pontuação elevada: quando os dois textos são as mesmas palavras contadas de forma diferente — «segunda fase» e«terceira fase» — são tratados como coisas distintas, porque é precisamente a contagem que os distingue. O mesmo número escrito de duas formas (2 eII) continua a corresponder.Compromisso do limiar: um limiar mais alto é mais rigoroso (menos fusões acidentais); um mais baixo é mais permissivo (deduplicação mais agressiva). Ajuste-o por propriedade quando o valor predefinido de 0,92 fundir a mais ou a menos.
Se um ID é gerado depende de já existir um presente na entrada para esse objeto. É isto que lhe permite fazer round-trip: enriqueça uma vez para obter IDs e, depois, passe um ID conhecido em execuções posteriores para associar novos factos à mesma identidade — mais barato e sem ambiguidade.
Se o objeto que envia já contém um semantic ID, é tratado como uma consulta: o ID é mantido tal como está, o record é associado a esse conceito existente e não há embedding — sem custo, sem match-or-mint. Está a dizer à plataforma “este objeto já está identificado na nossa base de dados”.
Se o objeto não tiver ID semântico, a plataforma gera um com os passos acima. A partir daí, esse ID passa a ser o identificador estável do objeto na base de dados da sua organização.
Um valor presente mas não reconhecível (que não é um ID de conceito real) é ignorado, sendo gerado um ID em vez disso.
A resolução consome uma pequena quantidade de utilização de embeddings por enriquecimento (medida como qualquer chamada de modelo). A cache de correspondência exata torna as repetições gratuitas e os IDs fornecidos na entrada não têm qualquer custo.
Os IDs resolvidos aparecem no JSON de saída do enriquecimento (o campo id de cada objeto), nos conceitos semânticos do detalhe do registo e todos juntos na página de IDs semânticos, onde o vocabulário que formam é consultado e curado. Use-os para:
A fusão reconcilia discordâncias entre modelos dentro de uma única execução; os IDs semânticos reconciliam a mesma entidade ao longo de execuções e do tempo. Os dois funcionam em conjunto.