Enriqueça o mesmo tipo de entidade uma e outra vez e continua a redescobrir as mesmas coisas do mundo real — a mesma empresa, o mesmo efeito secundário de um medicamento, a mesma pessoa — descritas com palavras ligeiramente diferentes de cada vez. Um ID semântico é um identificador estável, no âmbito da organização, que o Entity Enricher atribui a um objeto a partir dos seus campos-chave, para que esses quase-duplicados se reduzam a uma identidade pela qual pode agrupar, desduplicar e fazer junções.
A identidade de um objeto é construída a partir dos seus campos-chave — e pode haver um ou vários. Dois exemplos:
nameAparece como Headache, Céphalée e Cephalalgia em diferentes execuções e idiomas. Um campo-chave, três grafias, um conceito real.
nome + paísAcme Inc. · Estados Unidos e Acme Incorporated · Estados Unidos são a mesma empresa — enquanto Acme Inc. · Alemanha é uma diferente. A segunda chave desambigua; é por isso que um objeto pode ter mais do que uma.
A correspondência simples de cadeias de texto falha em todos estes casos; um humano sabe quais são iguais. Os IDs semânticos codificam esse juízo automaticamente.
string num objeto (denominada id por predefinição), que contém um identificador opaco e estável.fabricante) ou cada item de um array (por exemplo, cada side_effect).Depois de o modelo devolver o resultado, o Entity Enricher resolve cada ID semântico em seis passos — do mais barato para o mais caro. Os quatro passos anteriores ao embedding são pura comparação de texto, por isso uma identidade resolvida nessa fase não tem qualquer custo:
null no elemento que o contém e um item dentro de uma lista é retirado da lista. A entidade enriquecida em si nunca é removida; simplesmente não tem ID.LC-39A unifica todas as formas como o resto do texto foi escrito. Igualmente importante, funciona no sentido inverso: um código diferente veta uma fusão que o passo de embedding teria aceitado, porque duas coisas com identificadores diferentes são duas coisas, por muito parecidas que se leiam.“Boeing” e “The Boeing Company”. Isto apanha exatamente as diferenças de verbosidade que os embeddings medem como muito distantes, e não custa nada: tal como no passo de texto exato, uma correspondência aqui significa nenhuma chamada de embedding e nenhum custo.“Acme Inc.” e“Acme Incorporated” fiquem lado a lado.Porquê um modelo e não um número: a semelhança, por si só, falha nos dois sentidos. Duas grafias do mesmo estaleiro podem obter pontuações muito distantes, ao passo que uma condição clínica e o seu oposto (“aguda” versus “crónica”) pontuam de forma quase idêntica. Nenhum limiar separa estes casos; só o conhecimento do significado das palavras o consegue. O limiar do juiz (por predefinição 0,5, ajustável por propriedade) decide apenas até onde procurar candidatos que valha a pena questionar — nunca decide a identidade.
Se um ID é gerado depende de já existir um presente na entrada para esse objeto. É isto que lhe permite fazer round-trip: enriqueça uma vez para obter IDs e, depois, passe um ID conhecido em execuções posteriores para associar novos factos à mesma identidade — mais barato e sem ambiguidade.
Se o objeto que envia já contém um semantic ID, é tratado como uma consulta: o ID é mantido tal como está, o record é associado a esse conceito existente e não há embedding — sem custo, sem match-or-mint. Está a dizer à plataforma “este objeto já está identificado na nossa base de dados”.
Se o objeto não tiver ID semântico, a plataforma gera um com os passos acima. A partir daí, esse ID passa a ser o identificador estável do objeto na base de dados da sua organização.
Um valor presente mas não reconhecível (que não é um ID de conceito real) é ignorado, sendo gerado um ID em vez disso.
A resolução consome uma pequena quantidade de utilização de embeddings por enriquecimento (medida como qualquer chamada de modelo). A cache de correspondência exata torna as repetições gratuitas e os IDs fornecidos na entrada não têm qualquer custo.
Os IDs resolvidos aparecem no JSON de saída do enriquecimento (o campo id de cada objeto), nos conceitos semânticos do detalhe do registo e todos juntos na página de IDs semânticos, onde o vocabulário que formam é consultado e curado. Use-os para:
A fusão reconcilia discordâncias entre modelos dentro de uma única execução; os IDs semânticos reconciliam a mesma entidade ao longo de execuções e do tempo. Os dois funcionam em conjunto.