Um guia passo a passo de como o Entity Enricher processa uma única entidade — desde a entrada, passando pela classificação e execução paralela de modelos, até à saída estruturada.
Abra a página do Editor de Fluxo de Trabalho e configure o seu enriquecimento. Um assistente de passos guia-o pelas fases do pipeline: Dados de Amostra, Esquema, Enriquecimento e Resultados — mais um passo Base de Dados Pronta quando o esquema está ligado a um Database Sync, confirmando que as alterações da execução foram colocadas em fila para a sua base de dados (ou explicando porque a gravação foi recusada).
Cole uma amostra JSON para gerar automaticamente um esquema e, em seguida, explore a árvore de propriedades interativa. Edite propriedades, adicione domínios de especialização e marque campos como chaves de pesquisa ou preservados.
Configure as opções de enriquecimento (estratégia, modelos, idiomas, classificação, além do schema de resposta e das opções de saída estruturada estrita) e preencha as chaves de pesquisa da entidade (nome, site, país, etc.) para identificar a entidade.
Mostra o progresso e os resultados em tempo real para cada modelo. Ao utilizar vários modelos, aparece um botão “Combinar Resultados” para a fusão.
Alguns pedidos não têm qualquer hipótese de produzir um resultado utilizável, e o sítio mais barato para o descobrir é antes da primeira chamada ao LLM. São aplicados dois contratos logo à partida.
Um esquema declara o que a sua entrada tem de conter: os campos-chave que dizem qual é a entidade, uma chave em cada item de um array que forneça e um valor para cada campo marcado como preservado (nada pode ser preservado se nunca foi fornecido). Um pedido a que falte algum destes elementos é recusado com um único erro que lista todas as violações de uma vez — mais o contrato completo do esquema, para que possa corrigir tudo numa só passagem em vez de descobrir os requisitos a cada rejeição. O contrato é publicado em todos os esquemas guardados, para que um cliente possa verificar antes de enviar.
Um array para o qual fornece itens é enriquecido exatamente: o modelo preenche o que sabe sobre cada item e não pode acrescentar nem eliminar nenhum. Enviou cinco linhas, recebe cinco de volta. Um item que o modelo não tenha tratado é reinserido tal e qual, em vez de se perder, e um item que tenha inventado é descartado. Os arrays que deixar vazios continuam abertos — aí é o modelo a descobrir factos, que é precisamente o objetivo.
Se você tiver selecionado um model de classification, é executada primeiro uma chamada rápida e económica ao LLM para verificar se a entity corresponde ao tipo do schema. Isto evita desperdiçar tokens em enrichment quando a entity não corresponde. Saiba mais na documentação de Classification.
Cada modelo selecionado processa a entidade com a estratégia que indicou — ou, por predefinição, com a que é escolhida automaticamente a partir da forma do seu esquema, e que a execução comunica ao arrancar. Quando são selecionados vários modelos, estes correm em paralelo entre fornecedores (Claude e GPT-4 correm em simultâneo), enquanto os modelos do mesmo fornecedor correm sequencialmente para respeitar os limites de taxa.
Cada resposta do LLM é validada em relação ao seu schema em tempo real. Quando o output não corresponde aos tipos ou restrições esperados, o sistema envia automaticamente os erros de volta ao LLM para correção.
Até 5 tentativas automáticas de repetição por chamada ao LLM. Cada repetição inclui o erro de validação específico, para que o LLM saiba exatamente o que corrigir — e a reparação é cirúrgica: apenas as folhas que vieram erradas são pedidas de novo, não a resposta inteira.
Repare no que não consta desta lista: um valor que o modelo não conseguiu determinar não é um erro a repetir. Qualquer campo pode vir ausente e o modelo declara o que não conseguiu encontrar, pelo que “desconhecido” é uma resposta e não uma falha. Se um valor em falta é aceitável decide-se mais tarde, quando a entidade é admitida na sua base de dados — e não obrigando o modelo a adivinhar.
Dois botões opcionais pedem ao provider que restrinja a saída antes de esta ser devolvida, para que menos respostas precisem de correção à partida. Ambos se aplicam apenas a models que os suportam; tudo continua a recorrer ao ciclo de validação e repetição acima.
O Entity Enricher usa Server-Sent Events (SSE) para transmitir o progresso em tempo real. Não tem de esperar que todos os modelos concluam — os resultados aparecem progressivamente à medida que cada domínio de especialização ou modelo termina.
Cada modelo tem o seu próprio painel de resultados, que mostra o output JSON estruturado, distintivos de progresso por especialização, utilização de tokens, custo e tempo de processamento. Ao utilizar a estratégia multi-especialização, os distintivos de especialização atualizam-se em tempo real à medida que cada domínio termina.
Ao utilizar a estratégia multi-expertise domain, algumas expertise domains podem falhar enquanto outras têm êxito. Em vez de descartar tudo, o Entity Enricher devolve o resultado combinado das expertise domains bem-sucedidas com um estado “Parcial”. Pode então repetir apenas as expertise domains que falharam sem voltar a executar todo o enrichment.
Após a conclusão do enriquecimento, os seus resultados são guardados na página de Histórico para referência futura. Se utilizou vários modelos, pode combinar os resultados através da Fusão Multimodelo.