Modelos e preços

Faça a gestão dos fornecedores e modelos de LLM, sincronize modelos a partir de registos externos, execute verificações de estado e configure API keys por organização para faturação independente.

Gestão de Fornecedores

O Entity Enricher suporta uma ampla variedade de fornecedores de LLM. Cada fornecedor pode ter múltiplos modelos com preços, capacidades e configuração individuais.

Os fornecedores e os modelos aparecem lado a lado porque é assim que são geridos: a chave de API pertence ao fornecedor, os preços e as capacidades pertencem a cada modelo.

Fornecedores suportados

AnthropicOpenAIGoogleGoogle VertexMistralDeepSeekGroqTogether AIFireworks AICoherexAIMoonshotZ.AINVIDIA NIMOllamaAzure OpenAI

Tipos de Fornecedor

PadrãoA maioria dos fornecedores (Anthropic, OpenAI, Mistral, etc.) usa endpoints de API padrão com autenticação por bearer token. Um fornecedor Standard também pode apontar para um endpoint personalizado compatível com OpenAI — consulte Endpoints Personalizados e Corporativos abaixo.
AzureO Azure OpenAI utiliza endpoints de implementação personalizados com configuração de versão da API.
OllamaInstâncias Ollama autoalojadas com URLs de endpoint personalizados e deteção automática de modelos.

Endpoints Personalizados e Empresariais

Muitas equipas encaminham o tráfego de LLM através de um gateway de IA empresarial, um endpoint regional ou um fornecedor que não está integrado — por exemplo, um proxy LiteLLM empresarial, o Cloudflare AI Gateway ou o Alibaba DashScope (para modelos Qwen). Adiciona-os como o seu próprio fornecedor Standard (compatível com OpenAI) com um URL base personalizado.

Adicionar um fornecedor de gateway

  1. Crie um provider com um nome que não seja um dos integrados (por exemplo, acme-openai-gw). Nomes integrados como openai ou anthropic estão reservados.
  2. Escolha o tipo Standard (compatível com OpenAI) e preencha Endpoint da API personalizado (URL base) — por exemplo, https://gateway.example.com/v1. Este campo é obrigatório para qualquer provider para o qual o Entity Enricher não tenha um cliente incorporado.
  3. Adicione a chave do gateway como uma chave de organização para esse fornecedor (API Keys → AI Provider Keys), para que a faturação e a rotação sejam feitas por organização.
  4. Adicione os modelos que o gateway disponibiliza. O identificador do modelo é enviado tal e qual, por isso deve corresponder exatamente ao que o gateway espera.

Bom saber

  • Os fornecedores integrados ocultam o campo de endpoint. A Anthropic, a OpenAI, a Mistral e os outros fornecedores reconhecidos já conhecem o seu endpoint, por isso não há nada para configurar. Se um fornecedor personalizado passar mais tarde a integrado, o endpoint guardado permanece visível para que o possa limpar.
  • Apenas HTTPS público. Os endpoints têm de ser URLs públicos https://. Loopback e intervalos privados (localhost, 10.x, 192.168.x) são rejeitados para evitar SSRF — um servidor auto-hospedado tem de ser acessível pela internet. Para um Ollama local, utilize antes o túnel Ollama dedicado.
  • Formato de comunicação compatível com OpenAI. As chamadas a um fornecedor personalizado são encaminhadas através da API compatível com OpenAI, pelo que o endpoint tem de falar o protocolo OpenAI /v1 (chat completions, /models).
  • Testar ligação sonda {endpoint}/models para verificar a chave e o URL base antes de executar um enriquecimento.

Orçamentos de taxa e concorrência (por chave)

Cada chamada feita com uma chave API é cadenciada dentro do orçamento que o fornecedor concede a essa chave — pedidos e tokens por minuto, por modelo — para que uma distribuição em paralelo nunca esbarre em erros 429. O orçamento não é introduzido manualmente: é lido nos próprios cabeçalhos de resposta do fornecedor, aprendido a partir de uma rejeição quando o fornecedor nada indica ou, em último recurso, introduzido por um proprietário.

  • Lido a partir do fornecedor. Mistral, OpenAI, Azure, Groq, xAI, Anthropic e Cohere indicam os limites da chave em todas as respostas; a primeira chamada a um modelo aprende-os e as chamadas seguintes respeitam-nos.
  • Aprendido quando o fornecedor nada indica. Google, DeepSeek, Moonshot, Z.AI, Together e Alibaba não indicam nada: uma rejeição ensina um orçamento de 80% do que foi enviado no último minuto, que depois recupera lentamente. Os proprietários também podem introduzir uma regra a partir da página Chaves API.
  • Limitado por chave e modelo. Cada chave da organização e a chave global partilhada têm os seus próprios orçamentos, por modelo — na Mistral, uma chave pode permitir 15 pedidos por minuto num modelo e 1000 noutro.
  • A concorrência decorre daí. O número de chamadas em curso é derivado desse orçamento e da latência observada. A definição Máximo de chamadas simultâneas por chave do fornecedor destina-se apenas a destinos que nunca respondem 429 mas que não aguentam chamadas em paralelo, como um portátil a executar Ollama.
  • Visível por chave. A ação Limites de taxa numa chave lista as suas regras, a origem de cada uma e a utilização em tempo real do minuto atual. Uma sondagem de capacidades regista também os limites indicados pelo fornecedor nas colunas TPM e RPM da tabela Modelos.

Isto é distinto do limite de trabalhos concorrentes máximos do seu plano, que restringe quantos trabalhos de enriquecimento a sua organização executa em simultâneo em todos os fornecedores.

Capacidades do Model

Cada modelo regista as suas capacidades, que são apresentadas como ícones no seletor de modelos:

CapacidadeDescrição
VisãoPode processar entradas de imagem e visuais
Chamadas de ferramentaSuporta chamada de funções / uso de ferramentas
Entrada de ÁudioPode processar entradas de áudio
Entrada de PDFPode processar documentos PDF
Caching de PromptsSuporta cache de prompts para redução de custos
RaciocínioCapacidades de raciocínio alargado / cadeia de pensamento
EmbeddingsTransforma texto num vetor em vez de responder — é com isto que os IDs semânticos são resolvidos. Os modelos de embedding são uma família à parte, com o seu próprio tamanho de vetor, e nunca aparecem num seletor de enriquecimento

Deixar a plataforma escolher o modelo

Indicar um modelo é opcional. O enriquecimento, a geração de esquemas e a geração de amostras aceitam todos auto — e tratam um modelo omitido como auto —, valor que é resolvido no servidor, por tarefa, no momento em que o trabalho arranca. A execução indica que modelo foi escolhido, por isso automático nunca significa opaco.

1. A predefinição fixada da sua organização

Os proprietários podem fixar um modelo preferido por tarefa em Definições → Organização → Seleção de modelo. Se estiver definido um para a tarefa em causa, é esse que prevalece.

2. Caso contrário, o melhor modelo medido

Na ausência de um modelo fixado, a escolha recai sobre o modelo com a melhor pontuação combinada dos seus benchmarks de fonte de pontuação — as suas próprias medições de qualidade, velocidade e custo nos seus esquemas. Sem qualquer fonte de pontuação, o pedido é recusado em vez de adivinhado.

3. Restringido pelo que a tarefa exige

Ativar a pesquisa web, ou anexar um documento que tem de ser enviado tal como está, restringe os candidatos aos modelos que o conseguem realmente fazer — e, se nenhum se qualificar, recebe um erro explícito em vez de uma degradação silenciosa.

  1. 1Qualidade, velocidade e custo, pontuados pelos seus próprios benchmarks
  2. 2Deixe em Auto ou fixe um modelo para esta tarefa
  3. 3Cada tarefa mostra o que Auto resolve neste momento e a respetiva pontuação
Os pesos são definidos por tarefa, pelo que a geração de schemas pode privilegiar a qualidade enquanto o enriquecimento se orienta pelo custo. Um modelo que apresenta traços em vez de pontuações nunca foi medido aqui, e o Auto nunca o escolhe.

Um modelo também pode ser vedado a uma tarefa sem ser desativado: um modelo que enriquece bem mas gera maus esquemas pode ser ocultado apenas nos seletores de geração de esquemas e de amostras, seja para a sua organização, seja globalmente por um administrador. Continua totalmente disponível em todo o resto — um instrumento mais suave do que a desativação apresentada abaixo.

Sincronização automática de preços

Administrador do sistema

Mantenha os preços dos modelos atualizados sincronizando a partir de registos externos. O processo de sincronização deteta automaticamente novos modelos, alterações de preços e modelos removidos.

Registo LiteLLM

A fonte de preços predefinida. Obtém dados do registo mantido pela comunidade da LiteLLM no GitHub, com nomes reais de modelos da API, preços, comprimentos de contexto e capacidades.

Cobre ~30 providers. Não inclui nomes de apresentação, benchmarks nem velocidade de geração.

PricePerToken

Uma fonte alternativa de pricepertoken.com. Inclui nomes de apresentação, benchmarks (pontuações de programação e matemática) e velocidade de geração (tokens por segundo).

Cobre ~20 providers. Fornece metadados mais ricos do que o LiteLLM.

Z.AI

Um catálogo oficial e autenticado de identificadores de modelos GLM, com preços extraídos diretamente da documentação da Z.AI e lacunas de capacidades investigadas na mesma.

Substitui as entradas da Z.AI importadas anteriormente do LiteLLM e do PricePerToken.

Processo de sincronização

  1. Pré-visualização de simulação — Veja o que vai mudar antes de aplicar. Consulte novos modelos, atualizações de preços e desativações.
  2. Correspondência ao nível da fonte — Cada fonte afeta apenas os modelos dessa fonte. Os modelos manuais nunca são alterados.
  3. Chaves de sincronização estáveis — Os modelos são associados por um identificador estável, não pelo nome. Pode renomear modelos sem quebrar a sincronização.
  4. Aplicação transacional — Todas as alterações são aplicadas numa única transação de base de dados para garantir a consistência.
  5. Criação automática de provider — Se um modelo sincronizado pertencer a um provider desconhecido, o provider é criado automaticamente.

Verificações de Saúde do Model

Valide proativamente se os models estão acessíveis executando um prompt mínimo de verificação de estado. Isto deteta models avariados antes de os utilizadores encontrarem erros durante o enriquecimento.

AprovadoO modelo responde com êxito. Se tiver sido desativado automaticamente antes, é reativado.
Não encontradoO modelo devolve um erro de “não encontrado”. É desativado automaticamente para evitar falhas futuras.
Outro erroErros de autenticação, timeouts ou limites de taxa são reportados, mas não desencadeiam a desativação.

As verificações de estado podem ser executadas em todos os modelos, nos modelos de um fornecedor específico ou num único modelo. Os resultados são transmitidos em tempo real via SSE com uma barra de progresso que mostra as contagens de aprovações/falhas.

Desativação Automática

Quando uma chamada de enriquecimento falha com um erro “model not found”, o modelo é automaticamente desativado para evitar falhas repetidas. Isto acontece em tempo real durante as operações normais de enriquecimento.

Motivo da desativaçãoDefinido porReativado automaticamente?
Modelo não encontradoErros de enriquecimento, verificações de estado ou uma sondagem de capacidades a que nenhuma rota respondeSim (por sincronização de preços ou validação)
Sem Saída EstruturadaSondagem de capacidades: nem o canal de ferramentas nem o nativo em qualquer rota acessívelSim, apenas por uma sondagem de capacidades posterior
Sincronização removidaSincronização de preços (model desapareceu)Sim (se o model reaparecer no registo)
ManualAlternância de administrador na interfaceNão (apenas reativação manual)

Use a Sua Própria Chave (BYOK)

As organizações podem configurar as suas próprias chaves de API de provider de LLM para faturação e monitorização de utilização independentes. O sistema utiliza uma resolução de chaves em dois níveis com seleção LRU:

1.º
Pool de Chaves da Organization

Chaves por organização configuradas na página de Chaves API. Suporta várias chaves por fornecedor com rotação LRU. Encriptadas com Fernet.

2.º
Conjunto de chaves globais

Chaves de todo o sistema geridas por administradores. Partilhadas por todas as organizações. Também suporta várias chaves por fornecedor com rotação LRU.

Cada enriquecimento regista qual a chave utilizada, para que possa acompanhar os custos por chave. As chaves incluem suporte para verificações de estado e contadores de utilização. Dentro de um conjunto, a chave seguinte a ser escolhida é a chave ativa com a data de última utilização mais antiga; uma chave só sai da rotação quando você a desativa manualmente, pelo que um erro do fornecedor nunca retira silenciosamente uma chave de serviço. Saiba como gerir chaves no guia Chaves de API.

Importar e exportar

Exporte toda a sua configuração de providers e models em JSON para cópia de segurança ou transferência para outra instância. A importação é sempre uma inserção-ou-atualização: os providers e models existentes são correspondidos pelo nome e atualizados no local, enquanto os novos são adicionados — nada é eliminado.

A exportação inclui as definições do fornecedor, as configurações do modelo, os preços, as capacidades e as especificações canónicas do modelo — mas nunca as chaves de API, que são armazenadas separadamente. Após a importação, configure as chaves de API separadamente. Os administradores do sistema fazem cópias de segurança do catálogo global completo; os proprietários da organização exportam e importam apenas os fornecedores e modelos da sua própria organização — o catálogo global partilhado não pode ser criado nem editado através da importação.

Catálogo Público de Modelos

A página de modelos apresenta o catálogo global a qualquer pessoa: preços do fornecedor, capacidades medidas e as pontuações que cada modelo obteve nos cenários de benchmark publicados como fontes globais de pontuação. Lê dois ficheiros JSON estáticos que a atualização noturna de modelos reescreve e que pode transferir e reutilizar. Um modelo que o fornecedor já não disponibiliza (desativado como “modelo não encontrado”) fica de fora; todos os outros modelos do catálogo são listados.

Ficheiros

  • /data/models.json — a tabela: uma entrada por fornecedor × modelo, com tabelas de consulta para fornecedores, cenários e especificações.
  • /data/benchmarks.json — todos os resultados de benchmark públicos, agrupados por chave de modelo.

Ambos são servidos com um ETag e uma cache pública de uma hora, codificados em gzip quando o cliente o aceita. O campo version é incrementado a cada alteração a que um consumidor tenha de se adaptar.

Campos de models.json

generated_at, counts, default_weightsQuando o ficheiro foi escrito, quantos modelos, fornecedores e cenários contém, e a combinação qualidade / velocidade / custo (em percentagem) por trás de cada pontuação global.
providers[], scenarios[], specs{}Tabelas de consulta: os modelos referenciam um fornecedor e os cenários por índice; as specs são as pontuações públicas de benchmark dos pesos (inteligência, programação, matemática e as restantes em extra), indexadas por chave canónica para que os revendedores de um mesmo modelo as partilhem.
models[].key, model, display_name, canonical_keyA chave composta que a API aceita (provider::model), o id bruto do modelo, o respetivo rótulo e a identidade transversal aos fornecedores.
models[].pricingPreços de tabela do fornecedor em USD por milhão de tokens: input, output, cache_read, cache_write, cache_write_1h, reasoning_output, mais web_search_per_query com a respetiva unidade. Antes de qualquer comissão do plano.
models[].capabilities[]As flags ativas: vision, pdf_input, audio_input, audio_output, video_input, tool_calls, tool_choice, response_schema, strict_structured_output, reasoning, reasoning_effort, web_search, prompt_caching, embeddings, requires_streaming. Uma flag em falta significa falso ou não medido.
models[].context_length, max_input_tokens, max_output_tokens, deprecation_date, latencyLimites, a data de descontinuação anunciada pelo fabricante e os valores de latência recolhidos (tokens por segundo, tempo até ao primeiro token).
models[].enrichment_capable, disabled_tasks[]Se o modelo dispõe sequer de um canal de saída estruturada e as tarefas para as quais a aplicação nunca o disponibiliza (a classificação e a arbitragem exigem chamadas de ferramentas; a geração de esquemas e de amostras segue a condição de geração de esquemas).
models[].scores{task}Por tipo de tarefa (enrichment, schema_generation, sample_generation): a média de qualidade, velocidade e custo nos cenários públicos dessa tarefa, a pontuação global com os pesos predefinidos e os índices dos cenários. A velocidade e o custo são relativos aos outros modelos no mesmo cenário.

A forma como as pontuações de qualidade, velocidade e custo são calculadas é explicada em Pontuação de Benchmark.

Próximos Passos