模型与定价

管理 LLM 提供商和模型,从外部注册表同步模型,运行健康检查,并为各组织配置独立计费的 API 密钥。

提供商管理

Entity Enricher 支持广泛的 LLM 提供商。每个提供商可拥有多个模型,各自具有独立的定价、功能和配置。

提供商与模型并排展示,因为它们本就是这样管理的:API 密钥属于提供商,定价和能力属于各个模型。

支持的 provider

AnthropicOpenAIGoogleGoogle VertexMistralDeepSeekGroqTogether AIFireworks AICoherexAIMoonshotZ.AINVIDIA NIMOllamaAzure OpenAI

提供商类型

标准大多数提供商(Anthropic、OpenAI、Mistral 等)使用带 bearer 令牌认证的标准 API 端点。标准提供商也可以指向自定义的 OpenAI 兼容端点——请参阅下方的自定义与企业端点。
AzureAzure OpenAI 使用自定义部署端点,并配合 API 版本配置。
Ollama自托管的 Ollama 实例,支持自定义端点 URL 和自动模型发现。

自定义与企业端点

许多团队会将 LLM 流量路由经过企业 AI 网关、区域端点或某个未内置的提供商 —— 例如企业级 LiteLLM 代理、Cloudflare AI Gateway 或 Alibaba DashScope(用于 Qwen 模型)。您可以将它们作为各自独立的标准(OpenAI 兼容)提供商添加,并使用自定义基础 URL。

添加网关提供商

  1. 创建一个名称不属于内置项的提供商(例如 acme-openai-gw)。openai 或 anthropic 等内置名称为保留名称。
  2. 选择标准(OpenAI 兼容)类型并填写 自定义 API 端点(base URL)——例如 https://gateway.example.com/v1。对于 Entity Enricher 没有内置客户端的任何提供商,此字段为必填。
  3. 将网关的密钥添加为该提供商的组织密钥(API Keys → AI Provider Keys),以便按组织计费和轮换。
  4. 添加网关所提供的模型。模型标识符会原样发送,因此必须与网关的预期完全一致。

须知

  • 内置提供商会隐藏端点字段。Anthropic、OpenAI、Mistral 以及其他已识别的提供商已知道各自的端点,因此无需配置。如果某个自定义提供商之后变为内置,其已存储的端点仍会保持可见,以便你清除它。
  • 仅限公开 HTTPS。 端点必须是公开的 https:// URL。环回地址和私有网段(localhost、 10.x、 192.168.x)会被拒绝,以防止 SSRF — 自托管服务器必须能通过互联网访问。对于本地 Ollama,请改用专用的 Ollama 隧道。
  • OpenAI 兼容的传输格式。 对自定义提供商的调用会通过 OpenAI 兼容的 API 路由,因此该端点必须支持 OpenAI /v1 协议(chat completions、/models)。
  • 测试连接会探测 {endpoint}/models 以在您运行 enrichment 前验证密钥和基础 URL。

速率预算与并发(按密钥)

使用 API 密钥发出的每一次调用都会控制在提供商授予该密钥的预算之内——按模型区分的每分钟请求数和 token 数——因此扇出调用绝不会撞上 429 错误。该预算无需手动输入:它从提供商自己的响应头中读取;当提供商不声明任何限制时,则从一次拒绝中学习得出;万不得已时才由所有者手动输入。

  • 从提供商读取。Mistral、OpenAI、Azure、Groq、xAI、Anthropic 和 Cohere 会在每次响应中声明该密钥的限制;对某个模型的首次调用即可获知这些限制,后续调用将遵守它们。
  • 提供商不声明限制时自动学习。Google、DeepSeek、Moonshot、Z.AI、Together 和 Alibaba 不声明任何限制:一次拒绝会让系统学到一个预算,即最近一分钟已发送量的 80%,随后再缓慢回升。所有者也可以在 API 密钥页面手动输入规则。
  • 按密钥和模型分别限制。每个组织密钥以及共享的全局密钥都有各自的预算,且按模型区分——在 Mistral 上,同一个密钥可能在某个模型上允许每分钟 15 次请求,而在另一个模型上允许 1000 次。
  • 并发随之而定。进行中的调用数量由该预算和实测延迟推导得出。提供商的每个密钥最大并发调用数设置仅适用于那些从不返回 429、但在并行调用下会卡顿的目标,例如运行 Ollama 的笔记本电脑。
  • 按密钥可见。密钥上的速率限制操作会列出其规则、各条规则的来源,以及当前这一分钟的实时用量。能力探测还会将提供商声明的限制记录到模型表的 TPM 和 RPM 列中。

这与你套餐的最大并发作业数限制不同,后者限制的是整个 organization 在所有 provider 上同时运行的 enrichment 作业数量。

模型能力

每个模型都会追踪其能力,并在模型选择器中以图标形式显示:

能力描述
视觉可处理图像和视觉输入
工具调用支持函数调用 / 工具使用
音频输入可处理音频输入
PDF 输入可处理 PDF 文档
提示词缓存支持 prompt 缓存以降低成本
推理扩展思考/思维链能力
嵌入向量把文本转成向量而不是作答——语义 ID 正是靠它解析的。嵌入模型自成一类,有各自的向量维度,且绝不会出现在增强模型的选择器中

让平台挑选模型

指定模型是可选的。增强、架构生成和样本生成都接受 auto——并将未指定的模型视为 auto——它会在作业启动时于服务器端按任务解析。运行结果会报告实际选用的模型,因此自动绝不意味着不透明。

1. 你所在组织置顶的默认模型

所有者可在 设置 → 组织 → 模型选择 中为每个任务固定首选模型。若当前任务已设置,则以该设置为准。

2. 否则选用实测表现最佳的模型

若未固定指定模型,则选择在你的评分源基准测试中综合得分最高的模型 —— 即你在自己的模式上对质量、速度和成本的实测结果。若完全没有评分源,请求会被拒绝,而不会靠猜测执行。

3. 再按任务需求进一步收窄

开启网页搜索,或附加必须原样发送的文档,会把候选范围限制在真正支持这些能力的模型上——若没有模型符合条件,你会收到明确的错误提示,而不是被悄悄降级。

  1. 1质量、速度和成本,依据你自己的基准测试评分
  2. 2保持为“自动”,或为此任务固定一个模型
  3. 3每个任务都会显示“自动”当前解析到的模型及其评分
权重按任务分别设置,因此 Schema 生成可以坚持质量优先,而富化则更看重成本。显示为短横线而非分数的模型从未在此处被测量,自动模式也永远不会选中它。

模型也可以只在某一项任务中被禁用,而无需整体停用:某个富集效果良好但生成架构较差的模型,可以仅在架构生成和样本生成的选择器中隐藏,范围可以是你的组织,也可以由管理员设为全局。它在其他所有场景中依然完全可用——比下面的停用更温和。

自动价格同步

系统管理员

通过从外部注册表同步来保持模型定价最新。同步过程会自动检测新模型、价格变化以及已移除的模型。

LiteLLM 注册表

默认定价来源。从 GitHub 上由 LiteLLM 社区维护的注册表获取真实的 API 模型名称、定价、上下文长度和功能。

覆盖约 30 个提供商。不包含显示名称、基准测试或生成速度。

PricePerToken

来自 pricepertoken.com 的替代数据源。包含显示名称、基准测试(编程和数学得分)以及生成速度(每秒 token 数)。

覆盖约 20 个提供商。提供比 LiteLLM 更丰富的元数据。

Z.AI

GLM 模型标识符的官方认证目录,定价直接解析自 Z.AI 文档,能力差异也在此处研究整理。

替代此前从 LiteLLM 和 PricePerToken 导入的 Z.AI 条目。

同步流程

  1. 试运行预览——在应用更改前查看将发生的变化。查看新模型、价格更新和停用项。
  2. 按来源匹配——每个来源仅影响该来源的模型。手动模型永远不会被改动。
  3. 稳定的同步键——model 通过稳定标识符匹配,而非按名称。您可以重命名 model 而不会破坏同步。
  4. 事务式应用——所有变更在单个数据库事务中应用,以保证一致性。
  5. 自动创建提供商 — 如果同步的模型属于未知提供商,则自动创建该提供商。

模型健康检查

通过运行最小化的健康检查提示词,主动验证模型是否可访问。这能在用户于富集过程中遇到错误之前捕获失效的模型。

通过模型成功响应。如果之前被自动停用,则会重新激活。
未找到模型返回“未找到”错误。系统会自动将其停用,以防止未来失败。
其他错误身份验证错误、超时或速率限制会被报告,但不会触发停用。

健康检查可针对所有模型、某个特定 provider 的模型或单个模型运行。结果通过 SSE 实时传输,并以进度条显示通过/失败数量。

自动停用

当扩充调用因“未找到模型”错误而失败时,该模型会被自动停用,以防止重复失败。这会在正常扩充操作期间实时发生。

停用原因设置者已自动重新激活?
未找到模型富化错误、健康检查,或没有任何路由响应的能力探测是(通过定价同步或校验)
无结构化输出能力探测:任何可达路由上既无工具通道,也无原生通道是,但仅通过后续的能力探测确定
同步已移除定价同步(模型已消失)是(如果 model 重新出现在注册表中)
手动界面中的管理员开关否(仅手动重新激活)

使用你自己的密钥(BYOK)

组织可以配置自己的 LLM 提供商 API 密钥,以实现独立计费和使用情况跟踪。系统采用两级密钥解析并结合 LRU 选择:

第 1
组织密钥池

在“API 密钥”页面为各组织配置密钥。支持每个 provider 配置多个密钥并进行 LRU 轮换。使用 Fernet 加密。

第 2
全局密钥池

由管理员管理的全系统范围密钥。在所有 organization 之间共享。同时支持每个 provider 配置多个密钥并采用 LRU 轮换。

每次增强都会记录所使用的密钥,因此您可以按密钥跟踪成本。密钥支持健康检查和使用次数统计。在同一密钥池中,系统会优先选用上次使用时间最早的已启用密钥;只有当您手动禁用时,密钥才会退出轮换,因此提供商报错绝不会悄悄让某个密钥停止服务。请在 API 密钥指南中了解如何管理密钥。

导入和导出

将您的全部提供商和模型配置导出为 JSON,以便备份或转移到其他实例。导入始终为 upsert 操作:现有的提供商和模型按名称匹配并就地更新,新增的则会被添加——不会删除任何内容。

导出内容包括提供商设置、模型配置、定价、功能以及规范的模型规格——但绝不包含 API 密钥,密钥单独存储。导入后需另行配置 API 密钥。系统管理员可备份完整的全局目录;组织所有者只能导出和导入自己组织的提供商和模型——共享的全局目录无法通过导入创建或编辑。

公开模型目录

模型页面向所有人展示全局目录:厂商定价、实测能力,以及每个模型在作为全局评分来源发布的基准测试场景中取得的分数。该页面读取两个静态 JSON 文件,它们由每晚的模型刷新重写,你可以下载并复用。提供商已不再提供的模型(因“未找到模型”而停用)不会列出;目录中的其他所有模型均会列出。

文件

  • /data/models.json — 该表格:每个提供商 × 模型对应一条记录,并附有提供商、场景和规格的查找表。
  • /data/benchmarks.json — 每一项公开基准测试结果,按模型键分组。

两者均带有 ETag 和一小时公共缓存,并在客户端支持时使用 gzip 压缩。只要发生需要使用方适配的变更,version 字段便会递增。

models.json 的字段

generated_at, counts, default_weights文件的写入时间、包含的模型、提供商和场景数量,以及每个总分背后的质量/速度/成本配比(百分比)。
providers[], scenarios[], specs{}查找表:模型按索引引用提供商和场景;specs 是该权重的公开基准测试分数(intelligence、coding、math,其余归入 extra),以规范键为索引键,因此同一模型的各经销商可共享这些分数。
models[].key, model, display_name, canonical_keyAPI 所接受的复合键(provider::model)、原始模型 id、其标签,以及跨提供商的统一标识。
models[].pricing厂商标价(美元/每百万 token):input、output、cache_read、cache_write、cache_write_1h、reasoning_output,以及 web_search_per_query 及其单位。均未计入任何套餐佣金。
models[].capabilities[]生效的标志:vision、pdf_input、audio_input、audio_output、video_input、tool_calls、tool_choice、response_schema、strict_structured_output、reasoning、reasoning_effort、web_search、prompt_caching、embeddings、requires_streaming。缺失的标志表示 false 或未测量。
models[].context_length, max_input_tokens, max_output_tokens, deprecation_date, latency限制、供应商公布的退役日期,以及抓取到的延迟数据(每秒 token 数、首 token 时间)。
models[].enrichment_capable, disabled_tasks[]模型是否具备结构化输出通道,以及应用从不为其提供该通道的任务(分类和仲裁需要工具调用;模式与示例生成遵循模式生成门控)。
models[].scores{task}按任务类型(enrichment、schema_generation、sample_generation)列出:该任务所有公开场景的质量、速度和成本平均值、默认权重下的综合分数,以及场景索引。速度和成本是相对于同一场景下的其他模型而言的。

质量、速度和成本分数的计算方式详见基准测试评分。

后续步骤