管理 LLM 提供商和模型,从外部注册表同步模型,运行健康检查,并为各组织配置独立计费的 API 密钥。
Entity Enricher 支持广泛的 LLM 提供商。每个提供商可拥有多个模型,各自具有独立的定价、功能和配置。
许多团队会将 LLM 流量路由经过企业 AI 网关、区域端点或某个未内置的提供商 —— 例如企业级 LiteLLM 代理、Cloudflare AI Gateway 或 Alibaba DashScope(用于 Qwen 模型)。您可以将它们作为各自独立的标准(OpenAI 兼容)提供商添加,并使用自定义基础 URL。
acme-openai-gw)。openai 或 anthropic 等内置名称为保留名称。 https://gateway.example.com/v1。对于 Entity Enricher 没有内置客户端的任何提供商,此字段为必填。 https:// URL。环回地址和私有网段(localhost、 10.x、 192.168.x)会被拒绝,以防止 SSRF — 自托管服务器必须能通过互联网访问。对于本地 Ollama,请改用专用的 Ollama 隧道。/v1 协议(chat completions、/models)。{endpoint}/models 以在您运行 enrichment 前验证密钥和基础 URL。使用 API 密钥发出的每一次调用都会控制在提供商授予该密钥的预算之内——按模型区分的每分钟请求数和 token 数——因此扇出调用绝不会撞上 429 错误。该预算无需手动输入:它从提供商自己的响应头中读取;当提供商不声明任何限制时,则从一次拒绝中学习得出;万不得已时才由所有者手动输入。
这与你套餐的最大并发作业数限制不同,后者限制的是整个 organization 在所有 provider 上同时运行的 enrichment 作业数量。
每个模型都会追踪其能力,并在模型选择器中以图标形式显示:
| 能力 | 描述 |
|---|---|
| 视觉 | 可处理图像和视觉输入 |
| 工具调用 | 支持函数调用 / 工具使用 |
| 音频输入 | 可处理音频输入 |
| PDF 输入 | 可处理 PDF 文档 |
| 提示词缓存 | 支持 prompt 缓存以降低成本 |
| 推理 | 扩展思考/思维链能力 |
| 嵌入向量 | 把文本转成向量而不是作答——语义 ID 正是靠它解析的。嵌入模型自成一类,有各自的向量维度,且绝不会出现在增强模型的选择器中 |
指定模型是可选的。增强、架构生成和样本生成都接受 auto——并将未指定的模型视为 auto——它会在作业启动时于服务器端按任务解析。运行结果会报告实际选用的模型,因此自动绝不意味着不透明。
所有者可在 设置 → 组织 → 模型选择 中为每个任务固定首选模型。若当前任务已设置,则以该设置为准。
若未固定指定模型,则选择在你的评分源基准测试中综合得分最高的模型 —— 即你在自己的模式上对质量、速度和成本的实测结果。若完全没有评分源,请求会被拒绝,而不会靠猜测执行。
开启网页搜索,或附加必须原样发送的文档,会把候选范围限制在真正支持这些能力的模型上——若没有模型符合条件,你会收到明确的错误提示,而不是被悄悄降级。
模型也可以只在某一项任务中被禁用,而无需整体停用:某个富集效果良好但生成架构较差的模型,可以仅在架构生成和样本生成的选择器中隐藏,范围可以是你的组织,也可以由管理员设为全局。它在其他所有场景中依然完全可用——比下面的停用更温和。
通过从外部注册表同步来保持模型定价最新。同步过程会自动检测新模型、价格变化以及已移除的模型。
默认定价来源。从 GitHub 上由 LiteLLM 社区维护的注册表获取真实的 API 模型名称、定价、上下文长度和功能。
覆盖约 30 个提供商。不包含显示名称、基准测试或生成速度。
来自 pricepertoken.com 的替代数据源。包含显示名称、基准测试(编程和数学得分)以及生成速度(每秒 token 数)。
覆盖约 20 个提供商。提供比 LiteLLM 更丰富的元数据。
GLM 模型标识符的官方认证目录,定价直接解析自 Z.AI 文档,能力差异也在此处研究整理。
替代此前从 LiteLLM 和 PricePerToken 导入的 Z.AI 条目。
通过运行最小化的健康检查提示词,主动验证模型是否可访问。这能在用户于富集过程中遇到错误之前捕获失效的模型。
健康检查可针对所有模型、某个特定 provider 的模型或单个模型运行。结果通过 SSE 实时传输,并以进度条显示通过/失败数量。
当扩充调用因“未找到模型”错误而失败时,该模型会被自动停用,以防止重复失败。这会在正常扩充操作期间实时发生。
| 停用原因 | 设置者 | 已自动重新激活? |
|---|---|---|
| 未找到模型 | 富化错误、健康检查,或没有任何路由响应的能力探测 | 是(通过定价同步或校验) |
| 无结构化输出 | 能力探测:任何可达路由上既无工具通道,也无原生通道 | 是,但仅通过后续的能力探测确定 |
| 同步已移除 | 定价同步(模型已消失) | 是(如果 model 重新出现在注册表中) |
| 手动 | 界面中的管理员开关 | 否(仅手动重新激活) |
组织可以配置自己的 LLM 提供商 API 密钥,以实现独立计费和使用情况跟踪。系统采用两级密钥解析并结合 LRU 选择:
在“API 密钥”页面为各组织配置密钥。支持每个 provider 配置多个密钥并进行 LRU 轮换。使用 Fernet 加密。
由管理员管理的全系统范围密钥。在所有 organization 之间共享。同时支持每个 provider 配置多个密钥并采用 LRU 轮换。
每次增强都会记录所使用的密钥,因此您可以按密钥跟踪成本。密钥支持健康检查和使用次数统计。在同一密钥池中,系统会优先选用上次使用时间最早的已启用密钥;只有当您手动禁用时,密钥才会退出轮换,因此提供商报错绝不会悄悄让某个密钥停止服务。请在 API 密钥指南中了解如何管理密钥。
将您的全部提供商和模型配置导出为 JSON,以便备份或转移到其他实例。导入始终为 upsert 操作:现有的提供商和模型按名称匹配并就地更新,新增的则会被添加——不会删除任何内容。
导出内容包括提供商设置、模型配置、定价、功能以及规范的模型规格——但绝不包含 API 密钥,密钥单独存储。导入后需另行配置 API 密钥。系统管理员可备份完整的全局目录;组织所有者只能导出和导入自己组织的提供商和模型——共享的全局目录无法通过导入创建或编辑。
模型页面向所有人展示全局目录:厂商定价、实测能力,以及每个模型在作为全局评分来源发布的基准测试场景中取得的分数。该页面读取两个静态 JSON 文件,它们由每晚的模型刷新重写,你可以下载并复用。提供商已不再提供的模型(因“未找到模型”而停用)不会列出;目录中的其他所有模型均会列出。
/data/models.json — 该表格:每个提供商 × 模型对应一条记录,并附有提供商、场景和规格的查找表。/data/benchmarks.json — 每一项公开基准测试结果,按模型键分组。两者均带有 ETag 和一小时公共缓存,并在客户端支持时使用 gzip 压缩。只要发生需要使用方适配的变更,version 字段便会递增。
generated_at, counts, default_weights文件的写入时间、包含的模型、提供商和场景数量,以及每个总分背后的质量/速度/成本配比(百分比)。providers[], scenarios[], specs{}查找表:模型按索引引用提供商和场景;specs 是该权重的公开基准测试分数(intelligence、coding、math,其余归入 extra),以规范键为索引键,因此同一模型的各经销商可共享这些分数。models[].key, model, display_name, canonical_keyAPI 所接受的复合键(provider::model)、原始模型 id、其标签,以及跨提供商的统一标识。models[].pricing厂商标价(美元/每百万 token):input、output、cache_read、cache_write、cache_write_1h、reasoning_output,以及 web_search_per_query 及其单位。均未计入任何套餐佣金。models[].capabilities[]生效的标志:vision、pdf_input、audio_input、audio_output、video_input、tool_calls、tool_choice、response_schema、strict_structured_output、reasoning、reasoning_effort、web_search、prompt_caching、embeddings、requires_streaming。缺失的标志表示 false 或未测量。models[].context_length, max_input_tokens, max_output_tokens, deprecation_date, latency限制、供应商公布的退役日期,以及抓取到的延迟数据(每秒 token 数、首 token 时间)。models[].enrichment_capable, disabled_tasks[]模型是否具备结构化输出通道,以及应用从不为其提供该通道的任务(分类和仲裁需要工具调用;模式与示例生成遵循模式生成门控)。models[].scores{task}按任务类型(enrichment、schema_generation、sample_generation)列出:该任务所有公开场景的质量、速度和成本平均值、默认权重下的综合分数,以及场景索引。速度和成本是相对于同一场景下的其他模型而言的。质量、速度和成本分数的计算方式详见基准测试评分。