LLM プロバイダーとモデルを管理し、外部レジストリからモデルを同期し、ヘルスチェックを実行し、独立した課金のために組織ごとの API キーを設定します。
Entity Enricher は幅広い LLM プロバイダーをサポートしています。各プロバイダーは、それぞれ個別の価格、機能、設定を持つ複数のモデルを持つことができます。
多くのチームは、LLMトラフィックを企業向けAIゲートウェイ、リージョナルエンドポイント、または組み込みではないプロバイダー(例: エンタープライズのLiteLLMプロキシ、Cloudflare AI Gateway、Alibaba DashScope(Qwenモデル用))経由でルーティングします。これらは、カスタムベースURLを持つ独自のStandard(OpenAI互換)プロバイダーとして追加します。
acme-openai-gw)。openaiや anthropicのような組み込み名は予約されています。 https://gateway.example.com/v1。このフィールドは、Entity Enricher に組み込みクライアントがないproviderの場合は必須です。 https:// URL である必要があります。SSRF を防ぐため、ループバックおよびプライベートレンジ(localhost、 10.x、 192.168.x)は拒否されます。セルフホストのサーバーはインターネット経由で到達可能でなければなりません。ローカルの Ollama の場合は、専用の Ollama トンネルを使用してください。/v1 プロトコル(チャット補完、/models)に対応している必要があります。 {endpoint}/modelsにプローブを送り、enrichmentを実行する前にキーとベースURLを検証します。API キーで行われるすべての呼び出しは、プロバイダーがそのキーに割り当てる予算(モデルごとの毎分のリクエスト数とトークン数)に合わせてペース調整されるため、並列展開しても 429 エラーになりません。この予算は手入力するものではありません。プロバイダー自身のレスポンスヘッダーから読み取り、プロバイダーが何も示さない場合は拒否から学習し、最後の手段としてオーナーが入力します。
これは、プランの最大同時実行ジョブ数の制限とは別のものです。この制限は、組織全体がすべてのプロバイダーにわたって一度に実行するエンリッチメントジョブの数を制限します。
各モデルはその機能を追跡し、モデルセレクターにアイコンとして表示します:
| 機能 | 説明 |
|---|---|
| ビジョン | 画像および視覚的な入力を処理できます |
| ツール呼び出し | 関数呼び出し / ツール利用に対応 |
| 音声入力 | 音声入力を処理できます |
| PDF 入力 | PDF文書を処理できます |
| promptキャッシュ | コスト削減のためのpromptキャッシュに対応 |
| 推論 | 拡張思考/思考連鎖(chain-of-thought)の機能 |
| 埋め込み | 回答する代わりにテキストをベクトルに変換します。セマンティックIDの解決に使われるものです。埋め込みモデルは独自のベクトルサイズを持つ独立したファミリーであり、エンリッチメントのモデル選択には表示されません |
モデルの指定は任意です。エンリッチメント、スキーマ生成、サンプル生成のいずれも auto を受け付け、モデルの指定を省略した場合も auto として扱います。これはジョブの開始時に、タスクごとにサーバー側で解決されます。実行結果には選択されたモデルが表示されるため、自動指定でも処理が不透明になることはありません。
オーナーは 設定 → 組織 → モデル選択 で、タスクごとに優先モデルを固定できます。対象のタスクに設定されている場合は、そちらが優先されます。
ピン留めがない場合は、スコアリングソースのベンチマーク(自分のスキーマで測定した品質・速度・コストの実測値)から総合スコアが最も高いモデルが選ばれます。スコアリングソースがまったくない場合は、推測せずにリクエストを拒否します。
Web 検索を有効にしたり、そのまま送信する必要のあるドキュメントを添付したりすると、候補は実際にそれを処理できるモデルに限定されます。該当するモデルがない場合は、黙って性能の低いモデルに切り替わるのではなく、明示的なエラーが返されます。
モデルは、無効化しなくても特定のタスクからのみ除外できます。エンリッチメントは得意でもスキーマ生成が苦手なモデルは、スキーマ生成とサンプル生成のピッカーからのみ非表示にできます(組織単位、または管理者によるグローバル設定)。それ以外の場所では引き続き完全に利用できます。以下の無効化よりも穏やかな手段です。
外部レジストリと同期して、モデルの料金を最新の状態に保ちます。同期処理では、新しいモデル、価格変更、削除されたモデルを自動的に検出します。
デフォルトの価格ソースです。実際のAPIモデル名、価格、コンテキスト長、機能を含む、LiteLLMのコミュニティが管理するレジストリをGitHubから取得します。
約30のproviderに対応。表示名、benchmark、生成速度は含まれません。
pricepertoken.com からの代替ソースです。表示名、ベンチマーク(コーディングおよび数学のスコア)、生成速度(1秒あたりのトークン数)が含まれます。
約20のproviderに対応。LiteLLMより豊富なメタデータを提供します。
GLM モデル識別子の公式認証済みカタログです。価格は Z.AI のドキュメントから直接解析され、機能面のギャップもそこで調査されています。
以前に LiteLLM および PricePerToken からインポートされた Z.AI のエントリを置き換えます。
最小限のヘルスチェックプロンプトを実行して、モデルに到達可能かどうかを事前に検証します。これにより、エンリッチメント中にユーザーがエラーに遭遇する前に、故障したモデルを検出できます。
ヘルスチェックは、すべてのモデル、特定のプロバイダーのモデル、または単一のモデルに対して実行できます。結果は SSE を介してリアルタイムでストリーミングされ、成功/失敗の件数を示すプログレスバーが表示されます。
enrichment呼び出しが「model not found」エラーで失敗すると、繰り返しの失敗を防ぐためにそのmodelは自動的に無効化されます。これは通常のenrichment処理中にリアルタイムで発生します。
| 無効化の理由 | 設定者 | 自動再有効化されましたか? |
|---|---|---|
| モデルが見つかりません | エンリッチメントのエラー、ヘルスチェック、またはどのルートも応答しない機能プローブ | はい(価格同期または検証による) |
| 構造化出力なし | 機能プローブ: 到達可能などのルートでも、ツールチャネルもネイティブチャネルも利用できません | はい(後続の機能プローブによってのみ) |
| 同期で削除済み | 料金の同期(モデルが消失しました) | はい(モデルがレジストリに再表示された場合) |
| 手動 | UIの管理者トグル | いいえ(手動での再有効化のみ) |
組織は独自の LLM provider API キーを設定して、請求と使用状況の追跡を個別に行えます。システムは LRU 選択による 2 層のキー解決を使用します:
API Keys ページで設定される organization ごとのキー。provider ごとに複数のキーを持ち、LRU ローテーションに対応します。Fernet で暗号化されます。
管理者が管理するシステム全体のキーです。すべての organization で共有されます。LRU ローテーションによる provider ごとの複数キーにも対応します。
各エンリッチメントはどのキーが使用されたかを記録するため、キーごとにコストを追跡できます。キーはヘルスチェックと使用回数カウンターに対応しています。プール内では、有効なキーのうち最終使用日時が最も古いものが次に選ばれます。キーがローテーションから外れるのは手動で無効化した場合のみで、プロバイダーのエラーによってキーが黙って停止されることはありません。キーの管理方法については API キーガイドをご覧ください。
プロバイダーとモデルの設定全体をJSONとしてエクスポートし、バックアップや別インスタンスへの移行に利用できます。インポートは常にアップサートです。既存のプロバイダーとモデルは名前で照合されてその場で更新され、新規のものは追加されます — 削除されるものはありません。
エクスポートにはプロバイダー設定、モデル構成、価格、機能、および正規モデル仕様が含まれますが、API キーは含まれません。API キーは別途保存されます。インポート後は API キーを別途設定してください。システム管理者はグローバルカタログ全体をバックアップします。組織のオーナーは自組織のプロバイダーとモデルのみをエクスポートおよびインポートでき、共有のグローバルカタログはインポートを通じて作成または編集することはできません。
モデルページでは、グローバルカタログをどなたにも公開しています。ベンダー価格、計測済みの機能、そしてグローバルスコアリングソースとして公開されているベンチマークシナリオで各モデルが獲得したスコアをご覧いただけます。このページは、夜間のモデル更新によって書き換えられる 2 つの静的な JSON ファイルを読み込んでおり、ダウンロードして再利用できます。プロバイダーが提供を終了したモデル(「model not found」として無効化されたもの)は除外され、カタログ内のその他のすべてのモデルが一覧表示されます。
/data/models.json — 表本体: プロバイダー × モデルごとに 1 エントリ。プロバイダー、シナリオ、スペックのルックアップテーブル付き。/data/benchmarks.json — すべての公開ベンチマーク結果を、モデルキーごとにグループ化したものです。どちらも ETag と 1 時間の公開キャッシュ付きで配信され、クライアントが対応している場合は gzip で圧縮されます。version フィールドは、利用側が対応を迫られる変更があるたびに増加します。
generated_at, counts, default_weightsファイルが書き込まれた日時、収録しているモデル・プロバイダー・シナリオの数、および総合スコアの基準となる品質 / 速度 / コストの配分(パーセント)です。providers[], scenarios[], specs{}ルックアップテーブルです。モデルはプロバイダーとシナリオをインデックスで参照します。specs はモデルウェイトの公開ベンチマークスコア(intelligence、coding、math、その他は extra 配下)で、正規キーをキーとしているため、同一モデルのリセラー間で共有されます。models[].key, model, display_name, canonical_keyAPI が受け付ける複合キー(provider::model)、生のモデル ID、そのラベル、およびプロバイダー横断の識別子です。models[].pricingトークン 100 万件あたりのベンダー定価(USD): input、output、cache_read、cache_write、cache_write_1h、reasoning_output、および単位付きの web_search_per_query。いずれもプラン手数料を含みません。models[].capabilities[]有効なフラグ: vision, pdf_input, audio_input, audio_output, video_input, tool_calls, tool_choice, response_schema, strict_structured_output, reasoning, reasoning_effort, web_search, prompt_caching, embeddings, requires_streaming。記載のないフラグは false または未計測です。models[].context_length, max_input_tokens, max_output_tokens, deprecation_date, latency各種上限、ベンダーが公表している場合は提供終了日、および収集したレイテンシ指標(1秒あたりのトークン数、最初のトークンまでの時間)です。models[].enrichment_capable, disabled_tasks[]モデルが構造化出力チャネルを備えているかどうか、およびアプリが構造化出力を提供しないタスク(分類と調停にはツール呼び出しが必要です。スキーマとサンプルの生成はスキーマ生成ゲートに従います)です。models[].scores{task}タスクタイプ(enrichment、schema_generation、sample_generation)ごとに、そのタスクの公開シナリオにおける品質・速度・コストの平均、デフォルトの重みによる総合スコア、シナリオのインデックスを示します。速度とコストは、同じシナリオ上の他のモデルとの相対値です。品質・速度・コストの各スコアの算出方法は Benchmark Scoring で説明しています。