Управление провайдерами и моделями LLM, синхронизация моделей из внешних реестров, запуск проверок работоспособности и настройка API-ключей для каждой организации для независимой тарификации.
Entity Enricher поддерживает широкий спектр провайдеров LLM. Каждый провайдер может иметь несколько моделей с индивидуальной ценой, возможностями и конфигурацией.
Многие команды направляют трафик LLM через корпоративный ИИ-шлюз, региональную конечную точку или провайдера, который не встроен, — например, корпоративный прокси LiteLLM, Cloudflare AI Gateway или Alibaba DashScope (для моделей Qwen). Вы добавляете их как отдельного провайдера Standard (OpenAI-compatible) с пользовательским базовым URL.
acme-openai-gw). Встроенные имена, такие как openai или anthropic, зарезервированы. https://gateway.example.com/v1. Это поле обязательно для любого провайдера, для которого в Entity Enricher нет встроенного клиента. https://. Loopback и частные диапазоны (localhost, 10.x, 192.168.x) отклоняются для предотвращения SSRF — сервер с собственным размещением должен быть доступен через интернет. Для локального Ollama используйте специальный туннель Ollama./v1 (chat completions, /models). {endpoint}/models, чтобы проверить ключ и базовый URL перед запуском обогащения.Каждый вызов с ключом API выполняется в пределах бюджета, который провайдер выделяет этому ключу, — запросы и токены в минуту для каждой модели, — поэтому массовые вызовы никогда не упираются в ошибки 429. Бюджет не вводится вручную: он считывается из заголовков ответов самого провайдера, определяется после отказа, если провайдер ничего не сообщает, или, в крайнем случае, задаётся владельцем.
Это отдельно от ограничения максимального числа одновременных задач вашего тарифа, которое ограничивает, сколько задач обогащения вся ваша организация выполняет одновременно по всем провайдерам.
Каждая model отслеживает свои возможности, которые отображаются в виде значков в селекторе model:
| Возможность | Описание |
|---|---|
| Зрение | Может обрабатывать изображения и визуальные данные |
| Вызовы инструментов | Поддерживает вызов функций / использование инструментов |
| Аудиовход | Может обрабатывать аудиоданные |
| Ввод PDF | Может обрабатывать документы PDF |
| Кэширование промптов | Поддерживает кэширование промптов для снижения затрат |
| Рассуждение | Возможности расширенного мышления / цепочки рассуждений |
| Эмбеддинги | Превращает текст в вектор вместо ответа — именно этим разрешаются семантические ID. Модели эмбеддингов образуют отдельное семейство со своим размером вектора и никогда не появляются в выборе модели для обогащения |
Указывать модель необязательно. Обогащение, генерация схемы и генерация примеров принимают значение auto — и считают пропущенную модель равной auto, — которое разрешается на сервере, отдельно для каждой задачи, в момент запуска. Прогон сообщает, какая модель была выбрана, поэтому автоматический выбор никогда не означает непрозрачный.
Владельцы могут закрепить предпочитаемую модель для каждой задачи в разделе Настройки → Организация → Выбор модели. Если она задана для текущей задачи, приоритет остаётся за ней.
Если закрепления нет, выбирается модель с лучшей сводной оценкой из ваших бенчмарков источника оценок — ваших собственных измерений качества, скорости и стоимости на ваших же схемах. Если источника оценок нет вовсе, запрос отклоняется, а не выполняется наугад.
Включение веб-поиска или прикрепление документа, который нужно передать как есть, ограничивает круг кандидатов моделями, которые действительно это умеют, — и если ни одна не подходит, вы получите явную ошибку вместо молчаливого понижения.
Модель можно также закрыть для одной задачи, не отключая её целиком: модель, которая хорошо обогащает, но плохо генерирует схемы, можно скрыть только из списков выбора для генерации схем и образцов — для вашей организации или глобально силами администратора. Во всём остальном она остаётся полностью доступной — это более мягкий инструмент, чем отключение ниже.
Поддерживайте актуальность цен на модели, синхронизируя их из внешних реестров. Процесс синхронизации автоматически обнаруживает новые модели, изменения цен и удалённые модели.
Источник цен по умолчанию. Загружает данные из поддерживаемого сообществом реестра LiteLLM на GitHub с реальными именами моделей API, ценами, длинами контекста и возможностями.
Охватывает ~30 провайдеров. Не включает отображаемые имена, бенчмарки и скорость генерации.
Альтернативный источник с pricepertoken.com. Включает отображаемые имена, бенчмарки (оценки по программированию и математике) и скорость генерации (токенов в секунду).
Охватывает ~20 провайдеров. Предоставляет более подробные метаданные, чем LiteLLM.
Официальный проверенный каталог идентификаторов моделей GLM, где цены взяты напрямую из документации Z.AI, а пробелы в возможностях изучены там же.
Заменяет записи Z.AI, ранее импортированные из LiteLLM и PricePerToken.
Заблаговременно проверяйте доступность моделей, запуская минимальный prompt проверки работоспособности. Это позволяет выявлять неработающие модели до того, как пользователи столкнутся с ошибками во время enrichment.
Проверки работоспособности можно запускать для всех моделей, моделей конкретного провайдера или отдельной модели. Результаты передаются в реальном времени через SSE с индикатором прогресса, показывающим количество успешных и неуспешных проверок.
Когда вызов обогащения завершается ошибкой «model not found», модель автоматически деактивируется, чтобы предотвратить повторные сбои. Это происходит в реальном времени во время обычных операций обогащения.
| Причина деактивации | Кем задано | Автоматически реактивировано? |
|---|---|---|
| Модель не найдена | Ошибки обогащения, проверки работоспособности или проверка возможностей, на которую не отвечает ни один маршрут | Да (через синхронизацию цен или валидацию) |
| Нет структурированного вывода | Проверка возможностей: ни инструментального, ни встроенного канала ни на одном доступном маршруте | Да, только по результатам последующей проверки возможностей |
| Удалено при синхронизации | Синхронизация тарифов (model исчезла) | Да (если модель снова появляется в реестре) |
| Вручную | Переключатель администратора в интерфейсе | Нет (только ручная повторная активация) |
Организации могут настроить собственные API-ключи LLM-провайдеров для независимого биллинга и учёта использования. Система использует двухуровневое разрешение ключей с выбором по принципу LRU:
Ключи для каждой организации, настраиваемые на странице API-ключей. Поддерживает несколько ключей на провайдера с ротацией LRU. Зашифровано с помощью Fernet.
Общесистемные ключи, управляемые администраторами. Общие для всех организаций. Также поддерживается несколько ключей на провайдера с ротацией LRU.
Каждое обогащение фиксирует, какой ключ был использован, поэтому вы можете отслеживать расходы по каждому ключу. Ключи поддерживают проверку работоспособности и счётчики использования. В пуле следующим выбирается включённый ключ с самой давней отметкой последнего использования; ключ выходит из ротации только тогда, когда вы отключаете его вручную, поэтому ошибка провайдера никогда не выводит ключ из работы незаметно. О том, как управлять ключами, читайте в руководстве API Keys.
Экспортируйте всю конфигурацию провайдеров и моделей в формате JSON для резервного копирования или переноса на другой экземпляр. Импорт всегда выполняется как upsert: существующие провайдеры и модели сопоставляются по имени и обновляются на месте, а новые добавляются — ничего не удаляется.
Экспорт включает настройки провайдеров, конфигурации моделей, цены, возможности и канонические спецификации моделей, но никогда — ключи API, которые хранятся отдельно. После импорта настройте ключи API отдельно. Системные администраторы создают резервную копию всего глобального каталога; владельцы организаций экспортируют и импортируют только провайдеров и модели своей организации — общий глобальный каталог нельзя создать или изменить через импорт.
Страница моделей открывает глобальный каталог для всех: цены вендоров, измеренные возможности и оценки, полученные каждой моделью в сценариях бенчмарка, которые опубликованы как глобальные источники оценок. Она читает два статических файла JSON, которые перезаписывает ночное обновление моделей и которые вы можете скачать и использовать повторно. Модель, которую провайдер больше не обслуживает (деактивированная как «model not found»), не показывается; все остальные модели каталога перечислены.
/data/models.json — таблица: по одной записи на провайдера × модель, со справочниками провайдеров, сценариев и характеристик./data/benchmarks.json — все результаты публичных бенчмарков, сгруппированные по ключу модели.Оба файла отдаются с ETag и часовым публичным кэшем, со сжатием gzip, если клиент его поддерживает. Поле version увеличивается при любом изменении, к которому потребителю придётся адаптироваться.
generated_at, counts, default_weightsКогда был записан файл, сколько в нём моделей, провайдеров и сценариев и в какой пропорции (в процентах) качество / скорость / стоимость формируют каждую общую оценку.providers[], scenarios[], specs{}Справочные таблицы: модели ссылаются на провайдера и сценарии по индексу; specs — это публичные оценки бенчмарков для весов (intelligence, coding, math и остальные в extra) с ключом по каноническому ключу, поэтому реселлеры одной модели используют их совместно.models[].key, model, display_name, canonical_keyСоставной ключ, который принимает API (provider::model), исходный id модели, её название и межпровайдерский идентификатор.models[].pricingПрайсовые цены вендора в USD за миллион токенов: input, output, cache_read, cache_write, cache_write_1h, reasoning_output, а также web_search_per_query с его единицей измерения. Без комиссии тарифного плана.models[].capabilities[]Действующие флаги: vision, pdf_input, audio_input, audio_output, video_input, tool_calls, tool_choice, response_schema, strict_structured_output, reasoning, reasoning_effort, web_search, prompt_caching, embeddings, requires_streaming. Отсутствующий флаг означает false или отсутствие измерения.models[].context_length, max_input_tokens, max_output_tokens, deprecation_date, latencyЛимиты, дата вывода модели из эксплуатации у поставщика (если объявлена) и собранные показатели задержки (токенов в секунду, время до первого токена).models[].enrichment_capable, disabled_tasks[]Есть ли у модели канал структурированного вывода в принципе и задачи, для которых приложение его никогда не предлагает (классификация и арбитраж требуют вызовов инструментов; генерация схемы и примеров подчиняется условию генерации схем).models[].scores{task}По типу задачи (enrichment, schema_generation, sample_generation): среднее качество, скорость и стоимость по публичным сценариям этой задачи, общая оценка при весах по умолчанию и индексы сценариев. Скорость и стоимость указаны относительно других моделей на том же сценарии.Как рассчитываются оценки качества, скорости и стоимости, описано в разделе Оценка бенчмарков.