Пошаговое описание того, как Entity Enricher обрабатывает одну сущность — от входных данных через классификацию и параллельное выполнение моделей до структурированного вывода.
Откройте страницу Workflow Editor и настройте свой enrichment. Пошаговый мастер рабочего процесса проведёт вас по этапам конвейера: Sample Data, Schema, Enrichment и Results, — а также по шагу Database Ready, когда schema связана с database sync, подтверждая, что изменения запуска поставлены в очередь для вашей базы данных (или объясняя, почему в сохранении было отказано).
Вставьте образец JSON для автоматической генерации схемы, затем изучите интерактивное дерево свойств. Редактируйте свойства, добавляйте области экспертизы и отмечайте поля как ключи поиска или сохраняемые.
Настройте параметры обогащения (стратегию, модели, языки, классификацию, а также схему ответа и переключатели строгого структурированного вывода) и заполните ключи поиска сущности (название, веб-сайт, страна и т. д.) для её идентификации.
Показывает прогресс и результаты в реальном времени для каждой модели. При использовании нескольких моделей появляется кнопка «Объединить результаты» для слияния.
Некоторые запросы в принципе не могут дать пригодный результат, и дешевле всего выяснить это до первого обращения к LLM. Поэтому заранее проверяются два контракта.
Схема объявляет, что должны содержать её входные данные: ключевые поля, указывающие, какая это сущность, ключ у каждого элемента передаваемого вами массива и значение для каждого поля, помеченного как preserve (нельзя сохранить то, что не было передано). Запрос, в котором чего-то из этого нет, отклоняется единственной ошибкой, перечисляющей сразу все нарушения, — вместе с полным контрактом схемы, чтобы вы исправили всё за один проход, а не выясняли требования по одному отказу за раз. Контракт публикуется у каждой сохранённой схемы, так что клиент может проверить данные до отправки.
Массив, элементы которого передали вы, обогащается ровно так: модель дополняет то, что знает о каждом элементе, и не может ни добавить, ни удалить ни одного. Отправили пять позиций — получите пять. Элемент, который модель не распознала, вставляется обратно без изменений, а не теряется; придуманный ею элемент отбрасывается. Массивы, оставленные пустыми, остаются открытыми — именно там модель и находит новые факты, в этом весь смысл.
Если вы выбрали модель классификации, сначала выполняется быстрый и недорогой вызов LLM, чтобы проверить соответствие сущности типу схемы. Это позволяет не тратить токены на обогащение, когда сущность не соответствует. Подробнее в документации по классификации.
Каждая выбранная модель обрабатывает сущность по указанной вами стратегии — или, по умолчанию, по стратегии, выбранной автоматически на основе структуры вашей схемы, о чём запуск сообщает при старте. Если выбрано несколько моделей, они выполняются параллельно по провайдерам (Claude и GPT-4 работают одновременно), а модели одного провайдера — последовательно, чтобы соблюдать лимиты частоты запросов.
Каждый ответ LLM проверяется по вашей schema в реальном времени. Когда вывод не соответствует ожидаемым типам или ограничениям, система автоматически отправляет ошибки обратно в LLM для исправления.
До 5 автоматических повторных попыток на каждый вызов LLM. Каждая повторная попытка содержит конкретную ошибку валидации, поэтому LLM точно знает, что исправлять, — и починка точечная: заново запрашиваются только те листья, которые вернулись неверными, а не весь ответ.
Обратите внимание, чего в этом списке нет: значение, которое модель не смогла определить, — это не ошибка, требующая повтора. Любое поле может вернуться отсутствующим, а модель прямо указывает, что ей не удалось найти, поэтому «неизвестно» — это ответ, а не сбой. Допустимо ли отсутствующее значение, решается позже, при допуске сущности в вашу базу данных, — а не за счёт того, что модель заставляют гадать.
Два необязательных переключателя просят провайдера ограничить вывод до того, как он вернётся, чтобы изначально приходилось исправлять меньше ответов. Оба применяются только к моделям, которые их поддерживают; всё остальное по-прежнему опирается на приведённый выше цикл проверки и повторов.
Entity Enricher использует Server-Sent Events (SSE) для потоковой передачи прогресса в реальном времени. Вам не нужно ждать завершения всех моделей — результаты появляются постепенно, по мере того как завершается каждая область экспертизы или модель.
Каждая model получает собственную панель результатов, показывающую структурированный вывод JSON, значки прогресса по каждой expertise, использование токенов, стоимость и время обработки. При использовании стратегии multi-expertise значки expertise обновляются в реальном времени по мере завершения каждого домена.
При использовании стратегии множественной экспертизы одни экспертизы могут завершиться неудачно, а другие успешно. Вместо того чтобы отбросить всё, Entity Enricher возвращает объединённый результат от успешных экспертиз со статусом «Частично». Затем вы можете повторить только неудавшиеся экспертизы, не запуская всё обогащение заново.
После завершения обогащения ваши результаты сохраняются на странице «История» для дальнейшего использования. Если вы использовали несколько моделей, вы можете объединить результаты с помощью слияния нескольких моделей.