Сценарии бенчмарка позволяют сравнивать модели LLM на реальной воспроизводимой задаче обогащения — на равных условиях — фиксируя выходные данные и общую стоимость каждой модели, чтобы вы могли выбрать подходящую модель для задачи.
Модели сильно различаются по точности, надёжности структурированного вывода и цене. Вместо догадок сценарий бенчмарка прогоняет одну и ту же схему и сущность через множество моделей одновременно и фиксирует, что выдала каждая и во сколько это обошлось. Вы сравниваете по фактам, а затем закрепляете самую дешёвую модель, которая соответствует вашей планке качества.
Сценарий бенчмарка — это сохранённый, переиспользуемый тест модели. Он может тестировать обогащение (схема, фиксированный ввод сущности, стратегия обогащения, языки, переключатели response-schema / strict-structured-output и любые вложения), генерацию образцов (описание типа сущности, которое каждая модель превращает в пример JSON) или генерацию схем (фиксированный образец JSON, который каждая модель преобразует в схему). Он также хранит свой эталон и то, как результаты оцениваются относительно него (модель-судья, модель эмбеддингов и порог строгости — генерация образцов оценивается по рубрике только судьёй, без эталона). Определите его один раз и переиспользуйте для каждой модели, которую хотите сравнить.
Когда у сценария есть проверенный эталон, запустите его на активных моделях одного провайдера или на всех активных моделях в текущем виде. Каждая модель обогащается независимо — без слияния — поэтому вы получаете чистый результат по каждой модели для сравнения бок о бок. Прогресс отображается в реальном времени, и каждый успешный результат автоматически оценивается относительно эталона по завершении прогона. Если сценарий содержит бинарные вложения, включите Пропускать модели, которые не могут читать вложения, и модели без необходимой возможности работы с файлами отмечаются как Пропущено, а не выдают гарантированные ошибки.
Каждый запуск сохраняется со своим структурированным выводом, статусом успеха, числом токенов, временем обработки и полной выставленной стоимостью. Разверните любую строку, чтобы просмотреть вывод JSON или перейти к соответствующей записи обогащения.
Повторный запуск сценария на той же модели перезаписывает её предыдущий результат, поэтому таблица всегда отражает последний запуск. Измените конфигурацию сценария — и прежние результаты помечаются как устаревшие, пока вы их не перезапустите. Задайте Запусков на модель равным 2 или 3, и каждая модель будет протестирована столько же раз: в таблице сохраняется среднее по стоимости, качеству и скорости плюс разброс согласованности (модели различаются от запуска к запуску) — примерно при таком же кратном расходе кредитов. Широкий разброс часто объясняется не моделью, а свойствами схемы, которые задают больше одного вопроса, — проверка неоднозначности находит и устраняет их.
Таблица результатов создана для сравнения. Сводная полоса вверху выделяет процент успеха, а также самые дешёвые и самые быстрые модели, завершившиеся успешно. Каждый столбец — модель, статус, стратегия, стоимость, токены и время — можно сортировать, поэтому одним щелчком модели ранжируются по цене или задержке. Фильтруйте по названию модели, статусу или стратегии, чтобы сузить представление, и разверните любую строку, чтобы прочитать полный структурированный вывод или открыть исходную запись обогащения.
Бенчмарк — это больше, чем таблица, которую вы прочитали один раз. Отметьте сценарий как источник оценок, и его результаты по моделям начнут управлять платформой: модели несут ваши измеренные оценки в виде значков в каждом списке выбора, списки сортируются по ним, а автоматический выбор модели приводит к той модели, которую ваши собственные измерения ставят выше всех для этой задачи. Отметьте несколько — и оценки усредняются, так что «лучшая модель» означает лучшую на ваших схемах, а не в публичном рейтинге. Системные администраторы могут опубликовать глобальный сценарий как запасной вариант для организаций, у которых нет своего.
Что считать «лучшим», решаете вы: качество, скорость и стоимость смешиваются в пропорции, настраиваемой для каждого типа сценария в Настройки → Организация → Значения по умолчанию (в сумме 100, по умолчанию по трети на каждую). Команда, оптимизирующая стоимость пакета, и команда, оптимизирующая качество ответа, вполне закономерно автоматически выберут разные модели по одному и тому же бенчмарку.
Бенчмаркинг — итеративный процесс. Отмечайте строки флажками (shift-клик для выбора диапазона), затем используйте меню ···, чтобы работать с подмножеством, не запуская всё заново:
Каждый сценарий содержит эталонный результат — ожидаемый вывод для его сущности, — и сценарий можно протестировать бенчмарком только после того, как этот эталон проверен. До этого он не появится ни в одном меню запуска. Эталон — это базовая линия для оценки качества: насколько близко каждая модель подходит, поле за полем, и (для списков вроде состава актёров фильма) сколько верных элементов она действительно нашла. Вы задаёте его — вместе с моделью-судьёй, моделью эмбеддингов и строгостью оценки относительно него — прямо в редакторе сценария.
Создайте его двумя способами. Сгенерируйте: прикрепите документ с правильными значениями (техническое описание, официальную страницу), включите веб-поиск и запустите несколько сильных моделей — они извлекают ответ из вашего источника, а не из памяти, поэтому результат основан на истине, а не на догадках. Или вставьте уже имеющийся у вас проверенный результат. В любом случае вы просматриваете JSON, вносите исправления и отмечаете его как проверенный — явное подтверждение того, что это эталонный ответ.
Поскольку эталон обоснован и один раз проверен человеком, он служит надёжным ориентиром, который вы повторно используете для каждой модели и каждого будущего запуска.
Бенчмарки находятся в разделе Управление моделями → Бенчмарки (доступно владельцам и администраторам организации). Создавайте сценарии и управляйте ими там или запускайте прогон из любого из четырёх мест: кнопка Бенчмарк моделей на панели инструментов (все активные модели в представлении), действие Бенчмарк моделей в строке любого провайдера (активные модели этого провайдера), выпадающее меню Бенчмарк, которое появляется при выборе моделей на панели «Модели» (выбранные модели), или действие Бенчмарк модели в строке любой отдельной модели.
Кнопки Запуск и Оценить результаты в сценарии по умолчанию работают инкрементально — они охватывают только модели без результата и устаревшие результаты (а при оценивании — неоценённые или устаревшие оценки). Диалог подтверждения позволяет расширить область до всех активных моделей для полного перезапуска или сузить её, исключив устаревшие записи. Фильтр Показанные модели в таблице результатов также может отображать активные модели, которые ещё не были включены в бенчмарк.
Запуски бенчмарка совершают реальные вызовы LLM и списывают кредиты в зависимости от фактического использования, точно так же, как обычное обогащение. Диалог подтверждения сообщает, сколько моделей вы собираетесь запустить, прежде чем произойдут любые списания. Каждый сохранённый результат показывает свою оплаченную стоимость, поэтому бенчмарк также служит инструментом сравнения затрат.