Сценарии бенчмарка позволяют сравнивать модели LLM на реальной воспроизводимой задаче обогащения — на равных условиях — фиксируя выходные данные и общую стоимость каждой модели, чтобы вы могли выбрать подходящую модель для задачи.
Модели сильно различаются по точности, надёжности структурированного вывода и цене. Вместо догадок сценарий бенчмарка прогоняет одну и ту же схему и сущность через множество моделей одновременно и фиксирует, что выдала каждая и во сколько это обошлось. Вы сравниваете по фактам, а затем закрепляете самую дешёвую модель, которая соответствует вашей планке качества.
Сценарий бенчмарка — это сохранённый переиспользуемый тест модели. Он может тестировать обогащение (схема, фиксированные входные данные сущности, стратегия обогащения, языки, переключатели схемы ответа / строгого структурированного вывода и любые вложения), генерацию образцов (текстовый запрос образца, который каждая модель превращает в пример JSON) или генерацию схемы (от одного до двадцати фиксированных входных образцов одного типа сущности, которые каждая модель преобразует в схему; их вместе с самой схемой в качестве черновика эталона можно импортировать из сохранённой схемы). Он также хранит свой золотой эталон и правила оценивания результатов относительно него (модель-судья, модель эмбеддингов и порог строгости; генерация образцов оценивается по рубрике только судьёй, без эталона). Определите его один раз и переиспользуйте для каждой модели, которую хотите сравнить.
Когда у сценария есть проверенный эталон, запустите его на активных моделях одного провайдера или на всех активных моделях в текущем виде. Каждая модель обогащается независимо — без слияния — поэтому вы получаете чистый результат по каждой модели для сравнения бок о бок. Прогресс отображается в реальном времени, и каждый успешный результат автоматически оценивается относительно эталона по завершении прогона. Если сценарий содержит бинарные вложения, включите Пропускать модели, которые не могут читать вложения, и модели без необходимой возможности работы с файлами отмечаются как Пропущено, а не выдают гарантированные ошибки.
Каждый запуск сохраняется со своим структурированным выводом, статусом успеха, числом токенов, временем обработки и полной выставленной стоимостью. Разверните любую строку, чтобы просмотреть вывод JSON или перейти к соответствующей записи обогащения.
Повторный запуск сценария на той же модели перезаписывает её предыдущий результат, поэтому таблица всегда отражает последний запуск. Измените конфигурацию сценария — и прежние результаты помечаются как устаревшие, пока вы их не перезапустите. Задайте Запусков на модель равным 2 или 3, и каждая модель будет протестирована столько же раз: в таблице сохраняется среднее по стоимости, качеству и скорости плюс разброс согласованности (модели различаются от запуска к запуску) — примерно при таком же кратном расходе кредитов. Широкий разброс часто объясняется не моделью, а свойствами схемы, которые задают больше одного вопроса, — проверка неоднозначности находит и устраняет их.
Таблица результатов создана для сравнения. Сводная полоса вверху выделяет процент успеха, а также самые дешёвые и самые быстрые модели, завершившиеся успешно. Каждый столбец — модель, статус, стратегия, стоимость, токены и время — можно сортировать, поэтому одним щелчком модели ранжируются по цене или задержке. Фильтруйте по названию модели, статусу или стратегии, чтобы сузить представление, и разверните любую строку, чтобы прочитать полный структурированный вывод или открыть исходную запись обогащения.
Бенчмарк — это больше, чем таблица, которую вы прочитали один раз. Отметьте сценарий как источник оценок, и его результаты по моделям начнут управлять платформой: модели несут ваши измеренные оценки в виде значков в каждом списке выбора, списки сортируются по ним, а автоматический выбор модели приводит к той модели, которую ваши собственные измерения ставят выше всех для этой задачи. Отметьте несколько — и оценки усредняются, так что «лучшая модель» означает лучшую на ваших схемах, а не в публичном рейтинге. Системные администраторы могут опубликовать глобальный сценарий как запасной вариант для организаций, у которых нет своего.
Что считать «лучшим», решаете вы: качество, скорость и стоимость смешиваются в пропорции, настраиваемой для каждого типа сценария в Настройки → Организация → Значения по умолчанию (в сумме 100, по умолчанию по трети на каждую). Команда, оптимизирующая стоимость пакета, и команда, оптимизирующая качество ответа, вполне закономерно автоматически выберут разные модели по одному и тому же бенчмарку.
Бенчмаркинг — итеративный процесс. Выделяйте строки кликом (Ctrl/Cmd+клик — переключение, Shift+клик — диапазон, либо Выбрать все в меню ···), затем работайте с этим подмножеством, не перезапуская всё:
Каждый сценарий содержит эталонный результат — ожидаемый вывод для его сущности, — и сценарий можно протестировать бенчмарком только после того, как этот эталон проверен. До этого он не появится ни в одном меню запуска. Эталон — это базовая линия для оценки качества: насколько близко каждая модель подходит, поле за полем, и (для списков вроде состава актёров фильма) сколько верных элементов она действительно нашла. Вы задаёте его — вместе с моделью-судьёй, моделью эмбеддингов и строгостью оценки относительно него — прямо в редакторе сценария.
Создайте его двумя способами. Сгенерируйте: прикрепите документ с правильными значениями (техническое описание, официальную страницу), включите веб-поиск и запустите несколько сильных моделей — они извлекают ответ из вашего источника, а не из памяти, поэтому результат основан на истине, а не на догадках. Или вставьте уже имеющийся у вас проверенный результат. В любом случае вы просматриваете JSON, вносите исправления и отмечаете его как проверенный — явное подтверждение того, что это эталонный ответ.
Поскольку эталон обоснован и один раз проверен человеком, он служит надёжным ориентиром, который вы повторно используете для каждой модели и каждого будущего запуска.
Бенчмарки находятся в разделе Управление моделями → Бенчмарки(доступен владельцам и администраторам организации). Там можно создавать сценарии и управлять ими или запустить прогон на вкладке «Модели» кнопкой Бенчмарк моделейна панели инструментов: выберите сценарий, а затем укажите охват — выбранные вами провайдеры или модели (их количество показано на кнопке), модели, для которых бенчмарк ещё не запускался или запускался со старой конфигурацией сценария, либо все активные модели в текущем списке.
Кнопки Запуск и Оценить результаты в сценарии по умолчанию работают инкрементально — они охватывают только модели без результата и устаревшие результаты (а при оценивании — неоценённые или устаревшие оценки). Диалог подтверждения позволяет расширить область до всех активных моделей для полного перезапуска или сузить её, исключив устаревшие записи. Фильтр Показанные модели в таблице результатов также может отображать активные модели, которые ещё не были включены в бенчмарк.
Запуски бенчмарка совершают реальные вызовы LLM и списывают кредиты в зависимости от фактического использования, точно так же, как обычное обогащение. Диалог подтверждения сообщает, сколько моделей вы собираетесь запустить, прежде чем произойдут любые списания. Каждый сохранённый результат показывает свою оплаченную стоимость, поэтому бенчмарк также служит инструментом сравнения затрат.