Los escenarios de benchmark le permiten comparar modelos LLM en una tarea de enriquecimiento real y repetible —de igual a igual— capturando la salida y el coste total de cada modelo para que pueda elegir el modelo adecuado para la tarea.
Los modelos difieren enormemente en precisión, fiabilidad de la salida estructurada y precio. En lugar de adivinar, un escenario de benchmark ejecuta el mismo esquema y la misma entidad a través de muchos modelos a la vez y registra lo que cada uno produjo y cuánto costó. Usted compara con datos objetivos y luego fija el modelo más económico que cumpla su nivel de calidad.
Un escenario de benchmark es una prueba de modelos guardada y reutilizable. Puede evaluar el enriquecimiento (un esquema, una entrada de entidad fija, una estrategia de enriquecimiento, idiomas, los conmutadores de response-schema / strict-structured-output y cualquier adjunto), la generación de muestras (una descripción de tipo de entidad que cada modelo convierte en un JSON de ejemplo) o la generación de esquemas (un JSON de muestra fijo que cada modelo convierte en un esquema). También contiene su referencia dorada y cómo se califican los resultados frente a ella (un modelo juez, un modelo de embeddings y un umbral de rigurosidad; la generación de muestras se puntúa con rúbrica únicamente por el juez, sin referencia). Defínalo una vez y reutilícelo en todos los modelos que quiera comparar.
Una vez que el escenario tenga una referencia verificada, ejecútelo contra los modelos activos de un proveedor o todos los modelos activos a la vista. Cada modelo se enriquece de forma independiente —sin fusión—, por lo que obtiene un resultado limpio y comparable por modelo. El progreso se transmite en vivo, y cada resultado exitoso se puntúa automáticamente contra la referencia a medida que finaliza la ejecución. Si el escenario incluye adjuntos binarios, active Omitir modelos que no pueden leer los adjuntos y los modelos que carecen de la capacidad de archivo requerida se informan como Omitidos en lugar de producir fallos garantizados.
Cada ejecución se guarda con su salida estructurada, estado de éxito, recuentos de tokens, tiempo de procesamiento y coste total facturado. Expanda cualquier fila para inspeccionar la salida JSON o saltar al registro de enriquecimiento subyacente.
Volver a ejecutar un escenario en el mismo modelo sobrescribesu resultado anterior, por lo que la tabla siempre refleja la última ejecución. Si edita la configuración de un escenario, los resultados anteriores se marcan como obsoletos hasta que los vuelva a ejecutar. Ponga Ejecuciones por modelo en 2 o 3 y cada modelo se evaluará en el benchmark ese número de veces: la tabla conserva la media de coste, calidad y velocidad, más una dispersión de consistencia (los modelos varían de una ejecución a otra), con aproximadamente ese múltiplo de créditos. Una dispersión amplia suele deberse a propiedades del esquema que plantean más de una pregunta, y no al modelo; la comprobación de ambigüedad las detecta y las corrige.
La tabla de resultados está diseñada para la comparación. Una franja de resumen en la parte superior destaca la tasa de éxito y los modelos más económico y más rápido que tuvieron éxito. Cada columna —modelo, estado, estrategia, coste, tokens y tiempo— es ordenable, de modo que un clic clasifica los modelos por precio o latencia. Filtre por nombre de modelo, estado o estrategia para acotar la vista, y expanda cualquier fila para leer la salida estructurada completa o abrir el registro de enriquecimiento subyacente.
Un benchmark vale más que una tabla que se lee una sola vez. Marque un escenario como fuente de puntuación y sus resultados por modelo empezarán a guiar la plataforma: los modelos muestran las puntuaciones que usted ha medido como distintivos en todos los selectores, los selectores se ordenan por ellas y la selección automática de modelo resuelve al modelo que sus propias mediciones sitúan más alto para esa tarea. Marque varios y las puntuaciones se promedian: así, “mejor modelo” significa mejor en sus esquemas, no en un ranking público. Los administradores del sistema pueden publicar un escenario global como alternativa para las organizaciones que no tengan ninguno propio.
Usted decide qué pesa en «lo mejor»: calidad, velocidad y coste se combinan según una proporción configurada por tipo de escenario en Ajustes → Organización → Valores predeterminados (cada conjunto suma 100, un tercio cada uno por defecto). Un equipo que optimiza el coste por lote y otro que optimiza la calidad de las respuestas seleccionarán automáticamente modelos distintos a partir del mismo benchmark, y ambos con razón.
La evaluación con benchmarks es iterativa. Marque filas con las casillas (mayús-clic para seleccionar un rango) y luego use el menú ··· para actuar sobre un subconjunto sin volver a ejecutarlo todo:
Cada escenario contiene un resultado de referencia —la salida esperada para su entidad— y un escenario solo se puede someter a benchmark una vez que esa referencia esté verificada. Hasta entonces no aparecerá en ningún menú de ejecución. La referencia es la base para juzgar la calidad: cuánto se acerca cada modelo, campo por campo, y (para listas como el reparto de una película) cuántos de los elementos correctos encontró realmente. Usted la define —junto con el modelo juez, el modelo de embeddings y el nivel de rigor usado para calificarla— directamente en el editor de escenarios.
Constrúyalo de dos maneras. Genérelo: adjunte un documento que contenga los valores correctos (una hoja de datos, una página oficial), active la búsqueda web y ejecute algunos modelos potentes: extraen la respuesta de su fuente en lugar de la memoria, de modo que el resultado se basa en la verdad, no en conjeturas. O pegue un resultado fiable que ya tenga. En cualquier caso, revisa el JSON, corrige lo que sea necesario y lo marca como verificado: una aprobación explícita de que esta es la respuesta de referencia.
Como la referencia está fundamentada y verificada por humanos una sola vez, sirve también como un patrón de confianza que reutiliza en cada modelo y en cada ejecución futura.
Los benchmarks se encuentran en Gestión de modelos → Benchmarks (disponible para propietarios y administradores de la organización). Cree y gestione escenarios allí, o inicie una ejecución desde cualquiera de estos cuatro lugares: el botón Evaluar modelos de la barra de herramientas (todos los modelos activos en la vista), la acción Evaluar modelos en la fila de cualquier proveedor (los modelos activos de ese proveedor), el menú desplegable Benchmark que aparece al seleccionar modelos en el panel Modelos (los modelos seleccionados), o la acción Evaluar modelo en la fila de un único modelo.
Los botones Run y Puntuar resultados de un escenario funcionan de forma incremental por defecto: solo afectan a los modelos que aún no tienen resultado más los resultados obsoletos (y las puntuaciones sin puntuar u obsoletas al puntuar). El cuadro de diálogo de confirmación le permite ampliar el alcance a todos los modelos activos para una reejecución completa, o restringirlo para excluir las entradas obsoletas. El filtro Modelos mostrados de la tabla de resultados también puede listar los modelos activos que aún no tienen benchmark.
Las ejecuciones de benchmark realizan llamadas reales al LLM y deducen créditos según el uso real, exactamente igual que un enriquecimiento normal. El cuadro de diálogo de confirmación le indica cuántos modelos está a punto de ejecutar antes de que se produzca cualquier gasto. Cada resultado guardado muestra su coste facturado, por lo que un benchmark sirve también como herramienta de comparación de costes.