基准测试场景让您可以在真实、可重复的丰富化任务上对 LLM 模型进行同类比较,捕获每个模型的输出和总成本,以便为任务选择合适的模型。
不同模型在准确性、结构化输出可靠性和价格上差异巨大。与其靠猜测,基准测试场景会将同一个模式和实体同时交由多个模型处理,并记录每个模型的产出及其成本。你可以基于证据进行比较,然后锁定满足你质量标准的最便宜模型。
基准测试场景是一个已保存、可重用的模型测试。它可以对富集(一个模式、固定的实体输入、富集策略、语言、response-schema / strict-structured-output 开关,以及任意附件)、样本生成(每个模型将一段实体类型描述转换为示例 JSON)或模式生成(每个模型将固定的示例 JSON 转换为模式)进行基准测试。它还保存了自己的黄金参考以及如何据此对结果评分(一个评审模型、一个嵌入模型和一个严格度阈值——样本生成仅由评审模型按评分标准打分,无需参考答案)。只需定义一次,即可在你想比较的每个模型上重复使用。
一旦场景拥有已验证的参考,即可针对某个提供商的活跃模型或视图中的所有活跃模型运行它。每个模型都会独立进行丰富化——不做融合——因此你会得到每个模型清晰的并排结果。进度会实时流式显示,运行结束时,每个成功的结果都会自动根据参考进行评分。如果场景带有二进制附件,请启用跳过无法读取附件的模型,缺少所需文件能力的模型会被报告为已跳过,而不是产生必然的失败。
每次运行都会保存其结构化输出、成功状态、令牌数、处理时间以及计费总成本。展开任意一行即可查看 JSON 输出,或跳转到底层的扩充 record。
在同一模型上重新运行场景会覆盖它此前的结果,因此表格始终反映最近一次运行。修改场景配置后,较早的结果会被标记为已过期,直到你重新运行为止。将每个模型运行次数设为 2 或 3,每个模型就会被基准测试相应的次数——表格会保留成本、质量和速度的平均值,外加一致性离散度(模型每次运行都会有所不同),积分消耗也大致按该倍数增加。离散度过大往往并非源于模型,而是源于同时提出多个问题的架构属性——歧义检查能找出并修正它们。
结果表专为对比而设计。顶部的汇总条会突出显示成功率以及成功 model 中最便宜和最快的 model。每一列——model、状态、策略、成本、token 和耗时——都可排序,因此一次点击即可按价格或延迟对 model 排序。可按 model 名称、状态或策略筛选以缩小视图范围,展开任意行即可阅读完整的结构化输出或打开底层的 enrichment record。
基准测试的价值远不止一张只看一次的表格。把某个场景标记为评分来源,它的各模型结果就会开始驱动整个平台:模型会在每个选择器中以徽章形式带上你测得的分数,选择器按分数排序,自动模型选择也会解析为你自己的测量结果中该任务得分最高的模型。标记多个场景时分数取平均——因此“最佳模型”指的是在你的架构上最佳,而不是在公开排行榜上最佳。系统管理员可以发布一个全局场景,作为没有自有场景的组织的回退选项。
“最佳”如何权衡由你决定:质量、速度和成本按各场景类型配置的比例混合,可在设置 → 组织 → 默认值中设置(每组合计为 100,默认各占三分之一)。以批量成本为优化目标的团队和以回答质量为优化目标的团队,从同一份基准测试中自动选出不同的模型,是完全合理的。
基准测试是迭代式的。用复选框勾选行(按住 Shift 点击可选择一段范围),然后使用 ··· 菜单 对子集进行操作,而无需重新运行所有内容:
每个 scenario 都持有一份参考结果——即其 entity 的预期输出——只有当该参考结果通过验证后,scenario 才能进行基准测试。在此之前,它不会出现在任何运行菜单中。参考结果是评判质量的基准:衡量每个模型逐字段的接近程度,以及(对于电影演员阵容这类列表)它实际找出了多少正确项。你可以在 scenario 编辑器中直接设定它——以及用于对照评分的评判模型、嵌入模型和严格程度。
有两种构建方式。生成:附上包含正确值的文档(数据表、官方页面),开启网络搜索,并运行几个强大的模型——它们会从您的来源而非记忆中提取答案,因此结果基于事实,而非猜测。或者粘贴一份您已有的已知正确结果。无论哪种方式,您都可以审阅 JSON、修正任何内容,并将其标记为已验证——明确确认这就是标准答案。
由于参考基准已经过实证并经人工核对一次,它同时可作为可信的标尺,在每个模型和未来每次运行中重复使用。
基准测试位于 模型管理 → 基准测试(组织所有者和管理员可用)。可在此创建和管理场景,或从以下四个位置之一启动运行:工具栏中的 基准测试模型 按钮(视图中所有活跃模型)、任意提供商行上的 基准测试模型 操作(该提供商的活跃模型)、在“模型”面板中选择模型时出现的 基准测试 下拉菜单(选定的模型),或任意单个模型行上的 基准测试模型 操作。
场景上的运行和评分结果按钮默认按增量方式工作——它们仅针对尚无结果的模型以及过期结果(评分时还包括未评分或过期的评分)。确认对话框可让你将范围扩大到每个活动模型以进行完整重跑,或缩小范围以排除过期条目。结果表的显示的模型筛选器还可以列出尚未基准测试的活动模型。
基准测试运行会进行真实的 LLM 调用,并根据实际用量扣除积分,与普通丰富化完全一样。确认对话框会在产生任何支出前告知您即将运行多少个模型。每个保存的结果都会显示其计费成本,因此基准测试还可兼作成本比较工具。