基准测试场景让您可以在真实、可重复的丰富化任务上对 LLM 模型进行同类比较,捕获每个模型的输出和总成本,以便为任务选择合适的模型。
不同模型在准确性、结构化输出可靠性和价格上差异巨大。与其靠猜测,基准测试场景会将同一个模式和实体同时交由多个模型处理,并记录每个模型的产出及其成本。你可以基于证据进行比较,然后锁定满足你质量标准的最便宜模型。
基准测试场景是一份已保存、可复用的模型测试。它可以对增强(一个架构、一份固定的实体输入、一种增强策略、语言、响应架构 / 严格结构化输出开关,以及任何附件)、样本生成(一段自由文本样本需求,每个模型将其转化为示例 JSON)或架构生成(同一实体类型的 1 到 20 个固定输入样本,每个模型将其转换为架构——可从已保存的架构中导入,并连同该架构本身一起作为参考草稿)进行基准测试。它还保存其黄金参考以及据此为结果评分的方式(评判模型、嵌入模型和严格度阈值——样本生成仅由评判模型按评分标准打分,不使用参考)。只需定义一次,即可在你想比较的每个模型上复用。
一旦场景拥有已验证的参考,即可针对某个提供商的活跃模型或视图中的所有活跃模型运行它。每个模型都会独立进行丰富化——不做融合——因此你会得到每个模型清晰的并排结果。进度会实时流式显示,运行结束时,每个成功的结果都会自动根据参考进行评分。如果场景带有二进制附件,请启用跳过无法读取附件的模型,缺少所需文件能力的模型会被报告为已跳过,而不是产生必然的失败。
每次运行都会保存其结构化输出、成功状态、令牌数、处理时间以及计费总成本。展开任意一行即可查看 JSON 输出,或跳转到底层的扩充 record。
在同一模型上重新运行场景会覆盖它此前的结果,因此表格始终反映最近一次运行。修改场景配置后,较早的结果会被标记为已过期,直到你重新运行为止。将每个模型运行次数设为 2 或 3,每个模型就会被基准测试相应的次数——表格会保留成本、质量和速度的平均值,外加一致性离散度(模型每次运行都会有所不同),积分消耗也大致按该倍数增加。离散度过大往往并非源于模型,而是源于同时提出多个问题的架构属性——歧义检查能找出并修正它们。
结果表专为对比而设计。顶部的汇总条会突出显示成功率以及成功 model 中最便宜和最快的 model。每一列——model、状态、策略、成本、token 和耗时——都可排序,因此一次点击即可按价格或延迟对 model 排序。可按 model 名称、状态或策略筛选以缩小视图范围,展开任意行即可阅读完整的结构化输出或打开底层的 enrichment record。
基准测试的价值远不止一张只看一次的表格。把某个场景标记为评分来源,它的各模型结果就会开始驱动整个平台:模型会在每个选择器中以徽章形式带上你测得的分数,选择器按分数排序,自动模型选择也会解析为你自己的测量结果中该任务得分最高的模型。标记多个场景时分数取平均——因此“最佳模型”指的是在你的架构上最佳,而不是在公开排行榜上最佳。系统管理员可以发布一个全局场景,作为没有自有场景的组织的回退选项。
“最佳”如何权衡由你决定:质量、速度和成本按各场景类型配置的比例混合,可在设置 → 组织 → 默认值中设置(每组合计为 100,默认各占三分之一)。以批量成本为优化目标的团队和以回答质量为优化目标的团队,从同一份基准测试中自动选出不同的模型,是完全合理的。
基准测试是一个迭代过程。点击行即可选择(Ctrl/Cmd 点击切换,Shift 点击选择范围,或在 ··· 菜单 中使用 全选),然后仅对该子集执行操作,无需全部重新运行:
每个 scenario 都持有一份参考结果——即其 entity 的预期输出——只有当该参考结果通过验证后,scenario 才能进行基准测试。在此之前,它不会出现在任何运行菜单中。参考结果是评判质量的基准:衡量每个模型逐字段的接近程度,以及(对于电影演员阵容这类列表)它实际找出了多少正确项。你可以在 scenario 编辑器中直接设定它——以及用于对照评分的评判模型、嵌入模型和严格程度。
有两种构建方式。生成:附上包含正确值的文档(数据表、官方页面),开启网络搜索,并运行几个强大的模型——它们会从您的来源而非记忆中提取答案,因此结果基于事实,而非猜测。或者粘贴一份您已有的已知正确结果。无论哪种方式,您都可以审阅 JSON、修正任何内容,并将其标记为已验证——明确确认这就是标准答案。
由于参考基准已经过实证并经人工核对一次,它同时可作为可信的标尺,在每个模型和未来每次运行中重复使用。
基准测试位于模型管理 → 基准测试(仅组织所有者和管理员可用)。你可以在那里创建和管理场景,也可以在“模型”标签页中通过工具栏的基准测试模型按钮启动运行:先选择一个场景,再选择范围——已选择的供应商或模型(按钮会显示数量)、从未进行基准测试或在旧场景配置下测试过的模型,或视图中的所有活跃模型。
场景上的运行和评分结果按钮默认按增量方式工作——它们仅针对尚无结果的模型以及过期结果(评分时还包括未评分或过期的评分)。确认对话框可让你将范围扩大到每个活动模型以进行完整重跑,或缩小范围以排除过期条目。结果表的显示的模型筛选器还可以列出尚未基准测试的活动模型。
基准测试运行会进行真实的 LLM 调用,并根据实际用量扣除积分,与普通丰富化完全一样。确认对话框会在产生任何支出前告知您即将运行多少个模型。每个保存的结果都会显示其计费成本,因此基准测试还可兼作成本比较工具。