Playground

针对任意 AI 模型测试自定义 prompt,提供实时响应格式化、token 跟踪、成本指标和持久化历史记录。

概览

Playground 是一个自由形式的提示词测试环境。与由 schema 驱动的增强工作流不同,它允许你向模型发送任意的系统提示词和用户提示词,并检查原始响应。可用它试验提示词工程、测试模型能力或运行一次性查询。

模型
任意
语言
40
历史记录
持久化
成本跟踪
每次调用

界面布局

演练场采用分栏布局。所有输入都保存在本地存储中,可跨会话保留。

  1. 1这三个输入是同一面板的三个标签页
  2. 2源文档随同一次调用一起发送
  3. 3每次运行都会记录各自的耗时、令牌数和费用
  4. 4历史记录,位于其所属答案的下方
左侧是提示词,右侧是模型返回的全部内容:由于三项输入共用一个标签页面板,提示词得以保持窗口的完整高度,而不必被挤进三分之一的空间。

系统 Prompt

设定 model 的行为和角色。此内容作为系统消息发送,并在多次执行之间保留,因此你可以在无需重新输入上下文的情况下迭代 user prompt。

用户 prompt

发送给模型的主提示词。你可在此编写查询、指令或测试用例。

输出 Schema

粘贴一个你期望返回的 JSON 示例,它会被编译成真正的结构化输出约定并发送给提供商——与增强所用的机制完全相同。你可以借此在围绕某种输出结构构建架构之前,先测试模型能否稳定输出该结构。

响应

以自动检测的格式显示模型的响应。JSON 响应在 Monaco 编辑器中获得语法高亮;纯文本按原样呈现。一键复制到剪贴板。

历史记录

每次执行都会保存到你的账户,而不仅仅是保存在此浏览器中。可按模型筛选、查看提示词预览,点击某条记录即可完整还原该次调用。历史记录中的任何记录也可以在此重新加载 —— 包括其提示词和附件 —— 这样你就能对一次真实运行的措辞进行迭代,而无需为整条流程再次付费。

配置

侧边栏用于配置本次调用:

选项描述
模型从任意已配置的 provider 中选择单个 AI model。虚拟化下拉菜单会显示定价和 provider 信息。
语言从 40 种支持的语言中选择。会影响发送给模型的提示词中的语言指令。
附件为该调用附加文档。模型列表会收窄为真正能读取你所附内容的模型,因此不兼容的搭配根本无法出现,而不只是不推荐。

你要配置的第四项不在侧边栏里:提示词面板的输出架构标签页。粘贴一段你希望返回的 JSON 示例,调用便会带上由此推断出的结构化输出约定——字段名,以及各值所隐含的类型。

  1. 1提示词面板的第三个标签页
  2. 2是答案的示例,而非 JSON Schema
  3. 3嵌套和数组会带入契约
这里的示例只是提示:每个键都会成为必填字段,值为 null 则表示该字段可选。如果选择了无法强制遵循响应架构的模型,会出现橙色提示 —— 此时架构将被忽略,而不是被悄悄地部分应用。

执行与指标

每次执行后,响应面板会显示详细指标:

处理时间— 总往返时间(毫秒),包括网络延迟和模型推理。
输入令牌— 由 model 统计的系统 prompt 与用户 prompt 中的 token 数量。
输出 token— model 响应中的 token 数量。
成本— 根据模型的每 token 定价估算的美元成本。
  1. 1先是输入令牌,然后是输出令牌 — 以提供商的计数为准
  2. 2这一次调用的成本
  3. 3复制只会取答案本身,不含指标
这一行属于它下方的答案,并会被下一次运行替换掉,这正是试验场成为敲定模型选择的低成本方式的原因:同一提示词、两个模型、三个数字可供比较。

执行历史

每次执行都会作为提示词记录保存到你的账户 —— 与历史页面列出的记录相同 —— 响应下方的面板会将它们读回:

模型筛选— 将列表收窄至单个模型。当历史记录中包含多个模型时,选择器才会出现。
提示词预览— 每条记录会显示用户提示词的前 50 个字符、时间戳和模型名称。
成功指示器— 绿色对勾或红色叉号 — 失败的调用会被保留,因此拒绝或超时会与成功的运行并列显示。
恢复会话— 点击某个条目即可恢复其系统提示词、用户提示词、输出 schema、模型和语言 — 连同它生成的答案以及该次调用的指标,且无需任何花费。
清除历史记录— 一键清空面板,将这些提示词记录移入回收站;在历史页面中仍可恢复。
  1. 1将列表筛选为单个模型
  2. 2清空整个面板
  3. 3失败的调用会被保留,并且仍可重放
清空不会永久删除任何内容:这些条目是你账户中的记录,清空只是将它们移入回收站,历史页面可从中恢复。

常见用例

提示词工程

在将系统提示词和指令构建进增强架构之前,反复迭代以优化模型行为。

模型对比

用相同的 prompt 运行不同模型,在为充实选择模型之前,对比输出质量、速度和成本。

快速查询

无需搭建完整的 schema 和充实流水线,即可运行一次性知识提取查询。

后续步骤