批处理

并行丰富任意数量的实体,支持实时进度跟踪、自动多模型融合,并可导出为 JSON 或 Excel——仅受套餐用量配额限制,而非固定批次大小。

输入方式

数据行通过表格上方的来源条栏导入——共三个标签页,一次只打开一个。加载数据行后,该条栏会收起为一行(“粘贴 / CSV · 已加载 12 行”),使表格保持原有高度;点击该行可加载另一组数据。

  1. 1粘贴 / CSV、文件和 URL——一次只能打开一个来源
  2. 2按钮会在加载之前先统计行数
  3. 3检测到的列数和表头行
分隔符——逗号、制表符或分号——以及表头行会在你粘贴时由浏览器就地判定,因此若判断有误,在加载任何一行之前就能看出来。

粘贴 / CSV

可直接从 Excel、Google Sheets 或 CSV 导出内容中粘贴数据行。逗号、制表符和分号均可识别,带引号的单元格中可以包含分隔符;若首行为非数字名称,则会被视为列标题。

文件

将 .csv、.tsv 或 .json 文件拖放到该标签页,或从磁盘中选择一个。JSON 文件可以包含对象数组或单个对象;列为这些对象键的并集,因此字段不齐的记录同样可以加载。

URL

从任意 REST 端点获取实体。返回的内容将被读取为自由格式对象的列表,列集合为这些对象键的并集。

支持的身份验证方式:

无Bearer TokenAPI 密钥请求头Basic Auth

如果 API 返回一个对象,系统会检查诸如 data、results、items 之类的键,以查找内嵌数组。

实体选择与验证

加载实体后,它们会以带验证状态的可选列表形式显示。你可以选择要包含在批次中的实体:

多选— 逐行勾选,或用表头的复选框全选;Ctrl+A 会选中当前筛选显示的全部内容。点击某一行会打开其结果抽屉,而不会改变选择。
内联编辑— 双击任意输入单元格即可就地修改值 —— 你的数据带来的每一列都可编辑,而不仅是架构的搜索键。
验证— 您的行不必使用架构中的字段名 — 模型会按原样读取。表格唯一做出的判断是是否为空:完全不含任何值的行会被标记、置灰并排除在本次运行之外。选择一个分类模型,即可自动丢弃类型错误的实体。
选择性处理— 仅将选中的实体发送进行扩充。取消勾选您不想处理的实体。
逐行契约校验— 服务器会在产生任何消耗之前,按架构的输入约定逐行校验,并报告每一个不合规的行,而不是在第一个错误处就中断——这样你可以一次性修完整个批次。
  1. 1逐行勾选框决定本次运行在哪些行上花费开销
  2. 2空行会在此标记出来——并从本次运行中剔除
  3. 3已选择 12 个 — 但只有 11 个可运行
第 11 行没有名称,只有国家和股票代码,但同样完成了增强:搜索关键字缺失是模型可以绕开的问题,空行则不行。此处的输入、校验和运行状态同处一行,而不是三个独立的列表。

配置

侧边栏与单个 enrichment 的配置选项相对应:

选项描述
Schema定义 enrichment 输出结构的目标 schema
策略单次通过、专家领域或多专业(每个领域并行调用)
模型针对每个实体运行的一个或多个 AI 模型。多个模型可启用自动融合。
语言用于多语言字段增强的语言(例如:英语 + 法语)
分类用于在增强前进行实体类型验证的可选快速模型
仲裁用于在 fusion 期间基于 LLM 解决冲突的模型。若未设置,则使用基于规则的合并。

成本估算

预估费用显示在运行栏中,紧邻用于启动运行的按钮。它根据架构的属性数量、所选模型的 token 定价以及所选实体数量计算得出。使用自动选择模型时,模型只在运行开始时才确定,因此显示的数字是可能选中的各个模型的中位值。仅当运行存在实际风险时才会弹出确认对话框 — 例如会写入已关联的数据库、预估费用较高,或部分所选行将被跳过 — 而不是每次运行都弹出。

  1. 1两个模型:每个实体各调用一次
  2. 2预估金额,随选择变化实时重算
  3. 311 个实体,而不是载入的 12 个 — 空行会被丢弃
按钮会写明即将运行的内容,因此数量和价格可以一并读到。在手机断点以下,各选择器会折叠进“更多选项”,预估金额仍留在按钮旁边。

并行执行

所有选定的实体将同时处理。每个实体独立走完整个丰富流程:

单实体流水线

  1. 分类(可选)——由快速模型验证实体类型。在批处理模式下,不匹配不会暂停作业;上下文会照常传递。
  2. 多模型增强 — 每个选定的模型并行增强该实体,各自在其密钥的速率预算下进行调控。
  3. 自动融合(当 2 个及以上模型成功时)— 使用冲突检测与解决自动合并结果。

速率调控

所有实体共享每个 API 密钥和模型的速率预算——即提供商授予该密钥的每分钟请求数和 token 数,从其响应中读取或从一次拒绝中学习得出。当有 20 个实体和 2 个模型时,对某个每分钟仅允许 15 次请求的模型的调用会分散到整分钟内,而另一个模型则按自己的节奏运行,因此批次可以在不出现 429 错误的情况下完成。

实时进度

启动运行后,工具栏与表格之间会出现一条运行状态条,由服务器发送事件(SSE)驱动:整个批量一个进度条,已完成/失败/跳过分别计数而非合并成一个数字,显示已用时间以及根据已完成行推算的预计剩余时间,还有当前花费与运行前预估的对比。表格上方不会弹出任何内容——各行保持原位,每行在“状态”列中显示自身状态,旁边是它所耗的时间和费用。

未运行

该行尚未经过任何运行——状态单元格显示一个短横线,而不是在整列中重复同样的内容。

排队中

已加入批次,等待该密钥速率预算中的空余额度。

运行中

标签会变成一个内联进度条,显示已完成的专业领域步骤数与总数。

完成

所有模型均已返回。耗时和费用已填充,结果列变为可读。

失败

没有任何模型为此行生成结果。批次停止后,该条栏会提供仅重试失败行的选项。

已跳过

在扩充之前就已丢弃 —— 例如分类高置信度不匹配 —— 因此该行不产生任何费用。

工具栏的“已完成 / 失败 / 已跳过”标签可将表格筛选为对应的行,而“输入 / 两者 / 结果”开关则把同样的行显示为你发送的内容、返回的内容,或两者并排显示。

取消与错误处理

你可以随时取消正在运行的 batch。取消是协作式的——已在处理中的 entity 会完成其当前的 LLM 调用,但不会启动新的调用。已完成 entity 的部分结果会被保留。

错误恢复能力

批处理设计为具有弹性。单个失败不会中止整个批次:

  • 如果某个 entity 的 classification 失败,enrichment 将在没有上下文的情况下继续进行
  • 如果某个 model 失败,该 entity 的其他 model 会继续处理
  • 使用两个或更多模型时,自动合并仅对所有模型均成功的实体执行——部分完成的实体不会产生合并结果,在通过重试失败的专业领域找回缺失的模型之前,任何数据都不会写入你的数据库
  • 如果某个 entity 的所有 model 都失败,则将其标记为失败,其他 entity 继续处理
  • 返回“未找到”错误的模型会被自动停用

导出格式

批次完成后,可将结果导出为三种格式。对于每个实体,如果有融合结果则优先使用;否则使用最佳模型的结果。

JSON 文件

将完整结果下载为结构化 JSON 文件,包含所有实体数据、模型输出和融合元数据。

剪贴板

将 JSON 结果直接复制到剪贴板,以便粘贴到其他工具或脚本中。

Excel

一个三工作表工作簿:Results(每个实体一行,属性已扁平化)、Summary(批次元数据、模型、成本)和 Conflicts(逐实体冲突详情及解决推理)。

限制

限制值
每个批次的最大实体数无固定上限——仅受套餐用量配额限制
最大实体数据大小50,000 个字符
最大提示词长度100,000 个字符
URL 抓取超时30 秒

后续步骤