バッチ処理

任意の数のエンティティを並列にエンリッチメントし、リアルタイムの進捗追跡、自動マルチモデルフュージョン、JSON または Excel へのエクスポートを行えます。固定のバッチサイズではなく、プランの利用クォータによってのみ制限されます。

入力方法

行はグリッド上部のソースストリップから読み込みます。タブは3つあり、一度に開けるのは1つだけです。行を読み込むとストリップは1行(“貼り付け / CSV · 12 行を読み込み済み”)に折りたたまれ、グリッドの高さが保たれます。別のデータを読み込むには、その行をクリックしてください。

  1. 1貼り付け / CSV、ファイル、URL — 一度に開けるソースは1つだけです
  2. 2ボタンは行を読み込む前に行数をカウントします
  3. 3検出された列数とヘッダー行
区切り文字(カンマ、タブ、セミコロン)とヘッダー行は貼り付けと同時にブラウザー側で判定されるため、誤った推測は 1 行も読み込まれる前に確認できます。

貼り付け / CSV

Excel、Google スプレッドシート、CSV エクスポートから行をそのまま貼り付けられます。カンマ、タブ、セミコロンはいずれも区切り文字として認識され、引用符で囲まれたセルには区切り文字を含められます。数値以外の名前が並ぶ先頭行は列ヘッダーとして扱われます。

ファイル

.csv、.tsv、.json ファイルをタブにドロップするか、ディスクから選択してください。JSON ファイルはオブジェクトの配列でも単一のオブジェクトでもかまいません。列はそれらのキーの和集合になるため、項目のそろっていないレコードでも読み込めます。

URL

任意の REST エンドポイントからエンティティを取得します。返された内容は自由形式のオブジェクトのリストとして読み取られ、列はそれらのキーの和集合になります。

対応している認証方式:

なしBearer トークンAPIキーヘッダーBasic 認証

APIがオブジェクトを返す場合、システムはdata、results、itemsなどのキーに埋め込み配列がないか確認します。

エンティティの選択と検証

エンティティを読み込むと、検証ステータスとともに選択可能なリストに表示されます。バッチに含めるエンティティを選択できます:

複数選択— 行は1つずつチェックするか、ヘッダーのボックスですべてを選択できます。Ctrl+Aは現在のフィルターに表示されているすべてを選択します。行をクリックすると、選択は変わらずに結果ドロワーが開きます。
インライン編集— 入力セルをダブルクリックすると、その場で値を修正できます。スキーマの検索キーだけでなく、データに含まれるすべての列が編集可能です。
検証— 行はスキーマのフィールド名に合わせる必要はありません。モデルは与えられたまま読み取ります。グリッドが唯一判定するのは「空かどうか」です。値がまったくない行はフラグが付き、グレー表示となり、実行から除外されます。分類モデルを選択すると、種類の異なるエンティティが自動的に破棄されます。
選択的処理— 選択されたエンティティのみがエンリッチメントに送信されます。処理したくないエンティティは選択を解除してください。
行ごとの契約チェック— サーバーはコストを消費する前に、すべての行をスキーマの入力コントラクトと照合します。最初の 1 行で失敗せずに問題のある行をすべて報告するため、バッチ全体を一度の修正で直せます。
  1. 1行ごとのチェックボックスで、実行時にどの行にコストをかけるかを決めます
  2. 2空の行はここで警告表示され、実行対象から除外されます
  3. 312 件を選択中 — ただし実行できるのは 11 件のみです
11行目には名前がなく、国とティッカーシンボルだけですが、それでも同じようにエンリッチメントされます。検索キーの欠落はモデルが補えますが、空の行は補えません。ここでは入力・検証・実行状態が3つの別々のリストではなく、1つの行にまとまっています。

設定

サイドバーは、単一 enrichment の設定オプションを反映しています。

オプション説明
スキーマenrichment 出力の構造を定義する対象 schema
戦略シングルパス、専門ドメイン、またはマルチエキスパティーズ(ドメインごとの並列呼び出し)
モデルエンティティごとに実行する1つ以上の AI モデル。複数のモデルを指定すると自動フュージョンが有効になります。
言語多言語フィールドのエンリッチメント用の言語(例: 英語+フランス語)
classificationエンリッチメント前のエンティティ型検証のための任意の高速モデル
アービトレーションfusion 中の LLM ベースの競合解決に使用するモデル。未設定の場合は、ルールベースのマージが使用されます。

コスト見積もり

推定コストは、実行バー内のコストを消費するボタンの隣に表示されます。スキーマのプロパティ数、選択したモデルのトークン料金、選択したエンティティの数から算出されます。モデルの自動選択では、実行の開始時にはじめてモデルが決まるため、表示される数値は選択され得るモデルの中央値です。確認ダイアログは毎回の実行時ではなく、実行に実際のリスクがある場合 — リンクされたデータベースへの書き込み、推定額が大きい、選択された行がスキップされる — にのみ表示されます。

  1. 12つのモデル:エンティティごとに、それぞれ1回ずつ呼び出します
  2. 2選択内容の変更に応じて再計算される見積もり
  3. 3読み込まれた 12 件ではなく 11 件のエンティティです — 空の行は除外されます
ボタンにはこれから実行する内容が表示されるため、件数と価格をまとめて確認できます。スマートフォンのブレークポイント未満では、ピッカーが「More options」に折りたたまれ、見積もりはボタンの隣に残ります。

並列実行

選択したすべてのエンティティが同時に処理されます。各エンティティは、完全なエンリッチメントパイプラインを独立して通過します:

entity ごとのパイプライン

  1. Classification(任意)— 高速なmodelがentityの種類を検証します。batchモードでは、不一致があってもジョブは停止せず、コンテキストがそのまま引き継がれます。
  2. マルチモデルエンリッチメント — 選択した各モデルが並列にエンティティをエンリッチし、それぞれがキーのレート予算に合わせてペース調整されます。
  3. 自動フュージョン(2 つ以上のモデルが成功した場合) — 結果は競合の検出と解決を使用して自動的にマージされます。

レートペース調整

すべてのエンティティは、API キーとモデルごとのレート予算を共有します。これは、プロバイダーがそのキーに割り当てる毎分のリクエスト数とトークン数で、レスポンスから読み取るか、拒否から学習します。エンティティ 20 件・モデル 2 つの場合、毎分 15 リクエストまでのモデルへの呼び出しは 1 分間に分散され、もう一方のモデルは独自のペースで実行されるため、429 エラーを発生させずにバッチが完了します。

リアルタイム進捗

実行を開始すると、ツールバーとグリッドの間に実行ストリップが表示され、Server-Sent Events (SSE) によって更新されます。バッチ全体の進捗バー、完了 / 失敗 / スキップをひとまとめの数値ではなく個別のカウンターとして表示し、経過時間とすでに確定した行から算出した完了予測、さらに事前見積もりに対する現在までの消費額が並びます。グリッドの上に何かが重なることはありません。行は元の位置に残り、各行は所要時間とコストの隣にある Status 列に自身の状態を保持します。

未実行

この行はまだ実行されていません。Status セルは同じ表示を列内で繰り返す代わりに、ダッシュを表示します。

待機中

バッチに受け付けられ、キーのレート予算に空きが出るのを待っています。

実行中

ラベルが切り替わり、完了した専門領域のステップ数と全体数を示すインラインバーが表示されます。

完了

すべてのモデルから応答が返りました。時間とコストが入力され、結果の列が読み取れるようになります。

失敗

この行では、どのモデルも結果を生成できませんでした。バッチが停止すると、失敗した行だけを再試行するオプションがストリップに表示されます。

スキップしました

エンリッチメント前に破棄されました(例:分類が明確に不一致)。そのため、この行には一切コストがかかっていません。

ツールバーの「完了」「失敗」「スキップ」のチップはグリッドを該当する行に絞り込み、「入力/両方/結果」の切り替えは同じ行を、送信した内容、返ってきた内容、またはその両方を並べて表示します。

キャンセルとエラー処理

実行中のバッチはいつでもキャンセルできます。キャンセルは協調的です — すでに処理中のエンティティは現在の LLM 呼び出しを完了しますが、新しい呼び出しは開始されません。完了したエンティティの部分的な結果は保持されます。

エラー耐性

バッチ処理は耐障害性を備えて設計されています。個々の失敗によってbatchが停止することはありません。

  • エンティティの分類が失敗した場合、エンリッチメントはコンテキストなしで続行されます
  • 1つのモデルが失敗しても、そのエンティティの他のモデルは続行されます
  • モデルが 2 つ以上ある場合、自動マージはすべてのモデルが成功したエンティティに対してのみ実行されます。部分的なエンティティではマージ結果が生成されず、失敗した専門領域を再試行して不足しているモデルを回復するまで、データベースには何も反映されません
  • エンティティのすべてのモデルが失敗した場合、そのエンティティは失敗としてマークされ、他のエンティティは続行されます
  • 「見つかりません」エラーを返すモデルは自動的に無効化されます

エクスポート形式

バッチ完了後、結果を3つの形式でエクスポートできます。各エンティティについて、フュージョン結果が利用可能な場合はそれが優先され、そうでない場合は最良のモデル結果が使用されます。

JSONファイル

すべてのエンティティデータ、モデル出力、フュージョンのメタデータを含む構造化された JSON ファイルとして、完全な結果をダウンロードできます。

クリップボード

JSON の結果を直接クリップボードにコピーして、他のツールやスクリプトに貼り付けられます。

Excel

3シート構成のワークブック:Results(エンティティごとに1行、プロパティをフラット化)、Summary(バッチのメタデータ、モデル、コスト)、Conflicts(エンティティごとの競合の詳細と解決の根拠)。

上限

上限値
バッチあたりの最大エンティティ数固定上限なし — プランの利用クォータによって制限されます
エンティティデータの最大サイズ50,000文字
最大プロンプト長100,000文字
URLフェッチのタイムアウト30秒

次のステップ