セマンティックIDページ

セマンティックID を解決するエンリッチメントは、組織がすでに知っている概念を再利用するか、新しい概念を作成します。セマンティックID ページでは、増え続けるこの語彙を実際に確認できます。一覧を閲覧し、2つのエントリがどれだけ近いかを測定し、手動で用語を追加し、同一性ジャッジがあなたに残した質問に回答し、不要になったものを廃止し、全体を別の埋め込みモデルへ移行できます。

ページを開く

このページはサイドバーの/semantic-idsにあります。組織に埋め込みモデルがあり、セマンティックIDを持つスキーマが1つ以上ある場合にのみ役立ちます。コンセプトを作成するのはエンリッチメントであり、このページではありません。

誰が何をできるか

  • •エディタ — 閲覧、比較、エクスポート、テキストのチェック、コンセプトの追加、コンセプトの削除ができます。
  • •オーナー / 管理者 — さらに、インポートによるコンセプトの作成(ファイルが必要とする場合は、それらで新しいコンセプトタイプを開くことも)、コンセプトタイプ全体の消去、埋め込みモデルの移行も行えます。

コンセプト表の見方

各行が 1 つのコンセプトを表します。正規テキスト(そのコンセプトを最初に作成した識別テキスト)、コンセプトタイプ(そのコンセプトが属する空間。既定ではエンティティタイプ名)、使用しているレコード数、作成日時が表示されます。テキスト、任意の数のコンセプトタイプ、それらに書き込むスキーマ、または最小使用回数で絞り込むと、注目すべきエントリを見つけられます。スキーマを選ぶことは、そのコンセプトタイプを選ぶショートカットです。タイプは共有されるため、同じタイプ内で別のスキーマが作成したコンセプトも表示されます。ビューをエクスポートすると、フィルタで表示されている内容がそのままダウンロードされます。

  1. 1正規行のエイリアス数
  2. 2同一性ジャッジによって統合された表記
+1 チップはエイリアス数です。1 つのコンセプトに複数の表記があり、使用回数は合計 1 件です。ジャッジが取り込んだ表記には auto が付きます — ジャッジへの課金は表記ごとに生涯 1 回だけです。
行を選択すると、類似度の列がその行を基準とした測定値に変わり、右側にそのコンセプトが開きます。

類似度は1つの空間の内部でのみ測定されます。 ベクトルを比較できるのは、同じコンセプトタイプかつ同じ埋め込みモデルの中だけです。選択したコンセプトの空間の外にある行には—が表示されます。これは「比較不可」という意味であり、「0%」ではありません。

用語の追加:キュレーションのループ

データが届く前から語彙が分かっている場合もあります。料理の一覧、ステータス、製品ファミリーなどです。キュレートバーは、そうした一覧を入力するために作られています。まずコンセプトタイプにスコープを設定します。スコープはページのアドレスに反映されるため、/semantic-ids/<concept type> がそのスライスへの直接リンクになります。あとは 値を入力 → 確認 → 追加 を繰り返すだけです。Enterで確認し、もう一度Enterで追加されると、フィールドはクリアされてフォーカスも残るため、50語の語彙でもマウスに触れずに数分の入力で登録できます。

このテキストをしきい値以上で解決するものがないため、コンセプトを追加が有効になります。表には、入力内容との類似度順にすべてのコンセプトが並びます。

チェックは、実際の解決ラダーのドライランです — エンリッチメントが実行するものとまったく同じであり、その判定は推定ではありません。すでにその判定に対して料金を支払っているため、重複防止の役割も兼ねます。既存のコンセプトがしきい値以上で入力テキストを網羅している場合、コンセプトを追加は無効のままになります。

完全一致には一切費用がかかりません — モデル呼び出しは発生しません。近似一致の場合は、代わりに既存のコンセプトとそのスコアが報告されます。

この拒否は意図的なものです。しきい値以上の重複コンセプトは解決で選ばれることがなく、今後の一致が2つのエントリーに予測できない形で分散してしまいます。入力欄の横にあるしきい値スライダーで、チェック時の基準線を決められます。上げれば厳しく、下げればより積極的に統合されます。

語彙はエンリッチメントから始める必要もありません。新しいコンセプトタイプ…(ページツールバー、エディター以上の権限で利用可能)では、タイプに名前を付け、そのコンセプトが属する埋め込みモデルを選択します。既定では組織のモデルが使用されます。キュレーションバーはすぐにそのタイプに絞り込まれ、最初に追加したコンセプトとともにタイプが語彙に加わります。すでに存在するタイプは自身のモデルを保持します。モデル間で語彙を移すには移行をご利用ください。

埋め込みモデルだけは後から決め直せません。タイプは作成時のモデルを保持し続け、変更するには移行が必要になります。

レビューキュー

似ているというだけで レビュー に入るものはありません。ここにあるペアはすべて、同一性ジャッジが判断したうえであなたに委ねたものです。判断できなかった場合(判断不能)、1つの入力テキストに対して組織の概念が2つ該当した場合(重複の可能性)、ほぼ同一と測定される2つを別物とした場合(別物と判定)です。最後のケースは、明白な候補を見落としていないかを確認できるように提示されています。各行には、判断の根拠を説明するジャッジ自身の文が添えられています。

まったく異なる2つの判定結果を並べた例です。1つのターボット料理を指す2つの名称と、本当に異なる2つのチョコレートデザートです。質問を見つけるのはジャッジ、答えるのはあなたです。

比較 → はその概念を選択した状態でテーブルに戻り、判断を下す前に近くにどんな概念があるかを確認できます。統合… は一方をもう一方に畳み込みます。統合されなかった側の表記は残った側のエイリアスになるため、両者はあらゆる場所で収束し、その状態を保ちます。却下 は、2つが本当に別のものである場合に質問を閉じます。使用回数を見れば、データが実際にどちらを好んでいるかがわかります。

影響は確定前に集計されます: 参照先が変更されるレコードと、このマージが下流でデータベースに加える変更です。

個々のコンセプトを確認する

右側のパネルには、コンセプトのID(コピー可能で、データベースの結合キーとなるものです)、正規化されたテキスト、その基盤となる埋め込みモデル、そしてそのコンセプトに解決されたレコードが表示されます。選択中のコンセプトはページアドレスの一部となるため、アドレスバーのURLはそのままそのコンセプトへの直接リンクになります。同僚と共有したり、チケットに記録しておいたりするのに便利です。2つのビューで、周辺のコンセプトとの関係を確認できます。

オービット — 中心からの距離がそのまま類似度を表すため、破線のリングはしきい値そのものです。その内側にあるものはすべて、このコンセプトに解決されます。
コンセプトマップ(3D) — 空間全体を任意で表示するレイアウトです。測定値を表すのは色であり、位置はクラスタの形状を示唆するにすぎません。そのため、しきい値の球体は描画されません。

位置が真実を示さない理由

1536次元を3次元に圧縮すると距離は保持できず、レイアウトはクラスタの密集度を誇張します。どちらのビューもすべての点を同じ類似度スケールで色付けしているため、間隔ではなく色を読み取ってください。セッションで最初のマップはレイアウトに数秒かかりますが、以降は瞬時に表示されます。

関連レコード

リンクされた各レコードには、ここに解決されたときのスコアが表示されます。— は、IDが入力に含まれていてそのまま渡されたことを意味し、比較は一切行われていません。セマンティックIDガイドで説明されている、無料で曖昧さのないパスです。

語彙のインポートとエクスポート

インポートと解決は、CSVの列全体を同じラダーで処理し、各行がどう扱われるかを注記します。ファイルサイズの制限はなく、大きなファイルは1000件ずつのバッチで解決され、進捗がリアルタイムで表示されます。ファイルはブラウザー内で解析され、送信されるのは値そのものだけです。

マッチのみの実行では何も書き込まれないため、同じ値で次のエンリッチメントを行った場合の動作を忠実にプレビューできます。
結果意味するもの
exact正規化後の同じテキストがすでに存在します。無料で、モデル呼び出しも発生しません。
matched別の表現が、しきい値を超えて既存のコンセプトに解決されました。
would_mint十分に近いものがないため、ここではエンリッチメントが新しいコンセプトを作成します。
minted同じケースで作成を有効にした状態。コンセプトが作成されています(オーナーのみ)。

コンセプトタイプは選ぶものではなく、入力するものです。 ファイルから語彙を始めるのはごく自然なことなので、このフィールドは既存の空間を候補として示しつつ、まだ存在しない名前も受け付けます。そして新しい名前であれば新規と表示します。新しい名前は、後からは問えない唯一の質問を投げかけます。そのコンセプトをどの埋め込みモデルに置くか、です。ここで答えれば、インポートが最初の値を発行した時点で空間が作成されます。その後に語彙をモデル間で移すのは移行作業になります。

入力ミスが2つ目の語彙になるのを防ぐ仕組みが2つあります。既存の空間名を入力すると、大文字・小文字にかかわらずその空間が選択されること。そして既存の名前と1〜2文字しか違わない名前には、ワンクリックで修正できる警告が表示されることです。まったく新しい空間には比較対象がないため、照合のみの実行は1行も埋め込むことなく「すべての値が作成されます」と返し、料金も発生しません。

解決された行は個別のCSVとしてダウンロードできるため、インポートを監査目的だけに使うこともできます。900件の仕入先名のうち、どれがすでに登録済みで、どれが新しい識別子を作ることになるのか、といった具合です。エクスポートはその逆方向で、出力時のフィルターがファイル名に反映されるため、フォルダーにまとめても内容が分かるままです。

コンセプトの削除

この削除は、多くのデータ削除とは異なり安全です。次のエンリッチメントが必要なものを再び生成するため、語彙は自動的に再構築されます。戻らないのはすでに保存済みのIDとの収束であり、確認の前にダイアログが実際の件数とともにそれを提示します。

各タイプは、それが属する埋め込み空間を示します。異なるモデル上の2つのタイプを比較することはできないため、件数はこのように分けて表示されます。
レコードは既存のIDを保持しますが、同じ対象を再度エンリッチメントすると別のIDが発行されます。下流のデータベースでは、これは新しい行として扱われます。

このような変更の後に古いコンセプトを残しておくのは、慎重な選択ではなくむしろリスクのある選択です。新しいキーで構成されたアイデンティティが古いベクトルのしきい値内に収まり、そのまま静かに吸収されてしまうおそれがあり、結果としてどちらの意味も持たないIDが残ります。

埋め込みモデルの変更

異なるモデルが生成したベクトルは比較できないため、モデルを切り替えるにはすべてのコンセプトを再埋め込みする必要があります。コンセプトが存在する状態では、この移行が唯一の正式な方法です。組織の埋め込みモデル設定が単独では変更できないのは、そのためです。

埋め込み空間は一度に1つだけです。コンセプトIDは変わらないため、レコード、エンティティ、エクスポート、データベース同期はその間も有効なままです。

まずはドライラン

プレビューでは、再埋め込みにかかるコストと、衝突しそうなコンセプトのペア(新しい空間で互いにしきい値の範囲内に入り、まとめて解決されるようになるもの)が示されます。すべてのペアではなく現実的な候補だけを測定し、その旨も明示されます。

一時停止も、待機画面の監視も不要

新しいベクトルがその隣で構築される間も、エンリッチメントは古い空間で解決され続けます。その間に生成されたコンセプトは、後続のパスで取り込まれます。切り替えは最後に一度だけ行われ、同時に組織のデフォルト埋め込みモデルも切り替わります。中断しても問題はありません。再度開始すれば、停止した場所から続行されます。

このページにかかるコスト

チェック、追加、インポートは他の埋め込み利用と同様に課金され、完全一致はモデルに到達しないため費用がかかりません。閲覧、比較、オービット、3Dマップ、エクスポート、削除は無料です。1日分のインタラクティブな利用は、クレジット履歴の1行にまとめられるため、1セント未満の端数で埋め尽くされることなく、履歴は読みやすいままです。