セマンティックIDページ — コンセプト語彙を整備する - Entity Enricher ドキュメント

セマンティックIDページ

セマンティックIDを解決するエンリッチメントはすべて、組織がすでに把握しているコンセプトを再利用するか、新しいコンセプトを生成します。セマンティックIDページは、その増え続ける語彙を実際に確認できる場所です。語彙を閲覧し、2つの項目が実際にどれだけ近いかを測定し、手作業で用語を追加し、しきい値を下回ってすり抜けた近似重複を探し、不要になったものを廃止し、全体を別の埋め込みモデルへ移行できます。

ページを開く

このページはサイドバーの/semantic-idsにあります。組織に埋め込みモデルがあり、セマンティックIDを持つスキーマが1つ以上ある場合にのみ役立ちます。コンセプトを作成するのはエンリッチメントであり、このページではありません。

誰が何をできるか

  • エディタ — 閲覧、比較、エクスポート、テキストのチェック、コンセプトの追加、コンセプトの削除ができます。
  • オーナー / 管理者 — インポートによるコンセプトの作成、コンセプトタイプ全体のクリア、埋め込みモデルの移行も行えます。

コンセプト表の見方

各行は1つのコンセプトです。正規テキスト(最初にそのコンセプトを作成したアイデンティティテキスト)、コンセプトタイプ(属する空間 — 既定ではエンティティタイプ名)、使用しているレコード数、作成日時が表示されます。テキスト、任意の数のコンセプトタイプ、または最小使用回数でフィルターすれば、注目すべき項目を絞り込めます。ビューをエクスポートでは、フィルターで表示中の内容がそのままダウンロードされます。

「セマンティックID」ページ:左側にコンセプト一覧、右側に選択中のコンセプト
行を選択すると、類似度の列がその行を基準とした測定値に変わり、右側にそのコンセプトが開きます。

類似度は1つの空間の内部でのみ測定されます。 ベクトルを比較できるのは、同じコンセプトタイプかつ同じ埋め込みモデルの中だけです。選択したコンセプトの空間の外にある行にはが表示されます。これは「比較不可」という意味であり、「0%」ではありません。

用語の追加:キュレーションのループ

データが届く前から語彙が分かっている場合もあります。料理の一覧、ステータス、製品ファミリーなどです。キュレートバーは、そうした一覧を入力するために作られています。まずコンセプトタイプにスコープを設定します。スコープはページのアドレスに反映されるため、/semantic-ids/<concept type> がそのスライスへの直接リンクになります。あとは 値を入力 → 確認 → 追加 を繰り返すだけです。Enterで確認し、もう一度Enterで追加されると、フィールドはクリアされてフォーカスも残るため、50語の語彙でもマウスに触れずに数分の入力で登録できます。

入力した値に一致がなく、追加できることを示す整備バー
このテキストをしきい値以上で解決するものがないため、コンセプトを追加が有効になります。表には、入力内容との類似度順にすべてのコンセプトが並びます。

チェックは、実際の解決ラダーのドライランです — エンリッチメントが実行するものとまったく同じであり、その判定は推定ではありません。すでにその判定に対して料金を支払っているため、重複防止の役割も兼ねます。既存のコンセプトがしきい値以上で入力テキストを網羅している場合、コンセプトを追加は無効のままになります。

入力した値がすでに存在し、追加が無効になっている整備バー
完全一致には一切費用がかかりません — モデル呼び出しは発生しません。近似一致の場合は、代わりに既存のコンセプトとそのスコアが報告されます。

この拒否は意図的なものです。しきい値以上の重複コンセプトは解決で選ばれることがなく、今後の一致が2つのエントリーに予測できない形で分散してしまいます。入力欄の横にあるしきい値スライダーで、チェック時の基準線を決められます。上げれば厳しく、下げればより積極的に統合されます。

語彙はエンリッチメントから始める必要もありません。新しいコンセプトタイプ…(ページツールバー、エディター以上の権限で利用可能)では、タイプに名前を付け、そのコンセプトが属する埋め込みモデルを選択します。既定では組織のモデルが使用されます。キュレーションバーはすぐにそのタイプに絞り込まれ、最初に追加したコンセプトとともにタイプが語彙に加わります。すでに存在するタイプは自身のモデルを保持します。モデル間で語彙を移すには移行をご利用ください。

しきい値未満の重複を探す

しきい値を超えるものは、すでに統合済みです。興味深いのはそのすぐ下にあるケースです。疑わしいほど近いものの、統合されるほどは近くないものです。重複ビューはまさにその帯域を一覧表示し、スライダーでその幅を広げたり狭めたりできます。

類似度がしきい値をわずかに下回るコンセプトのペアを一覧表示する重複ビュー
同じ類似度帯でも、判断はまったく異なります。一方は1つのターボット料理に対する2つの呼び名、もう一方は本当に別物の2種類のチョコレートデザートです。候補を見つけるのはページの役目で、判断するのはあなたです。

比較 → では、そのコンセプトを選択した状態でテーブルに戻るため、判断する前に近くに何があるかを確認できます。真の重複だと考えられるペアは、それを生み出すプロパティのしきい値についてのシグナルです。スキーマエディタでしきい値を下げれば、今後のエンリッチメントがそのペアを自動的に統合します。使用回数を見れば、2つのうちどちらをデータが実際に好んでいるかがわかります。

個々のコンセプトを確認する

右側のパネルには、コンセプトのID(コピー可能で、データベースの結合キーとなるものです)、正規化されたテキスト、その基盤となる埋め込みモデル、そしてそのコンセプトに解決されたレコードが表示されます。選択中のコンセプトはページアドレスの一部となるため、アドレスバーのURLはそのままそのコンセプトへの直接リンクになります。同僚と共有したり、チケットに記録しておいたりするのに便利です。2つのビューで、周辺のコンセプトとの関係を確認できます。

オービットビュー:近傍のコンセプトを類似度に応じた半径に配置し、しきい値を破線の円で示したもの
オービット — 中心からの距離がそのまま類似度を表すため、破線のリングはしきい値そのものです。その内側にあるものはすべて、このコンセプトに解決されます。
3Dコンセプトマップ:コンセプト空間全体をUMAPで配置し、測定した類似度で色分けしたもの
コンセプトマップ(3D) — 空間全体を任意で表示するレイアウトです。測定値を表すのは色であり、位置はクラスタの形状を示唆するにすぎません。そのため、しきい値の球体は描画されません。

位置が真実を示さない理由

1536次元を3次元に圧縮すると距離は保持できず、レイアウトはクラスタの密集度を誇張します。どちらのビューもすべての点を同じ類似度スケールで色付けしているため、間隔ではなくを読み取ってください。セッションで最初のマップはレイアウトに数秒かかりますが、以降は瞬時に表示されます。

関連レコード

リンクされた各レコードには、ここに解決されたときのスコアが表示されます。 は、IDが入力に含まれていてそのまま渡されたことを意味し、比較は一切行われていません。セマンティックIDガイドで説明されている、無料で曖昧さのないパスです。

語彙のインポートとエクスポート

インポートと解決は、CSVの列全体を同じラダーで処理し、各行がどう扱われるかを注記します。ファイルサイズの制限はなく、大きなファイルは1000件ずつのバッチで解決され、進捗がリアルタイムで表示されます。ファイルはブラウザー内で解析され、送信されるのは値そのものだけです。

値のCSVについて、行ごとの結果(完全一致、一致、新規作成予定)を示すインポートダイアログ
マッチのみの実行では何も書き込まれないため、同じ値で次のエンリッチメントを行った場合の動作を忠実にプレビューできます。
結果意味するもの
exact正規化後の同じテキストがすでに存在します。無料で、モデル呼び出しも発生しません。
matched別の表現が、しきい値を超えて既存のコンセプトに解決されました。
would_mint十分に近いものがないため、ここではエンリッチメントが新しいコンセプトを作成します。
minted同じケースで作成を有効にした状態。コンセプトが作成されています(オーナーのみ)。

解決された行は個別のCSVとしてダウンロードできるため、インポートを監査目的だけに使うこともできます。900件の仕入先名のうち、どれがすでに登録済みで、どれが新しい識別子を作ることになるのか、といった具合です。エクスポートはその逆方向で、出力時のフィルターがファイル名に反映されるため、フォルダーにまとめても内容が分かるままです。

コンセプトの削除

この削除は、多くのデータ削除とは異なり安全です。次のエンリッチメントが必要なものを再び生成するため、語彙は自動的に再構築されます。戻らないのはすでに保存済みのIDとの収束であり、確認の前にダイアログが実際の件数とともにそれを提示します。

影響を受けるレコード、スキーマ、同期先データベースの件数を表示する削除確認ダイアログ
レコードは既存のIDを保持しますが、同じ対象を再度エンリッチメントすると別のIDが発行されます。下流のデータベースでは、これは新しい行として扱われます。

このような変更の後に古いコンセプトを残しておくのは、慎重な選択ではなくむしろリスクのある選択です。新しいキーで構成されたアイデンティティが古いベクトルのしきい値内に収まり、そのまま静かに吸収されてしまうおそれがあり、結果としてどちらの意味も持たないIDが残ります。

埋め込みモデルの変更

異なるモデルが生成したベクトルは比較できないため、モデルを切り替えるにはすべてのコンセプトを再埋め込みする必要があります。コンセプトが存在する状態では、この移行が唯一の正式な方法です。組織の埋め込みモデル設定が単独では変更できないのは、そのためです。

移行元モデル、そのコンセプト数、移行先の選択欄を表示する埋め込みモデルの移行ダイアログ
埋め込み空間は一度に1つだけです。コンセプトIDは変わらないため、レコード、エンティティ、エクスポート、データベース同期はその間も有効なままです。

まずはドライラン

プレビューでは、再埋め込みにかかるコストと、衝突しそうなコンセプトのペア(新しい空間で互いにしきい値の範囲内に入り、まとめて解決されるようになるもの)が示されます。すべてのペアではなく現実的な候補だけを測定し、その旨も明示されます。

一時停止も、待機画面の監視も不要

新しいベクトルがその隣で構築される間も、エンリッチメントは古い空間で解決され続けます。その間に生成されたコンセプトは、後続のパスで取り込まれます。切り替えは最後に一度だけ行われ、同時に組織のデフォルト埋め込みモデルも切り替わります。中断しても問題はありません。再度開始すれば、停止した場所から続行されます。

このページにかかるコスト

チェック、追加、インポートは他の埋め込み利用と同様に課金され、完全一致はモデルに到達しないため費用がかかりません。閲覧、比較、オービット、3Dマップ、エクスポート、削除は無料です。1日分のインタラクティブな利用は、クレジット履歴の1行にまとめられるため、1セント未満の端数で埋め尽くされることなく、履歴は読みやすいままです。