Каждое обогащение, разрешающее семантический ID, либо переиспользует концепт, уже известный вашей организации, либо создаёт новый. Страница Семантические ID — это место, где растущий словарь становится тем, на что можно посмотреть: просматривайте его, измеряйте, насколько близки две записи на самом деле, добавляйте термины вручную, выявляйте почти-дубликаты, проскользнувшие ниже порога, выводите из обращения ненужное и переносите всё это на другую модель эмбеддингов.
Страница находится по адресу /semantic-ids в боковой панели и полезна только тогда, когда в вашей организации есть модель эмбеддингов и хотя бы одна схема с семантическим ID — концепты создаются обогащениями, а не самой страницей.
Каждая строка — это один концепт: его канонический текст (текст идентичности, который его создал), его тип концепта (пространство, в котором он находится, — по умолчанию имя типа сущности), число записей, которые его используют, и дата создания. Фильтруйте по тексту, по любому количеству типов концептов или по минимальному числу использований, чтобы найти записи, заслуживающие внимания; Экспорт представления скачивает ровно то, что показывают фильтры.

Схожесть измеряется только внутри одного пространства. Векторы сравнимы лишь в пределах одного и того же типа концептов и одной и той же модели эмбеддингов. Строки за пределами пространства выбранного концепта показывают —, что означает «несравнимо», а вовсе не «0%».
Иногда словарь известен ещё до того, как появятся данные, — список блюд, статусов, товарных групп. Панель Курирование создана как раз для того, чтобы набрать такой список: один раз ограничьте её типом концепта — область попадает в адрес страницы, поэтому /semantic-ids/<concept type> — это ссылка сразу на нужный срез, — а дальше повторяйте ввести значение → Проверить → Добавить. Enter проверяет, второй Enter добавляет, поле очищается и сохраняет фокус, так что словарь из пятидесяти терминов — это несколько минут набора без единого касания мыши.

Проверка — это пробный прогон настоящей лестницы разрешения — той же самой, которую выполняет обогащение, — поэтому её вердикт не является приблизительной оценкой. И раз вы уже оплатили этот вердикт, он заодно служит защитой от дубликатов: если существующий концепт покрывает ваш текст на уровне порога или выше, кнопка Добавить концепт остаётся неактивной.

Этот отказ намеренный: близнец выше порога никогда не выиграл бы разрешение и непредсказуемо делил бы будущие совпадения между двумя записями. Ползунок Порог рядом с полем определяет, где проходит эта граница при ваших проверках: поднимите его, чтобы быть строже, опустите — чтобы объединять агрессивнее.
Словарь тоже не обязательно начинать с обогащения: Новый тип концепта… (на панели инструментов страницы, для роли «редактор» и выше) задаёт имя типа и выбирает модель эмбеддингов, в которой будут жить его концепты, — по умолчанию модель вашей организации. Панель курирования сразу ограничивается этим типом, и тип попадает в словарь вместе с первым добавленным концептом; уже существующий тип сохраняет свою модель, поскольку для переноса словаря между моделями предназначена миграция.
Всё, что выше порога, уже объединено за вас. Интересны случаи чуть ниже него: достаточно близкие, чтобы вызвать подозрение, но недостаточно близкие, чтобы слиться. Представление Дубликаты показывает именно эту полосу, а ползунок расширяет или сужает её.

Сравнить → возвращает к таблице с выбранным концептом, чтобы вы увидели, что ещё находится рядом, прежде чем принимать решение. Пара, которую вы считаете настоящим дубликатом, — это сигнал о пороге для свойства, которое её порождает: понизьте его в редакторе схемы, и будущие обогащения сами объединят такую пару. Счётчики использования подскажут, какой из двух концептов данные предпочитают на деле.
На правой панели отображаются ID концепта (его можно скопировать — именно по нему связываются данные в вашей базе), его нормализованный текст, лежащая в основе модель эмбеддингов и записи, сопоставленные с ним. Выбранный концепт входит в адрес страницы, поэтому URL в адресной строке — прямая ссылка на него: ею можно поделиться с коллегой или сохранить её в тикете. Два представления показывают концепт в окружении соседних.


Сжатие 1536 измерений до 3 не может сохранить расстояния, а раскладка преувеличивает плотность кластеров. Оба представления окрашивают все точки по одной и той же шкале схожести, поэтому читайте цвет, а не расстояние. Первая карта за сессию строится несколько секунд, последующие появляются мгновенно.
Каждая связанная запись показывает оценку, с которой она была разрешена сюда. — означает, что ID пришёл во входных данных и был передан как есть, поэтому сравнения не было вовсе — бесплатный и однозначный путь, описанный в руководстве по семантическим ID.
Импорт и разрешение прогоняет целый столбец CSV по той же цепочке и помечает каждую строку тем, что с ней произойдёт, — ограничения на размер файла нет; большие файлы обрабатываются пакетами по 1000 с отображением хода работы. Файл разбирается прямо в браузере — отправляются только сами значения.

| Результат | Что это значит |
|---|---|
exact | Такой же текст после нормализации уже существует — бесплатно, без вызова модели. |
matched | Иная формулировка разрешилась в существующий концепт выше порога. |
would_mint | Ничего достаточно близкого не нашлось; обогащение создало бы здесь новый концепт. |
minted | Тот же случай с включённым созданием — концепт теперь существует (только для владельца). |
Разрешённые строки скачиваются отдельным CSV, поэтому импорт можно использовать и просто как аудит: какие из наших 900 названий поставщиков уже известны, а какие создадут новую идентичность? Экспорт работает в обратную сторону и называет файл по применённым фильтрам, так что папка с экспортами остаётся самоописательной.
Удаление здесь безопасно так, как редко бывает при удалении данных: словарь восстанавливает себя сам, ведь следующее обогащение просто создаст заново то, что ему нужно. Не вернётся другое — совпадение с уже сохранёнными у вас ID, и диалог сообщает об этом с реальными цифрами до подтверждения.

После такого изменения сохранять старые концепты — рискованный выбор, а не осторожный: идентичности, собранные из новых ключей, всё ещё могут попасть в пределы порога старых векторов и незаметно быть поглощёнными ими, оставив вас с ID, которые не означают ни того, ни другого.
Векторы двух разных моделей несопоставимы, поэтому смена модели означает повторное построение эмбеддингов для всех концептов. Если концепты уже созданы, эта миграция — единственный разрешённый способ это сделать, и именно поэтому настройка модели эмбеддингов организации не меняется сама по себе.

Предпросмотр показывает, во что обойдётся повторное построение эмбеддингов и какие пары концептов, скорее всего, столкнутся — окажутся в новом пространстве в пределах порога друг от друга и начнут разрешаться в один. Оцениваются реалистичные кандидаты, а не все пары, и об этом прямо сообщается.
Обогащения продолжают разрешаться в старом пространстве, пока рядом строятся новые векторы; концепты, созданные за это время, подхватываются последующим проходом. Переключение происходит одним шагом в конце и заодно меняет модель эмбеддингов по умолчанию для вашей организации. Прерывание безвредно: при повторном запуске работа продолжится с места остановки.
Проверки, добавления и импорт тарифицируются как любое другое использование эмбеддингов, а точные совпадения не стоят ничего, поскольку никогда не доходят до модели. Просмотр, сравнение, орбита, 3D-карта, экспорт и удаление бесплатны. Все интерактивные расходы за день сворачиваются в одну строку в истории кредитов, поэтому журнал остаётся читаемым, а не заполняется долями цента.