시맨틱 ID를 확정하는 모든 보강은 조직이 이미 알고 있는 개념을 재사용하거나 새 개념을 새로 만들어냅니다. 시맨틱 ID 페이지는 이렇게 늘어나는 어휘를 직접 들여다볼 수 있게 해 주는 곳입니다. 목록을 훑어보고, 두 항목이 실제로 얼마나 가까운지 측정하고, 용어를 직접 추가하고, 동일성 판정 모델이 남긴 질문에 답하고, 더 이상 필요 없는 항목을 폐기하고, 전체를 다른 임베딩 모델로 옮길 수 있습니다.
이 페이지는 사이드바의 /semantic-ids에 있으며, 조직에 임베딩 모델이 있고 시맨틱 ID를 사용하는 스키마가 하나 이상 있어야 쓸모가 있습니다. 개념은 이 페이지가 아니라 보강 작업이 생성합니다.
각 행은 하나의 개념입니다. 표준 텍스트(해당 개념을 처음 생성한 식별 텍스트), 개념 유형(개념이 속한 공간으로, 기본값은 엔티티 유형 이름입니다), 이 개념을 사용하는 레코드 수, 생성 일시를 보여줍니다. 텍스트, 여러 개의 개념 유형, 개념에 값을 기록하는 스키마, 또는 최소 사용 횟수로 필터링하여 살펴볼 만한 항목을 찾으세요. 스키마를 선택하는 것은 해당 스키마의 개념 유형을 고르는 지름길이며, 유형은 공유되므로 같은 유형에서 다른 스키마가 생성한 개념도 함께 표시됩니다. 보기 내보내기를 사용하면 현재 필터에 표시된 내용을 그대로 다운로드합니다.
유사도는 하나의 공간 안에서만 측정됩니다. 벡터는 동일한 개념 유형과 임베딩 모델 안에서만 비교할 수 있습니다. 선택한 개념의 공간 밖에 있는 행에는 —가 표시되며, 이는 “0%”가 아니라 “비교 불가”를 뜻합니다.
데이터가 들어오기 전에 이미 어휘를 알고 있는 경우가 있습니다 — 요리 목록, 상태, 제품군처럼요. Curate 바는 바로 그 목록을 입력하기 위한 것입니다. 개념 유형으로 범위를 한 번 지정하면 — 범위가 페이지 주소에 반영되므로 /semantic-ids/<concept type>이 해당 구간으로 바로 연결되는 링크가 됩니다 — 이후 값 입력 → 확인 → 추가를 반복하면 됩니다. Enter 키를 누르면 확인하고, 한 번 더 누르면 추가됩니다. 입력란은 비워지면서 포커스를 유지하므로, 50개 용어짜리 어휘도 마우스를 쓰지 않고 몇 분 만에 입력할 수 있습니다.
확인은 실제 해석 단계를 그대로 시험 실행합니다 — 보강이 실행하는 것과 동일한 단계이므로 그 판정은 추정이 아닙니다. 그리고 이미 그 판정에 비용을 지불했기 때문에 중복 방지 장치 역할도 겸합니다. 기존 개념이 임계값 이상으로 입력 텍스트를 포괄하면 개념 추가는 비활성 상태로 유지됩니다.
이 거부는 의도적입니다. 임계값을 넘는 쌍둥이 개념은 확정에서 이길 수 없고, 이후의 일치 결과를 두 항목 사이에서 예측할 수 없게 갈라놓기 때문입니다. 입력란 옆의 임계값 슬라이더가 확인 시 적용되는 기준선을 정합니다. 값을 높이면 더 엄격해지고, 낮추면 더 적극적으로 병합합니다.
어휘집을 반드시 보강에서 시작해야 하는 것도 아닙니다. 새 개념 유형…(페이지 툴바에서 에디터 이상 권한으로 사용 가능)에서 유형 이름을 지정하고 해당 개념이 속할 임베딩 모델을 선택합니다 — 기본값은 조직의 모델입니다. 큐레이트 바는 즉시 해당 유형으로 범위가 지정되며, 유형은 처음 추가하는 개념과 함께 어휘집에 추가됩니다. 이미 존재하는 유형은 기존 모델을 유지하는데, 어휘집을 다른 모델로 옮기는 것은 마이그레이션이 담당하기 때문입니다.
단지 비슷해 보인다는 이유만으로 검토에 올라오는 것은 없습니다. 여기 있는 모든 쌍은 동일성 판정 모델이 판단한 뒤 사용자에게 남긴 것입니다. 판단할 수 없었거나(불확실), 들어온 하나의 텍스트에 대해 조직의 개념 두 개가 동일하다고 보았거나(중복으로 보임), 거의 동일한 수치를 보이는 둘을 분리했거나(분리 유지) 하는 경우입니다. 마지막 경우는 명백한 후보를 놓치지 않았는지 확인할 수 있도록 제공됩니다. 각 행에는 무엇이 결정을 좌우했는지 설명하는 판정 모델 자신의 문장이 함께 담겨 있습니다.
비교 →를 누르면 해당 개념이 선택된 상태로 테이블로 돌아가, 결정하기 전에 그 주변에 어떤 항목이 있는지 확인할 수 있습니다. 병합…은 하나를 다른 하나에 접어 넣습니다. 밀려난 쪽의 표기는 남는 쪽의 별칭이 되므로, 두 항목은 어디서나 하나로 수렴하고 그 상태를 유지합니다. 무시는 둘이 정말 서로 다른 것일 때 질문을 닫습니다. 사용 횟수를 보면 데이터가 실제로 둘 중 어느 쪽을 선호하는지 알 수 있습니다.
오른쪽 패널에는 해당 개념의 ID(복사 가능 — 데이터베이스가 조인 기준으로 사용하는 값입니다), 정규화된 텍스트, 그 뒤에 있는 임베딩 모델, 그리고 이 개념으로 해석된 레코드가 표시됩니다. 선택한 개념은 페이지 주소의 일부이므로, 주소 표시줄의 URL이 곧 해당 개념으로 바로 돌아오는 링크입니다 — 동료와 공유하거나 티켓에 남겨 두기에 좋습니다. 두 가지 보기를 통해 인접한 개념들 사이에서 해당 개념을 확인할 수 있습니다.
1536차원을 3차원으로 압축하면 거리를 그대로 유지할 수 없고, 배치는 클러스터를 실제보다 조밀해 보이게 만듭니다. 두 보기 모두 동일한 유사도 척도로 모든 점을 칠하므로, 간격이 아니라 색상을 보고 판단하세요. 세션의 첫 맵은 배치에 몇 초가 걸리지만, 이후에는 즉시 표시됩니다.
연결된 각 레코드에는 이 개념으로 해석된 점수가 표시됩니다. —는 ID가 입력에 이미 들어 있어 그대로 전달되었다는 뜻으로, 비교가 전혀 이루어지지 않았음을 의미합니다. 시맨틱 ID 가이드에서 설명한 무료이고 모호함이 없는 경로입니다.
Import & resolve는 CSV 열 전체를 동일한 해석 단계로 처리하고, 각 행에 어떤 결과가 적용될지 표시합니다 — 파일 크기 제한은 없으며, 큰 파일은 1000개씩 배치로 해석되고 진행 상황이 실시간으로 표시됩니다. 파일은 브라우저에서 파싱되며 — 값 자체만 전송됩니다.
| 결과 | 무엇을 의미하나요 |
|---|---|
exact | 정규화한 동일 텍스트가 이미 존재합니다 — 무료이며 모델 호출이 없습니다. |
matched | 다른 표현이 임계값 이상으로 기존 개념에 해석되었습니다. |
would_mint | 충분히 가까운 항목이 없습니다. 이 경우 보강 작업은 새 개념을 생성합니다. |
minted | 같은 상황에서 생성을 켠 모습 — 이제 개념이 존재합니다(소유자 전용). |
개념 유형은 선택하는 것이 아니라 입력하는 것입니다. 파일로 어휘를 시작하는 것은 지극히 일반적인 방식이므로, 이 필드는 이미 보유한 공간을 제안하면서도 아직 없는 이름도 받아들이고 — 그런 경우에는신규라고 표시합니다. 새 이름을 입력하면 나중에는 물을 수 없는 단 하나의 질문, 즉 그 개념들이 어떤 임베딩 모델에 존재할지를 묻게 됩니다. 여기서 답하면 임포트가 처음 생성하는 값과 함께 공간이 만들어집니다. 이후 어휘를 다른 모델로 옮기는 것은 마이그레이션 작업입니다.
실수가 두 번째 어휘로 굳어지지 않도록 두 가지 장치가 있습니다. 이미 보유한 공간의 이름을 입력하면 대소문자와 상관없이 그 공간이 선택되고, 기존 이름과 한두 글자만 다른 이름은 클릭 한 번으로 수정할 수 있도록 안내됩니다. 완전히 새로운 공간은 비교할 대상이 없으므로, 매칭 전용 실행은 단 한 행도 임베딩하지 않고 “모든 값이 생성될 것입니다”라고 답하며 — 비용도 청구하지 않습니다.
확정된 행은 별도의 CSV로 내려받을 수 있어, 가져오기를 순수한 감사 용도로도 쓸 수 있습니다. 900개의 공급업체 이름 중 이미 알려진 것은 무엇이고, 새 정체성을 만들게 될 것은 무엇인지 확인하는 식입니다. 내보내기는 반대 방향으로 동작하며 사용한 필터를 파일 이름에 반영하므로, 내보낸 파일이 쌓인 폴더도 그 자체로 내용을 설명합니다.
이 삭제는 대부분의 데이터 삭제와 달리 안전합니다. 다음 보강이 필요한 개념을 다시 만들어 내기 때문에 어휘는 스스로 복원됩니다. 돌아오지 않는 것은 이미 저장한 ID와의 수렴이며, 확인하기 전에 대화 상자가 실제 개수와 함께 이를 알려 줍니다.
이런 변경 후에 기존 개념을 그대로 두는 것은 신중한 선택이 아니라 위험한 선택입니다. 새 키로 구성된 아이덴티티가 여전히 옛 벡터의 임계값 안에 들어가 조용히 흡수될 수 있고, 그러면 이쪽도 저쪽도 아닌 의미의 ID만 남게 됩니다.
서로 다른 두 모델에서 생성된 벡터는 비교할 수 없으므로, 모델을 바꾸면 모든 개념을 다시 임베딩해야 합니다. 개념이 이미 존재한다면 이 마이그레이션이 유일하게 허용되는 방법이며, 조직의 임베딩 모델 설정이 저절로 바뀌지 않는 이유이기도 합니다.
미리보기는 재임베딩에 드는 비용과 함께 충돌할 가능성이 있는 개념 쌍, 즉 새 공간에서 서로 임계값 안에 들어와 함께 확정되기 시작할 쌍을 알려줍니다. 모든 쌍이 아니라 현실적인 후보만 측정하며, 그 사실도 함께 밝힙니다.
새 벡터가 옆에서 생성되는 동안 보강은 기존 공간에서 계속 해석되며, 그 사이에 새로 만들어진 개념은 이후 단계에서 처리됩니다. 전환은 마지막에 한 번에 이루어지며, 이때 조직의 기본 임베딩 모델도 함께 바뀝니다. 도중에 중단해도 문제가 없습니다. 다시 시작하면 멈춘 지점부터 이어집니다.
확인, 추가, 가져오기는 다른 임베딩 사용량과 동일하게 과금되며, 정확히 일치하는 경우에는 모델을 호출하지 않으므로 비용이 들지 않습니다. 탐색, 비교, 궤도 보기, 3D 맵, 내보내기, 삭제는 무료입니다. 하루 동안의 대화식 사용 비용은 크레딧 내역에 한 줄로 합쳐지므로, 장부가 소수점 단위 금액으로 채워지지 않고 읽기 쉬운 상태로 유지됩니다.