같은 종류의 엔터티를 반복해서 보강하다 보면, 같은 회사, 같은 약물 부작용, 같은 사람처럼 동일한 현실 세계의 대상을 매번 조금씩 다른 표현으로 계속 다시 발견하게 됩니다. 시맨틱 ID는 Entity Enricher가 객체의 핵심 필드로부터 부여하는 안정적인 조직 범위 식별자로, 이러한 유사 중복 항목이 그룹화, 중복 제거, 조인이 가능한 하나의 정체성으로 통합됩니다.
객체의 정체성은 키 필드로 구성되며, 하나 또는 여러 개일 수 있습니다. 두 가지 예시:
name을 키로 하는 부수 효과입니다실행과 언어에 따라 Headache, Céphalée, Cephalalgia로 나타납니다. 하나의 키 필드, 세 가지 표기, 하나의 실제 개념입니다.
이름 + 국가로 키가 지정된 회사Acme Inc. · United States와 Acme Incorporated · United States는 같은 회사이지만, Acme Inc. · Germany는 다른 회사입니다. 두 번째 키가 이를 구분해 주며, 그래서 하나의 객체가 여러 키를 가질 수 있습니다.
단순 문자열 매칭은 이 모든 경우에 실패하지만, 사람은 어느 것이 동일한지 압니다. 시맨틱 ID는 그러한 판단을 자동으로 인코딩합니다.
string 속성(기본 이름은 id)으로, 불투명하고 안정적인 식별자를 담습니다.manufacturer), 또는 배열의 각 항목(예: 각 side_effect).모델이 결과를 반환하면 Entity Enricher는 각 시맨틱 ID를 여섯 단계에 걸쳐, 비용이 낮은 순서대로 해석합니다. 임베딩 이전의 네 단계는 순수한 텍스트 비교이므로, 그 단계에서 확정된 아이덴티티는 비용이 전혀 들지 않습니다:
null이 되고, 목록 안의 항목은 목록에서 삭제됩니다. 보강 대상 엔티티 자체는 절대 제거되지 않으며, 단지 ID가 없을 뿐입니다.LC-39A는 나머지 텍스트가 어떻게 쓰였든 모두 하나로 통합합니다. 반대 방향도 그만큼 중요합니다. 코드가 다르면 임베딩 단계에서라면 승인되었을 병합도 거부됩니다. 식별자가 다른 두 대상은 아무리 비슷하게 읽히더라도 서로 다른 두 대상이기 때문입니다.“Boeing”과 “The Boeing Company”처럼 말입니다. 이 방식은 임베딩이 서로 멀다고 판정하는 바로 그 표현 길이 차이를 잡아내며, 비용도 전혀 들지 않습니다. 정확한 텍스트 비교 단계와 마찬가지로, 여기서 일치하면 임베딩 호출도 과금도 없습니다.“Acme Inc.”와“Acme Incorporated”가 서로 가까이 놓입니다.0.92, 속성별 조정 가능)을 넘으면 해당 개념의 ID가 재사용됩니다. 그렇지 않으면 완전히 새로운 ID가 생성되어 다음을 위해 저장됩니다. 점수가 높아도 예외가 하나 있습니다. 두 텍스트가 같은 단어로 이루어져 있고 세는 수만 다른 경우 — “두 번째 단계”와“세 번째 단계” — 서로 다른 것으로 처리됩니다. 숫자를 세는 것이 바로 둘을 구분하는 기준이기 때문입니다. 같은 숫자를 다르게 표기한 경우(2와II)는 여전히 일치합니다.임계값 트레이드오프: 임계값이 높을수록 더 엄격하고(우발적 병합 감소), 낮을수록 더 느슨합니다(더 공격적인 중복 제거). 기본값 0.92가 과도하게 병합하거나 부족하게 병합할 때 property별로 조정하세요.
ID가 생성되는지는 해당 객체의 입력에 이미 존재하는지에 따라 달라집니다. 이것이 왕복(round-trip)을 가능하게 합니다: 한 번 보강하여 ID를 얻은 다음, 이후 실행에서 알려진 ID를 다시 전달하여 동일한 정체성에 새로운 정보를 붙일 수 있습니다 — 더 저렴하고 모호하지 않습니다.
전송하는 객체에 이미 시맨틱 ID가 있으면 조회로 처리됩니다. ID는 그대로 유지되고, 레코드는 기존 개념에 연결되며, 임베딩이 없습니다 — 비용도, 일치 또는 생성도 없습니다. 플랫폼에 "이 객체는 이미 우리 데이터베이스에서 식별되었습니다"라고 알려주는 것입니다.
객체에 시맨틱 ID가 없으면 플랫폼이 위 단계에 따라 생성합니다. 이후 그 ID는 조직 데이터베이스에서 해당 객체의 고정 식별자가 됩니다.
존재하지만 인식할 수 없는 값(실제 개념 ID가 아닌 값)은 무시되며, 대신 ID가 생성됩니다.
해석은 강화당 소량의 임베딩 사용량이 듭니다(다른 모델 호출과 마찬가지로 측정됨). 정확히 일치하는 캐시는 반복 시 무료이며, 입력으로 제공된 ID는 비용이 들지 않습니다.
확정된 ID는 보강 결과 JSON(각 객체의 id 필드)과 레코드 상세의 시맨틱 개념에 표시되며, 이들이 이루는 어휘를 탐색하고 큐레이션하는 시맨틱 ID 페이지에 모두 모여 있습니다. 다음 용도로 활용하세요:
융합은 단일 실행 내에서 모델 간의 불일치를 조정하고, 시맨틱 ID는 여러 실행과 시간에 걸쳐 동일한 엔티티를 조정합니다. 이 둘은 함께 작동합니다.