채점은 벤치마크를 “JSON을 눈으로 확인”하는 방식에서 객관적인 수치로 바꿔줍니다. 각 모델의 결과는 골드 참조 — 예상 출력 — 기준으로 채점되어, 정렬 가능한 완전성, 정확성, 전체 품질 점수를 산출합니다.
채점하려면 기준이 될 무언가가 필요합니다. 각 시나리오에는 참조 출력이 담겨 있습니다. 즉, 고정된 하나의 엔터티에 대한 정답입니다. 강력한 모델로 생성하거나(웹 검색 + 신뢰 출처 문서), 검증된 결과를 붙여넣은 뒤 직접 편집하여 만들고 — 신뢰할 수 있게 되면 검증됨으로 표시하세요. 검증된 참조는 시나리오를 벤치마크하는 데 필수이므로, 채점 기준이 항상 존재합니다. 나중에 참조를 편집하거나 시나리오의 채점 구성을 변경하면, 기존 점수는 다시 채점할 때까지 오래됨으로 표시됩니다.
레퍼런스는 스스로 갱신되기도 합니다. 검증된 레퍼런스도 결국 직접 손본 초안이며, 벤치마크하는 모델들이 그 검토자 역할을 합니다. 판정자가 후보의 답이 레퍼런스보다 낫다고(또는 레퍼런스가 틀렸다고) 판단한 곳, 시나리오의 샘플이 레퍼런스의 오류를 입증한 곳, 레퍼런스가 비워 둔 값을 모델이 채우고 판정자가 이를 확인한 곳마다 결과에 발견 사항이 기록됩니다. 채점 패스가 끝날 때마다 채점된 모든 모델의 발견 사항이 통합되어 — 먼저 샘플이 입증한 내용, 그다음 가장 많은 모델이 내놓은 답 — 레퍼런스에 기록됩니다. 어떤 패스가 이미 적용한 수정은 더 강력한 근거(샘플, 값이 틀렸다는 판정, 또는 여러 패스에 걸쳐 집계된 더 많은 모델의 동의)에 의해서만 대체되며, 모델 하나의 의견이 더해진다고 해서 대체되지는 않습니다. 따라서 모델을 하나씩 벤치마크해도 레퍼런스가 마지막으로 채점된 모델 쪽으로 치우치지 않습니다. 이러한 자동 수정은 점수를 만료로 표시하지 않으며(직접 저장할 때만 만료됩니다), 무엇을 대체했고 어떤 모델이 제기했는지가 모두 기록됩니다.
변경 내용 추적처럼 검토하세요. 결과 옆에 있는 시나리오의 레퍼런스 보기에는 레퍼런스 자체와 함께 모든 자동 수정이 해당 위치에 강조 표시됩니다. 취소선이 그어진 이전 값, 새 값, 이를 뒷받침하는 모델 수와 그 이유를 볼 수 있습니다. 거부하지 않는 한 모든 변경이 수락됩니다. 거부하면 이전 값이 복원되고 해당 경로는 이후 패스에서 제외됩니다. 속성이나 근거로 필터링하고(모델 1개만 반영된 수정은 살펴볼 가치가 있습니다), 표시된 항목을 선택해 일괄 거부하세요.
핵심 문제: 두 개의 올바른 답이 다르게 표기될 수 있습니다. 배우를 “Robert Downey Jr.” 대신 “R. Downey Jr.”라고 표기하는 모델이 틀린 것은 아닙니다. 그래서 각 필드는 계층적 단계로 비교됩니다 — 가장 저렴하고 확실한 것부터 시작하여 필요할 때만 상위 단계로 올라갑니다:
동일한 값은 일치합니다. 대소문자, 주변 공백 또는 숫자 정밀도만 다른 값도 일치합니다("Acme" = "ACME", 4.0 = 4). 무료이며 완전히 결정론적입니다.
텍스트의 경우 후보와 참조가 임베딩되어 코사인 유사도로 비교됩니다. 임계값을 초과하면 동일한 것으로 간주되므로 "R. Downey Jr."와 "Robert Downey Jr."처럼 유효한 다른 표기는 오류가 아닌 일치로 처리됩니다. 날짜는 예외입니다. 유사도가 아니라 항상 달력 값으로 비교되므로, 근접하지만 잘못된 날짜("1972-03-14" 대 "1972-03-24")는 겉보기에 높은 코사인이 아니라 명확한 불일치로 처리됩니다. 불리언 값도 마찬가지로 정확히 일치하거나 아니거나입니다.
유사도만으로는 판정하기 어려운 값 — 요약이나 설명 같은 모든 자유 텍스트 필드, 완전히 일치하지 않는 모든 숫자, 그리고 사용자의 문서나 다른 대부분의 모델이 뒷받침하는 명백히 다른 값 — 은 심사 모델로 전달됩니다. 심사 모델은 블라인드로 동작합니다. 두 값을 A와 B로만 보고, 스키마에서 해당 필드가 놓인 위치(상위 항목과 그 설명, 타입, 어떤 리스트 항목에 속하는지)와 시나리오에 원본 문서가 있는 경우 그 문서를 함께 참고하여, 어느 쪽이 그 필드에 더 적합한지, 둘 다 맞는지, 아니면 한쪽이 틀렸는지를 판정합니다. 레퍼런스와 동등하거나 더 낫다고 판정된 후보 값 — 또는 레퍼런스가 틀렸다고 판정된 경우 — 은 만점을 받고, 더 약한 답은 부분 점수를, 틀린 답은 거의 또는 전혀 점수를 받지 못합니다. 숫자는 필드가 오차를 허용하는 경우 부분 점수를 받고(분자량 273.37 대 273.35, 반감기 12 대 15), 정확성이 중요한 경우에는 오답으로 처리됩니다(출시 연도 2020 대 2023). 레퍼런스가 비워 둔 값은 단독으로 검증합니다. 맞다고 확인되면 레퍼런스가 담고 있어야 했는데 모델이 찾아낸 값으로 간주되어 — 단순히 감점을 면하는 데 그치지 않고 점수가 올라갑니다 — 레퍼런스에도 그 값이 반영됩니다.
엄격도 설정은 임베딩 임계값을 제어합니다: 값이 높을수록 다르게 작성된 두 값이 같은 것으로 간주되려면 더 유사해야 합니다. 엄격도, 선택적 판정 모델, 임베딩 모델은 모두 시나리오에 설정되며 — 채점할 때마다 선택하는 것이 아니므로 — 모든 모델이 동일하게 채점되어 점수가 비교 가능한 상태로 유지됩니다.
목록 — 영화의 출연진, 약물의 부작용 — 은 모델 간 차이가 가장 큰 부분입니다: 작은 모델은 배우 4명을 찾는 반면 강력한 모델은 15명을 찾을 수 있습니다. 순서는 중요하지 않으며, 더 많은 올바른 항목을 찾는 것이 우선되어야 합니다. 따라서 배열은 위치별이 아니라 집합으로 채점됩니다:
결과 행을 펼치면 어떤 항목이 일치했는지, 누락되었는지, 잘못 생성되었는지 정확히 확인할 수 있습니다.
단일 숫자는 너무 많은 것을 감추므로, 모든 결과에는 세부 점수가 함께 제공됩니다:
확장 가능한 행에는 필드별 세부 내역이 표시됩니다: 후보 대 참조, 사다리의 어느 단계에서 결정되었는지, 그리고 해당되는 경우 유사도가 표시됩니다.
품질은 전체의 3분의 1에 불과합니다. 벤치마크가 점수 소스로서 모델 선택에 반영될 때, 모델의 순위는 품질·속도·비용을 조합해 결정되며 그 비율은 사용자가 정합니다. 설정 → 조직 → 기본값에서 시나리오 유형별로 설정할 수 있으며, 합계는 100이고 기본값은 균등 분할입니다. 비용에 큰 가중치를 주면 저렴하고 무난한 모델이 뛰어나지만 비싼 모델보다 높은 순위를 차지합니다. 이는 어떤 작업에는 정답이고 다른 작업에는 오답이므로, 플랫폼은 이 판단을 대신 내리지 않습니다. 속도와 비용은 해당 시나리오의 다른 결과를 기준으로 로그 스케일에서 해석합니다. 가장 빠르거나 가장 저렴한 모델은 100점, 10배 느리거나 비싼 모델은 0점을 받습니다. 다만 격차가 작은 경우 억지로 전체 범위에 맞춰 늘리지 않으므로, $10과 $12인 두 모델은 100점과 0점이 아니라 100점과 92점이 됩니다.
시나리오가 모델을 두 번 이상 실행하면(반복), 각 실행이 개별적으로 채점되고 행에는 평균 품질과 일관성 범위(실행 중 최저–최고)가 표시됩니다 — 따라서 평균적으로는 정확하지만 들쭉날쭉한 모델을 쉽게 발견할 수 있습니다. 표시되는 출력은 품질 기준 중앙값 실행입니다.
벤치마크는 보강에만 국한되지 않습니다. 시나리오는 샘플 생성(각 모델이 동일한 자유 텍스트 요청에 대해 예시 JSON을 만들어 냄) 또는 스키마 생성(각 모델이 고정된 샘플을 스키마로 변환)도 테스트할 수 있습니다. 각각 고유한 채점 규칙이 있습니다:
어느 경우든 익숙한 열들은 그 의미를 유지합니다 — 유형별 정의를 보려면 열 머리글에 마우스를 올리고, 전체 세부 내역을 보려면 행을 펼치세요.
채점은 이미 저장된 결과에 대한 별도의 패스입니다 — 다시 보강하지 않으므로 테스트 대상 모델에 비용을 다시 지불하지 않습니다. 다만 값을 비교하기 위해 텍스트를 임베딩하고(시나리오에 심판이 있으면 심판도 실행하므로) 이때 사용량에 따라 크레딧이 차감됩니다. 이 과정은 모든 실행 중에 자동으로 수행되며 — 각 모델은 실행이 끝나는 즉시 채점됩니다 — 다시 채점할 때마다 반복됩니다. 조직에 임베딩 모델이 구성되어 있지 않고 시나리오에도 재정의가 없으면, 채점은 계속 실행되지만 정확 일치 비교로만 대체되며(이 경우 다른 표기는 불일치로 계산됩니다) 그 사실을 알려줍니다. 심판 오류는 다릅니다. 심판 호출이 실패하면 채점은 명시적인 오류와 함께 중단되고 해당 모델에는 부분 점수가 남지 않습니다 — 결과는 완전히 채점되거나 전혀 채점되지 않으며, 나중에 다시 채점할 수 있습니다. 심판의 답변은 내용을 기준으로 시나리오별로 캐시됩니다. 다른 모델이 제기한 동일한 질문이든, 반복이든, 패스든 두 번 비용을 지불하지 않으며, 레퍼런스가 스스로 업데이트된 뒤 다시 채점하면 수정된 필드의 질문만 다시 묻습니다. 심사자가 하는 일은 무엇도 숨겨지지 않습니다. 모델에 대한 모든 채점 과정은 History에 채점 레코드를 남기며, 심사 호출마다 프롬프트, 답변, 토큰, 비용이 한 행씩 기록되고 실패한 호출도 포함되며, 캐시가 무료로 답변한 질문 수도 함께 표시됩니다. 또한 결과 테이블에는 각 모델의 심사 비용, 호출 수, 채점 시간이 해당 레코드 링크와 함께 표시됩니다. 판정자를 선택할 때, LLM 판정자는 자신과 같은 모델 계열을 선호할 수 있다는 점에 유의하세요 — 벤치마크하지 않는 제공자의 판정자를 선택하는 것이 좋습니다.
모델 관리 → 벤치마크에서 시나리오 편집기를 통해 레퍼런스를 설정하고 검증하세요(심판 모델, 임베딩 모델, 엄격도도 여기서 선택합니다). 그 이후로는 모든 실행이 성공한 결과를 자동으로 채점합니다 — 정렬 가능한 품질 열이 별도 작업 없이 채워집니다. 레퍼런스나 채점 설정을 수정한 뒤 다시 채점하려면 결과 다시 채점(헤더 버튼 또는 ··· 메뉴)을 사용하세요. 레퍼런스 상태 옆의 레퍼런스 업데이트 배지를 열면 채점 패스가 변경한 내용의 로그가 표시되며, 항목별로 되돌릴 수 있습니다.