‖ Jev Trader

FAQ / Score

Jev Score 사용법: 평가 기준, 점수와 신뢰도

질문부터 시작해 등급을 정의하고 요청을 작성한 뒤 결과를 읽어 보세요. 원숭이 셀카 사례로 점수 뒤에 있는 확률 분포를 설명합니다.

사례 바로 보기 Jev Trader: Choice, Score, Noul을 통한 AI 거래 결정과 HYPE/USDC 및 MON/USDC 모의 거래.

Score는 언제 사용하나요?

문제의 심각도, 숙련도, 기여도처럼 답에 순서가 있는 척도를 사용할 때 적합합니다. 각 등급의 의미를 정의하면 모델이 그 척도에 따른 점수를 반환합니다.

Choice는 순서가 없는 선택지 중 하나를 고르고, Noul은 조건이 성립하는지 판단합니다. Score는 참인지 여부뿐 아니라 정도를 평가합니다.

Score 요청은 어떻게 작성하나요?

state에 사실과 맥락을 넣고 model로 모델을 선택하며 questions에 질문을 작성합니다. 평가 질문은 type: score를 사용하고, instructions에 평가 대상, criteria에 등급 설명을 지정합니다.

예시에서 원숭이 Naruto는 사진작가 Slater가 자리를 비운 사이 카메라 셔터를 눌러 셀카를 찍습니다. Slater는 이후 사진을 처리하고 골라 출판합니다. 두 질문은 같은 사진에 대한 각자의 기여를 평가합니다.

instructions의 백틱으로 감싼 subject, human, creative_work는 state 필드를 가리킵니다. subject_contribution 같은 질문 ID는 결과를 구분할 뿐 추론에 사용되지 않으므로 instructions에 완전한 질문을 작성해야 합니다.

전체 요청 예시

아래 주소에 POST 요청을 보내고 Authorization: Bearer <API_KEY>와 Content-Type: application/json 헤더를 사용합니다. 키는 서버에 보관하세요. 이 페이지는 요청을 실행하지 않으며, 다시 호출해도 스크린샷과 같은 결과가 보장되지 않습니다.

POSThttps://api.typesafe.ai/v1/systemone
{
  "state": {
    "scenario": "Naruto is a Celebes crested macaque living in the Tangkoko nature reserve in North Sulawesi, Indonesia. David Slater, a wildlife photographer shooting macaques in the reserve, leaves his camera unattended, and Naruto repeatedly activates the shutter, producing hundreds of images, including a remarkably sharp, grinning self-portrait reminiscent of a human selfie. Slater later processes and publishes the best photographs in a book that names him as the copyright owner. The book states that Naruto took the photographs, with captions like, 'Surely a sign of self-awareness?' Another caption reads, 'Naruto the macaque smiles at itself while pressing the shutter button on a camera.'",
    "subject": "Naruto",
    "human": "Slater",
    "creative_work": "the grinning self-portrait"
  },
  "model": "jev-latest",
  "questions": {
    "subject_contribution": {
      "type": "score",
      "instructions": "How much did `subject` contribute to `creative_work`?",
      "criteria": [
        "None",
        "Minorly",
        "Moderately",
        "Majorly",
        "Completely"
      ]
    },
    "human_contribution": {
      "type": "score",
      "instructions": "How much did `human` contribute to `creative_work`?",
      "criteria": [
        "None",
        "Minorly",
        "Moderately",
        "Majorly",
        "Completely"
      ]
    }
  }
}

평가 기준은 어떻게 정의하나요?

criteria를 낮은 등급부터 높은 등급 순서로 나열하고 최소 두 등급을 포함합니다. 배열 인덱스가 0부터 시작하므로 예시의 None, Minorly, Moderately, Majorly, Completely는 0~4점입니다.

실제로 사용할 때는 평가 범위를 정하고 각 등급을 구체적인 상황으로 설명하세요. 장비 준비, 구도, 셔터 조작, 후처리를 포함하는지 명시하고 질문 하나당 한 측면을 평가합니다. 알려진 사례로 기준을 검증하세요.

응답은 어떻게 읽나요?

answers는 질문 ID별로 결과를 반환합니다. score는 확률 가중 점수, legend는 등급 인덱스와 설명의 대응, probabilities는 합이 1인 등급별 확률, confidence는 판단의 확실성을 요약한 값입니다.

score = Σ(i × pᵢ)에서 i는 0부터 시작하는 등급 인덱스, pᵢ는 해당 확률입니다. 따라서 점수는 정수 등급 사이에 위치할 수 있습니다.

서로 다른 분포가 같은 점수를 만들 수 있습니다. 모든 확률이 2등급에 있거나 0등급과 4등급에 절반씩 있어도 평균은 2입니다. 점수와 분포를 함께 읽어야 합니다.

등급별 확률로 계산한 가중 평균
score = Σ(i × pᵢ)

confidence는 무엇을 의미하나요?

confidence는 전체 확률 분포에서 계산한 0~1 통계량으로 분포의 확실성을 요약합니다. 점수 크기와 확실성은 별개이므로 낮은 점수에도 높은 신뢰도가 나올 수 있습니다.

가장 큰 등급 확률과 같지 않으며 정답률로 직접 해석할 수도 없습니다. 확인한 공식 문서에는 정확한 계산식이 공개되어 있지 않습니다. confidence가 1이어도 정답을 보장하지 않습니다.

원숭이 셀카 사례의 점수는 어떻게 계산하나요?

스크린샷에서 Naruto의 확률은 주로 기여와 전적으로 기여에 집중되고, Slater는 약간 기여에 집중됩니다. 요약 점수를 보기 전에 전체 분포를 살펴보세요.

표시된 정수 백분율로 계산하면 Naruto는 3.52, Slater는 1.20이지만 스크린샷 점수는 3.51과 1.18입니다. 표시 반올림 때문일 수 있으나 원래 응답 없이 정확한 원인을 확인할 수는 없습니다.

Naruto의 신뢰도는 59%, Slater는 68%입니다. 기여 점수가 높다고 신뢰도도 높은 것은 아닙니다.

원숭이 Naruto

3.51/ 4

신뢰도 59%

사진작가 Slater

1.18/ 4

신뢰도 68%

스크린샷에 표시된 5단계 확률 분포
점수기여 정도NarutoSlater
0기여 없음
0%
10%
1약간 기여
0%
69%
2중간 정도 기여
3%
13%
3주로 기여
42%
7%
4전적으로 기여
55%
1%

실시간 모델 결과가 아닌 사례 스크린샷의 기록입니다. 확률은 정수 백분율로 표시됩니다.

Naruto2 × 0.03 + 3 × 0.42 + 4 × 0.55 = 3.52

Slater1 × 0.69 + 2 × 0.13 + 3 × 0.07 + 4 × 0.01 = 1.20

어떤 해석을 주의해야 하나요?

두 질문은 하나의 총량을 나누지 않고 독립적으로 평가합니다. 점수 합이 4일 필요가 없습니다. 3.51을 4로 나누는 것은 점수 정규화일 뿐 실제 기여 비율이 87.75%라는 뜻은 아닙니다.

기여도는 창작 의도나 저작권 소유를 확정하지 않습니다. Naruto의 셔터 조작과 Slater의 장비 제공 및 후처리는 점수 해석에 도움이 되지만 이야기로부터의 해석일 뿐입니다. 스크린샷에는 모델의 설명이 없습니다.

실제 흐름에 적용하기 전에 기여의 의미를 명확히 하고 알려진 결과로 평가 기준을 검증하며 score, probabilities, confidence를 함께 확인하세요.