Skip to main content
이것은 대화형 노트북입니다. 로컬에서 실행하거나 아래 링크를 사용할 수 있습니다:

리더보드 빠른 시작

이 노트북에서는 Weave의 리더보드를 사용하여 다양한 데이터셋과 점수 함수에서 모델 성능을 비교하는 방법을 배웁니다. 구체적으로 다음을 수행합니다:
  1. 가짜 우편번호 데이터 데이터셋 생성하기
  2. 점수 함수를 작성하고 기준 모델 평가하기
  3. 이러한 기술을 사용하여 모델과 평가의 매트릭스를 평가하기
  4. Weave UI에서 리더보드 검토하기

1단계: 가짜 우편번호 데이터 데이터셋 생성하기

먼저 generate_dataset_rows 함수를 만들어 가짜 우편번호 데이터 목록을 생성합니다.

2단계: 점수 함수 작성하기

다음으로 3개의 점수 함수를 작성합니다:
  1. check_concrete_fields: 모델 출력이 예상 도시 및 주와 일치하는지 확인합니다.
  2. check_value_fields: 모델 출력이 예상 인구 및 중간 소득의 10% 이내인지 확인합니다.
  3. check_subjective_fields: LLM을 사용하여 모델 출력이 예상 “알려진 특징” 필드와 일치하는지 확인합니다.

3단계: 간단한 평가 만들기

다음으로 가짜 데이터와 점수 함수를 사용하여 간단한 평가를 정의합니다.

4단계: 기준 모델 평가하기

이제 정적 응답을 반환하는 기준 모델을 평가합니다.

5단계: 더 많은 모델 만들기

이제 기준 모델과 비교할 2개의 모델을 더 만듭니다.

6단계: 더 많은 평가 만들기

이제 모델과 평가의 매트릭스를 평가합니다.

7단계: 리더보드 검토하기

UI에서 리더보드 탭으로 이동하여 “Create Leaderboard”를 클릭하여 새 리더보드를 만들 수 있습니다. Python에서 직접 리더보드를 생성할 수도 있습니다: