Skip to main content
これはインタラクティブなノートブックです。ローカルで実行するか、以下のリンクを使用できます:

リーダーボードクイックスタート

このノートブックでは、Weaveのリーダーボードを使用して、異なるデータセットとスコアリング関数間でモデルのパフォーマンスを比較する方法を学びます。具体的には、以下を行います:
  1. 架空の郵便番号データのデータセットを生成する
  2. いくつかのスコアリング関数を作成し、ベースラインモデルを評価する。
  3. これらの手法を使用して、モデルと評価のマトリックスを評価する。
  4. Weave UIでリーダーボードを確認する。

ステップ1:架空の郵便番号データのデータセットを生成する

まず、generate_dataset_rowsという関数を作成し、架空の郵便番号データのリストを生成します。

ステップ2:スコアリング関数を作成する

次に、3つのスコアリング関数を作成します:
  1. check_concrete_fields:モデル出力が期待される都市と州に一致するかどうかをチェックします。
  2. check_value_fields:モデル出力が期待される人口と中央値所得の10%以内であるかどうかをチェックします。
  3. check_subjective_fields:LLMを使用して、モデル出力が期待される「known for」フィールドに一致するかどうかをチェックします。

ステップ3:シンプルな評価を作成する

次に、架空のデータとスコアリング関数を使用してシンプルな評価を定義します。

ステップ4:ベースラインモデルを評価する

ここでは、静的な応答を返すベースラインモデルを評価します。

ステップ5:さらにモデルを作成する

ここでは、ベースラインと比較するためにさらに2つのモデルを作成します。

ステップ6:さらに評価を作成する

ここでは、モデルと評価のマトリックスを評価します。

ステップ7:リーダーボードを確認する

UIのリーダーボードタブに移動し、「Create Leaderboard」をクリックすることで新しいリーダーボードを作成できます。 Pythonから直接リーダーボードを生成することもできます: