再ラベル付けが有効な場合
本番のモデル出力が、生徒モデルに学習させたい動作ではない場合は、リラベルを行います。たとえば、次のような場合です。- より高性能なモデルを使って、質が低い回答や一貫性のない回答を修正できる場合。
- 指示内容や構造化出力の要件が変更された場合。
- 本番データの入力は適切だが、ラベルにノイズが含まれている場合。
- トレーニングの前に 2 つの教師モデルを比較したい場合。
再ラベル付け戦略を選択する
以下のセクションでは、2 つの再ラベル付け戦略について説明します。出力を再生成する
モデルは、元のモデルとまったく同じ形で各リクエストを受け取りますが、既存の出力は受け取りません。そのうえで新たに回答を生成します。より強力な教師モデルや、更新された指示に従うモデルなど、モデルの動作を変えたい場合にこの戦略を使用します。修正済みの出力を作成する
モデルは、元の回答と再ラベル付けの指示をコンテキストとして受け取り、修正したバージョンを生成します。元の出力がほぼ正しく、その意図、スタイル、構造、ツール使用の判断を維持しながら、特定の箇所を修正したい場合に、この方法を使用してください。 修正用の run では、次の 2 つの追加設定を指定できます。- 再ラベル付けの指示: モデルが元の出力をどのように扱うかを指定します。デフォルトでは、明確で重大な誤りが含まれていない限り、モデルは元の出力を正しいものとして扱います。元の出力に誤りがある場合、モデルは元の意図、スタイル、構造、ツール使用の判断を維持するために、最小限の修正を行います。指示には最大 20,000 文字を含められます。
- 参照用の会話: タスクの例として、トレーニング用の分割から無作為に選択される完全な会話です。各リクエストにはこれらの会話が含まれます。デフォルトは 10、最大は 50 です。含めない場合は、0 を使用してください。UI には、リクエストあたりの推定追加入力トークン数が表示されます。これらの例は、プロバイダーがキャッシュできる固定の接頭辞を構成します。
リラベルを実行する
リラベルを実行するには、次のステップを完了します。- project の Datasets ページで、準備完了のデータセットを選択します。
- Relabel を選択します。Relabel with… で、モデルを選択します。
- 再ラベル付け戦略を選択します。
- Create revised outputs で、参照用の会話の数と再ラベル付けの指示を確認します。
- オプション: データセットのリビジョンを W&B Weave にパブリッシュした場合は、Publish outputs to Weave を選択して、完了した出力をそのリビジョンと並べてパブリッシュします。
- リラベル run を開始するには、Relabel dataset を選択します。
- 元の出力とリラベル後の出力を並べて確認します。
- 変更のない行やエラーが発生した行をフィルターします。
- ファインチューンを作成する際に、リラベル run をトレーニング出力として選択します。
- 比較評価でプライマリ参照として使用します。
API: データセットをリラベルする (POST /tasks/{alias}/datasets/{datasetId}/relabels)
API: データセットをリラベルする (POST /tasks/{alias}/datasets/{datasetId}/relabels)
データセット ID を置き換え、登録済みのプロバイダーモデルを選択します。出力を再生成するには、次のようにします。修正した出力を作成するには、完了した出力を、データセットのパブリッシュ済みリビジョンと並べて Weave にパブリッシュするには、いずれかのリクエストに
use_original_output を true に設定します。instructions と reference_conversation_count を省略すると、前述のデフォルトを使用できます。"publish_to_weave": true を追加します。応答には、リラベル run の ID とステータスが含まれます。リラベル run を開始するを参照してください。新しい行に戦略を再利用する
リラベル済みのデータセットにトラフィックを追加した後、既存の再ラベル付け戦略を再利用して、新しい行だけをリラベルできます。既存のリラベル run は以前のリビジョンのみを対象としているため、新しい行の出力がなく、run は古い状態になります。 UI では、モデル、戦略、指示、参照用の会話の数が同じリラベル run を、1 つの再ラベル付け戦略にまとめます。データセットの Active outputs メニューには、モデル別に戦略が一覧表示され、Regenerate または Revise v0、Revise v1 などのラベルが付けられます。 新しい行をリラベルするには、Active outputs メニューで戦略を選択します。UI には出力がない行の数が表示され、既存の出力を引き継いで、新しい行の出力だけが生成されます。API: 新しい行に戦略を適用する (POST /tasks/{alias}/datasets/{datasetId}/relabels/{relabelRunId}/apply-missing)
API: 新しい行に戦略を適用する (POST /tasks/{alias}/datasets/{datasetId}/relabels/{relabelRunId}/apply-missing)
完了済みまたは古い状態のリラベル run の ID を渡します。Model Distillation は、現在のデータセットのリビジョンに対して新しい run を作成し、既存の出力を再利用して、不足している出力だけを生成します。リクエストは、新しい run とともに
202 Accepted を返します。新しい行に再ラベル付け戦略を適用するを参照してください。