시작하기
Verifiers를 Weave와 통합하려면 먼저uv를 사용하여 Verifiers 라이브러리를 설치하세요(라이브러리 개발자 권장 방식). 다음 명령어 중 하나로 라이브러리를 설치할 수 있습니다.
롤아웃 트레이스 및 평가
필요한 라이브러리를 설치했다면 Weave와 Verifiers를 함께 사용하여 Call을 트레이스하고 평가를 실행할 수 있습니다. 다음 예시 스크립트는 Verifiers로 평가를 실행하고 결과를 Weave에 로깅하는 방법을 보여줍니다. 이 스크립트는 GSM8K 데이터셋을 사용하여 LLM의 수학 문제 풀이 능력을 테스트합니다. GPT-4에 수학 문제 두 개를 풀게 하고, 각 응답에서 숫자 값을 추출한 다음, Verifiers를 평가 프레임워크로 사용하여 답안을 채점합니다. 예시를 실행하고 Weave에서 결과를 확인하세요.실험 추적 및 트레이싱으로 모델 파인튜닝하기
Weave를 사용하면 RL 파인튜닝 중 모델의 성능을 자세히 파악할 수 있습니다. W&B와 함께 사용하면 워크플로 전반에 걸쳐 관측성을 확보할 수 있습니다. W&B는 트레이닝 메트릭과 성능 차트를 추적하고, Weave는 트레이닝 과정에서 일어나는 각 상호작용의 상세한 트레이스를 캡처합니다.verifiers 저장소에는 바로 실행할 수 있는 예시가 포함되어 있어 쉽게 시작할 수 있습니다.
다음 RL 트레이닝 파이프라인 예시는 로컬 추론 서버를 실행하고 GSM8K 데이터셋으로 모델을 트레이닝합니다. 모델이 수학 문제에 답하면 트레이닝 루프가 출력에 점수를 매기고 그 결과에 따라 모델을 업데이트합니다. W&B는 loss, reward, 정확도 등의 트레이닝 메트릭을 로깅하고, Weave는 입력, 출력, 추론, 점수화 과정을 캡처합니다.
이 파이프라인을 사용하려면 다음 단계를 따르세요.
- 소스에서 프레임워크를 설치합니다. 다음 명령어는 GitHub에서 Verifiers 라이브러리와 필요한 의존성을 설치합니다.
- 바로 사용할 수 있는 환경을 설치하세요. 다음 명령은 미리 설정된 GSM8K 트레이닝 환경을 설치합니다.
- 모델을 트레이닝하세요. 다음 명령어를 실행하면 추론 서버와 트레이닝 루프가 각각 시작됩니다. 이 예제 워크플로는 기본적으로
report_to=wandb로 설정되어 있으므로wandb.init()을 따로 호출할 필요가 없습니다. W&B에 메트릭을 로깅하려면 이 머신을 인증하라는 안내가 표시됩니다.
이 예제는 안정성을 높이기 위해 다음 환경 변수를 설정한 상태에서 2xH100으로 테스트했습니다.이 변수들은 디바이스 메모리 할당 시 CUDA Unified Memory(CuMem)를 비활성화합니다.
Environment.a_generate 및 Rubric.score_rollouts 메서드의 logprobs가 생략됩니다. 이렇게 하면 페이로드 크기는 작게 유지하면서 트레이닝에 사용되는 원본 데이터는 그대로 보존할 수 있습니다.