How to generate reward-labeled dataset
Open
feature request
- Dominant language
- Python
- Stars
- 4.8k
- Forks
- 487
- PR merge metrics
- No merged PRs in 30d
Description
### 🚀 The feature, motivation, and pitch
Would like to fine-tune either using a reward model or using a reward-labeled dataset, however am unable to find any references to how such a dataset looks like or how to generate it. Hope you care to elaborate, as I am new to this.
### Alternatives
_No response_
### Additional context
_No response_
Contributor guide
Assessment
This issue has not been assessed yet.