HF RL Explorer

karthik/gsm8k-base-vs-verl-comparison

gsm8k-base-vs-verl-comparison: GSM8K: BASE vs VERL-trained Model Comparison Dataset: RL dataset on Hugging Face. This dataset provides a comprehensive comparison between a base language model and its VERL (Reinforcement Learning from Human Feedback) fine-tuned version on mathematical reasoning…

karthik/gsm8k-base-vs-verl-comparison on the Hugging Face Hub