HF RL Explorer

AdithyaSK/data_agent_rl_environment_train_multireward

AdithyaSK/data agent rl environment train multireward: Harbor dataset on Hugging Face with 2,238 tasks. Multi-reward variant of AdithyaSK/data agent rl environment train (2238 tasks, identical data/instructions). The only change: each task's verifier now emits a reward.json with three named…

Tasks

2,088 more tasks.

AdithyaSK/data_agent_rl_environment_train_multireward on the Hugging Face Hub