HF RL Explorer

keryszhan/harbor-swesmith-rl-artifacts

harbor-swesmith-rl-artifacts: Harbor SWE-Smith 强化学习数据产物: Harbor dataset on Hugging Face with 267 tasks. 本数据集是 Harbor Qwen 工具调用代码智能体强化学习项目使用的冻结任务集,服务于 GRPO、原生价值模型/GAE PPO、训练过程诊断和统一协议评测。 项目已于 2026 年 8 月 30 日完成 P0 评测并进入阶段性归档。本数据集用于保留实验所依赖的数据切分、任务执行文件和审计信息,不代表新的通用代码能力基准。

Tasks

117 more tasks.

keryszhan/harbor-swesmith-rl-artifacts on the Hugging Face Hub