HF RL Explorer

Align KTO with DPO: Remove enforcement of causal language models

Align KTO with DPO: Remove enforcement of causal language models: a task in trl-r2e-v0-1 (Harbor dataset). Title: Align KTO with DPO: Remove enforcement of causal language models

The task

**Title:** Align KTO with DPO: Remove enforcement of causal language models

Part of AdithyaSK/trl-r2e-v0-1.