我在用 ALL 的 SAC 跑连续控制时发现,只把环境 action space 从 -1, 1 线性放大到比如 -2, 2 , SoftDeterministicPolicy 返回的…
我在用 ALL 的 SAC 跑连续控制时发现,只把环境 action space 从 -1, 1 线性放大到比如 -2, 2 , SoftDeterministicPolicy 返回的…: a task in MiMo-V2.6-RL-oss: Agentic RL Environments (MiMo RL release). Problem Statement 我在用 ALL 的 SAC 跑连续控制时发现,只把环境 action space 从 -1, 1 线性放大到比如 -2, 2 ,SoftDeterministicPolicy 返回的 log prob、entropy 和…
The task
Problem Statement 我在用 ALL 的 SAC 跑连续控制时发现,只把环境 action space 从 [-1, 1] 线性放大到比如 [-2, 2],SoftDeterministicPolicy 返回的 log_prob、entropy 和 policy loss 就会明显跟着尺度变,训练表现也飘得很厉害。另外我开了 clip_grad 后,有次梯度范数已经是 NaN/Inf,step() 还是继续往下跑了;我这边环境用的是 torch 1.9,但包依赖看起来还卡在 1.8。 Expected outcomes…
Part of XiaomiMiMo/MiMo-V2.6-RL-oss.