Reinforcement Learning on Humanoid v5
5,906.7Performance ScoreSAC+DBC(*)
Evaluation Results
| Method | Links | |
|---|---|---|
| SAC+DBC(*)Algorithm=SAC, Critic=DBC2026.02 | 5,906.7 | |
| QVPO+DBC(*)Algorithm=QVPO, Critic=DBC2026.02 | 5,426.3 | |
| TD3+DBC(*)Algorithm=TD3, Critic=DBC2026.02 | 5,343.2 | |
| SAC+TQCAlgorithm=SAC, Critic=TQC2026.02 | 5,269 | |
| SAC+CDQAlgorithm=SAC, Critic=CDQ2026.02 | 5,207.1 | |
| QVPO+CDQAlgorithm=QVPO, Critic=CDQ2026.02 | 5,068.3 | |
| TD3+CDQAlgorithm=TD3, Critic=CDQ2026.02 | 5,067.8 | |
| SAC+VFAlgorithm=SAC, Critic=VF2026.02 | 4,950.3 | |
| SAC+VDAlgorithm=SAC, Critic=VD2026.02 | 4,886.9 | |
| SAC+IQNAlgorithm=SAC, Critic=IQN2026.02 | 4,729.2 | |
| SAC+DSACAlgorithm=SAC, Critic=DSAC2026.02 | 3,442.6 |