Reinforcement Learning on Atari-10 (test)
1.64IQM Human-Normalized ScoreREPPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| REPPO2025.07 | 1.64 | 2.98 | 1.68 | — | — | |
| PQN2025.07 | 1.64 | 3.35 | 1.58 | — | — | |
| DSAC (τ, 0)Entropy Setting=adaptive actor entropy, no critic entropy2025.09 | 0.6951 | — | — | 0.6497 | 0.7413 | |
| Adam LMCDQNtype=Baseline2025.09 | 0.5862 | — | — | 0.547 | 0.6299 | |
| DQNtype=Baseline2025.09 | 0.4742 | — | — | 0.4558 | 0.4958 | |
| PPOtype=Baseline2025.09 | 0.3225 | — | — | 0.2664 | 0.3825 | |
| TES-SACtype=Baseline2025.09 | 0.3022 | — | — | 0.2497 | 0.3485 | |
| SD-SACtype=Baseline2025.09 | 0.2053 | — | — | 0.1928 | 0.2188 |