Continual Reinforcement Learning on CoinRun Normalized Continual Learning
1.34Max PerformanceARROW
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ARROWTask Order=Reversed Task Order, 85% Threshold=1.14, Frame at Middle=4,423,6802026.03 | 1.34 | 3,768,320 | 100 | |
| ARROWTask Order=Two-Cycle Training, 85% Threshold=1.13, Frame at Middle=4,423,6802026.03 | 1.33 | 3,768,320 | 100 | |
| DV3Task Order=Reversed Task Order, 85% Threshold=1.14, Frame at Middle=4,423,6802026.03 | 1.28 | 3,604,480 | 100 | |
| DV3Task Order=Two-Cycle Training, 85% Threshold=1.13, Frame at Middle=4,423,6802026.03 | 1.23 | 1,802,240 | 100 | |
| ARROWTask Order=Default Task Order, 85% Threshold=1.02, Frame at Middle=4,423,6802026.03 | 1.19 | 1,638,400 | 100 | |
| DV3Task Order=Default Task Order, 85% Threshold=1.02, Frame at Middle=4,423,6802026.03 | 1.19 | 491,520 | 100 | |
| TES-SACTask Order=Two-Cycle Training, 85% Threshold=1.13, Frame at Middle=4,423,6802026.03 | 0.9 | — | 0 | |
| TES-SACTask Order=Default Task Order, 85% Threshold=1.02, Frame at Middle=4,423,6802026.03 | 0.86 | — | 0 | |
| TES-SACTask Order=Reversed Task Order, 85% Threshold=1.14, Frame at Middle=4,423,6802026.03 | 0.85 | — | 0 |