Reinforcement Learning on Atari 100k steps (test)
0.809Median HNSCPT@0
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CPT@0Pretraining setting=Exploratory Pretraining + Finetuning, Data (transitions)=4000M, finetuning=false2021.06 | 0.809 | 4.945 | 12 | 25 | |
| SGI-M/LPretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=6M, Model size=Large2021.06 | 0.753 | 1.598 | 9 | 26 | |
| SGI-MPretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=3M2021.06 | 0.679 | 1.149 | 9 | 26 | |
| SGI-WPretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=5M2021.06 | 0.589 | 1.144 | 8 | 26 | |
| BC-MPretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=3M2021.06 | 0.548 | 0.858 | 8 | 26 | |
| APTPretraining setting=Exploratory Pretraining + Finetuning, Data (transitions)=250M2021.06 | 0.475 | 0.666 | 7 | 26 | |
| SGI-EPretraining setting=Exploratory Pretraining + Finetuning, Data (transitions)=6M2021.06 | 0.456 | 0.838 | 6 | 26 | |
| SGI-M/SPretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=3M, Model size=Small2021.06 | 0.423 | 0.914 | 8 | 26 | |
| SPRPretraining setting=No Pretraining (Finetuning Only), Data (transitions)=02021.06 | 0.415 | 0.704 | 7 | 26 | |
| SGI-NonePretraining setting=No Pretraining (Finetuning Only), Data (transitions)=02021.06 | 0.343 | 0.565 | 3 | 26 | |
| SGI-RPretraining setting=Exploratory Pretraining + Finetuning, Data (transitions)=6M2021.06 | 0.326 | 0.888 | 5 | 26 | |
| DrQPretraining setting=No Pretraining (Finetuning Only), Data (transitions)=02021.06 | 0.268 | 0.357 | 2 | 24 | |
| ATC-EPretraining setting=Exploratory Pretraining + Finetuning, Data (transitions)=3M, implementation=our implementation2021.06 | 0.237 | 0.462 | 3 | 26 | |
| ATC-WPretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=3M, implementation=our implementation2021.06 | 0.219 | 0.587 | 4 | 26 | |
| ATC-MPretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=3M, implementation=our implementation2021.06 | 0.204 | 0.78 | 5 | 26 | |
| ATC-RPretraining setting=Exploratory Pretraining + Finetuning, Data (transitions)=3M, implementation=our implementation2021.06 | 0.191 | 0.472 | 4 | 26 | |
| DERPretraining setting=No Pretraining (Finetuning Only), Data (transitions)=02021.06 | 0.161 | 0.285 | 2 | 26 | |
| SimPLePretraining setting=No Pretraining (Finetuning Only), Data (transitions)=02021.06 | 0.144 | 0.443 | 2 | 26 | |
| BC-M@0Pretraining setting=Offline-data Pretraining + Finetuning, Data (transitions)=3M, finetuning=false2021.06 | 0.139 | 0.227 | 0 | 23 | |
| VISRPretraining setting=Exploratory Pretraining + Finetuning, Data (transitions)=250M2021.06 | 0.095 | 1.281 | 7 | 21 |