Reinforcement Learning on Rotational Reacher Suboptimal context 1 (test)
0.6ReturnAug-D
Evaluation Results
| Method | Links | |
|---|---|---|
| Aug-DAlgorithm=CQL, Data Augmentation Approach=Offline Data Augmentation2026.07 | 0.6 | |
| DAC-OutputAlgorithm=CQL, Data Augmentation Approach=Consistency on Outputs2026.07 | 0.6 | |
| Aug-D-OnlineAlgorithm=CQL, Data Augmentation Approach=Online Data Augmentation2026.07 | 0.57 | |
| DAC-LatentAlgorithm=CQL, Data Augmentation Approach=Consistency on Latents2026.07 | 0.45 | |
| No DAAlgorithm=CQL, Data Augmentation Approach=None2026.07 | 0.3 |