Reinforcement Learning on Maze Gymnasium
0.97Mean Best RewardA2C
Evaluation Results
| Method | Links | |
|---|---|---|
| A2CEpisodes per run=8,000, Independent runs=102026.05 | 0.97 | |
| TRPOEpisodes per run=8,000, Independent runs=102026.05 | 0.97 | |
| ProPS+Episodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 0.97 | |
| R2POEpisodes per run=4,000, Language Model backbone=gpt-oss:20b, Independent runs=102026.05 | 0.97 | |
| ProPSEpisodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 0.55 | |
| ARTS*Base Model=Qwen 4B, Test-time trained=true2026.06 | 0.53 | |
| Human BestMethod Type=Human Baseline2026.06 | 0.525 | |
| ARTSBase Model=o32026.06 | 0.512 | |
| LinearMethod Type=Prior Works2026.06 | 0.468 | |
| MLEvolveMethod Type=Prior Works2026.06 | 0.4535 | |
| AIRAMethod Type=Prior Works2026.06 | 0.3642 | |
| ARTSBase Model=Qwen 4B2026.06 | 0.3035 |