Agentic Reasoning on Sokoban (test)
38.3Success RateRETROAGENT
Evaluation Results
| Method | Links | |
|---|---|---|
| RETROAGENTEvaluation Protocol=RL Training with Extrinsic and Dual Intrinsic Feedback, Reflection Strategy=RL-Trained Reflection, Base Algorithm=GRPO2026.03 | 38.3 | |
| RETROAGENTEvaluation Protocol=RL Training with Extrinsic and Dual Intrinsic Feedback, Reflection Strategy=In-Context Reflection, Base Algorithm=GRPO2026.03 | 32.6 | |
| GiGPOEvaluation Protocol=Fine-tuning with RL, Base Algorithm=GRPO2026.03 | 21.9 | |
| LAMEREvaluation Protocol=Fine-tuning with Meta-RL Frameworks, Base Algorithm=GRPO2026.03 | 14.3 | |
| GRPO w/ EMPGEvaluation Protocol=Fine-tuning with RL-based Frameworks2026.03 | 12.8 | |
| GRPOEvaluation Protocol=Fine-tuning with RL2026.03 | 11.2 | |
| RLOOEvaluation Protocol=Fine-tuning with RL2026.03 | 9.9 | |
| EvolveREvaluation Protocol=Fine-tuning with RL-based Frameworks, Base Algorithm=GRPO2026.03 | 6 | |
| ReflexionEvaluation Protocol=Prompting-based2026.03 | 4.3 | |
| MemRLEvaluation Protocol=Fine-tuning with RL-based Frameworks, Base Algorithm=GRPO2026.03 | 4.2 | |
| ReActEvaluation Protocol=Prompting-based2026.03 | 3.9 | |
| Qwen-2.5-7B-InstructEvaluation Protocol=Zero-Shot2026.03 | 2.6 |