Agentic Reasoning on MineSweeper (test)
48.2Success RateRETROAGENT
Evaluation Results
| Method | Links | |
|---|---|---|
| RETROAGENTEvaluation Protocol=RL Training with Extrinsic and Dual Intrinsic Feedback, Reflection Strategy=RL-Trained Reflection, Base Algorithm=GRPO2026.03 | 48.2 | |
| RETROAGENTEvaluation Protocol=RL Training with Extrinsic and Dual Intrinsic Feedback, Reflection Strategy=In-Context Reflection, Base Algorithm=GRPO2026.03 | 47.9 | |
| GiGPOEvaluation Protocol=Fine-tuning with RL, Base Algorithm=GRPO2026.03 | 41.1 | |
| GRPO w/ EMPGEvaluation Protocol=Fine-tuning with RL-based Frameworks2026.03 | 40.1 | |
| GRPOEvaluation Protocol=Fine-tuning with RL2026.03 | 39.3 | |
| LAMEREvaluation Protocol=Fine-tuning with Meta-RL Frameworks, Base Algorithm=GRPO2026.03 | 33.3 | |
| RLOOEvaluation Protocol=Fine-tuning with RL2026.03 | 32.8 | |
| EvolveREvaluation Protocol=Fine-tuning with RL-based Frameworks, Base Algorithm=GRPO2026.03 | 11.7 | |
| ReflexionEvaluation Protocol=Prompting-based2026.03 | 7.4 | |
| ReActEvaluation Protocol=Prompting-based2026.03 | 7 | |
| MemRLEvaluation Protocol=Fine-tuning with RL-based Frameworks, Base Algorithm=GRPO2026.03 | 7 | |
| Qwen-2.5-7B-InstructEvaluation Protocol=Zero-Shot2026.03 | 6.5 |