Multi-Agent Strategic Reasoning on SimpleHanabi OOD
73.1Collective Avg Normalized ScoreGemini-2.5-flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-flashModel Source=Closed-source, Evaluation Mode=Co-op2026.05 | 73.1 | |
| GPT-5-miniModel Source=Closed-source, Evaluation Mode=Co-op2026.05 | 72.77 | |
| Strat-Reasoner-4BModel Source=Open-source, Evaluation Mode=Co-op2026.05 | 68.63 | |
| MARSHAL-4BModel Source=Open-source, Evaluation Mode=Co-op2026.05 | 65.65 | |
| Qwen3-32BModel Source=Open-source, Evaluation Mode=Co-op2026.05 | 65.35 | |
| Qwen3-8BModel Source=Open-source, Evaluation Mode=Co-op2026.05 | 64.32 | |
| Gemma3-12BModel Source=Open-source, Evaluation Mode=Co-op2026.05 | 55.71 | |
| SPIRAL-4BModel Source=Open-source, Evaluation Mode=Co-op2026.05 | 55.55 | |
| Qwen3-4BModel Source=Open-source, Evaluation Mode=Co-op2026.05 | 55.53 |