Multi-agent game strategic reasoning on G game v0.8A (test)
84LLM Only PerformanceK-R
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| K-RBase model=GPT-4o, Warm-up phase=5 episodes, Contextual history=Provided2026.05 | 84 | 54 | 48 | 24 | 45 | 17 | 42 | 45 | |
| SOMBase model=GPT-4o, Warm-up phase=5 episodes, SCM structure=Fixed2026.05 | 80 | 61 | 59 | 39 | 47 | 19 | 64 | 53 | |
| CoTBase model=GPT-4o, Warm-up phase=5 episodes, Contextual history=Provided2026.05 | 68 | 16 | 54 | 28 | 32 | 9 | 36 | 35 | |
| ReflexionBase model=GPT-4o, Warm-up phase=5 episodes, Contextual history=Provided2026.05 | 64 | 10 | 40 | 20 | 26 | 23 | 54 | 34 | |
| ToTBase model=GPT-4o, Warm-up phase=5 episodes, Contextual history=Provided2026.05 | 46 | 18 | 22 | 12 | 22 | 11 | 26 | 22 | |
| LLM onlyBase model=GPT-4o, Warm-up phase=5 episodes, Contextual history=Provided2026.05 | 19 | 4 | 12 | 2 | 10 | 3 | 7 | 8 |