Information-gathering Reasoning on Clue Selector Game (CSG) (evaluation set)
86.2Resolve ScoreGreedy oracle
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Greedy oracleType=Reference2026.06 | 86.2 | 29.6 | 70 | 70.4 | 3.1 | 8.8 | 0 | |
| ECHOBackbone=Qwen2.5-1.5B2026.06 | 45.3 | 18.6 | 67 | 71.8 | 40.6 | 31.8 | 0.9 | |
| Claude Sonnet 4.62026.06 | 43.1 | 25.4 | 70.1 | 73.8 | 18.5 | 16.8 | 52.3 | |
| GPT-4.1-mini2026.06 | 31.6 | 28.7 | 61.5 | 64 | 28.5 | 15.9 | 0 | |
| o3-mini2026.06 | 27.1 | 29.8 | 61 | 63.6 | 24.8 | 15.1 | 0.3 | |
| GPT-4o2026.06 | 25.8 | 29.8 | 62.5 | 66.2 | 28.6 | 15.6 | 0 | |
| GPT-4oPrompting Strategy=Full ReAct2026.06 | 25.3 | 28.3 | 61.8 | 62.5 | 23.1 | 8.7 | 100 | |
| GPT-4o-mini2026.06 | 22.7 | 30.2 | 56.3 | 58.8 | 35.2 | 12.8 | 0 | |
| Qwen2.5-14B2026.06 | 22.7 | 27.3 | 53.5 | 53.7 | 29 | 12.5 | 1.8 | |
| Qwen2.5-7B2026.06 | 20.9 | 34 | 50.2 | 50.9 | 20 | 10.5 | 2.2 | |
| Episodic ReturnRL Algorithm=GRPO, Backbone=Qwen2.5-1.5B2026.06 | 14.7 | 39.2 | 44.5 | 44.6 | 33.9 | 9.3 | 16 | |
| RLOO per-turnBackbone=Qwen2.5-1.5B2026.06 | 13.8 | 40.2 | 44.6 | 44.5 | 29.7 | 12.6 | 1.2 | |
| Offline SFT+RLBackbone=Qwen2.5-1.5B2026.06 | 13.3 | 41.2 | 39.2 | 37.2 | 20.6 | 8.9 | 1 | |
| GPT-4.1-nano2026.06 | 10.2 | 35.6 | 49.6 | 52.8 | 32.7 | 8.3 | 0 | |
| Qwen2.5-3B2026.06 | 8.4 | 36 | 45.4 | 45.4 | 28 | 7.2 | 0.8 | |
| Qwen2.5-1.5B2026.06 | 8 | 38.6 | 35.2 | 34 | 22.9 | 6.4 | 1.1 | |
| Qwen2.5-1.5BPrompting Strategy=CoT2026.06 | 6.7 | 38.4 | 36.2 | 35.1 | 22.3 | 5.8 | 1 | |
| Qwen2.5-1.5BPrompting Strategy=ReAct2026.06 | 6.2 | 40.7 | 34.8 | 33.9 | 24.3 | 5.8 | 14.8 | |
| Qwen2.5-1.5BPrompting Strategy=Full ReAct2026.06 | 4.4 | 49.2 | 31.2 | 31.6 | 20.5 | 3.6 | 100 | |
| Qwen2.5-0.5B2026.06 | 3.6 | 50.2 | 28.1 | 26.8 | 18.9 | 2.7 | 1.5 |