Tool Selection on Chess Specialists: opening, midgame, endgame, late-endgame
64.4AccuracyGold (Ground Truth Documentation)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gold (Ground Truth Documentation)Model=GPT-5, Framework=ReAct2026.02 | 64.4 | 1,411 | |
| Gold (Ground Truth Documentation)Model=GPT-5-mini, Framework=ReAct2026.02 | 52.8 | 1,243 | |
| TOOLOBSERVERModel=GPT-5, Framework=ReAct2026.02 | 40.1 | 1,020 | |
| Play2PromptModel=GPT-5, Framework=ReAct2026.02 | 35.8 | 966 | |
| TOOLOBSERVERModel=GPT-5-mini, Framework=ReAct2026.02 | 32.1 | 949 | |
| EasyToolModel=GPT-5-mini, Framework=ReAct2026.02 | 25.8 | 739 | |
| Base (Opacified set)Model=GPT-5-mini, Framework=ReAct2026.02 | 24.9 | 772 | |
| Base (Opacified set)Model=GPT-5, Framework=ReAct2026.02 | 23.5 | 728 | |
| EasyToolModel=GPT-5, Framework=ReAct2026.02 | 23.2 | 761 | |
| Play2PromptModel=GPT-5-mini, Framework=ReAct2026.02 | 19.5 | 754 |