Interactive Decision Making on Textcraft
99.6Success RateGPT-4o-1120
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o-1120Paradigm=MAP, Model Category=Non-reasoning Models2026.05 | 99.6 | |
| Deepseek-V4-ProParadigm=MAP, Model Category=Reasoning Models2026.05 | 99.5 | |
| Kimi-K2-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 99.2 | |
| Deepseek-V4-ProParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 99.2 | |
| Deepseek-V4-ProParadigm=ReAct, Model Category=Reasoning Models2026.05 | 98.8 | |
| Kimi-K2-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 97.6 | |
| Kimi-K2-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 96.8 | |
| GPT-4o-0806Paradigm=MAP, Model Category=Non-reasoning Models2026.05 | 96.7 | |
| GPT-4o-1120Paradigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 96.7 | |
| Minimax-M2.7Paradigm=MAP, Model Category=Reasoning Models2026.05 | 96.7 | |
| MAP-4BParadigm=MAP, Model Category=Fine-Tuning Models2026.05 | 95.6 | |
| GPT-4o-1120Paradigm=ReAct, Model Category=Non-reasoning Models2026.05 | 94.7 | |
| GPT-4o-0806Paradigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 92.5 | |
| Minimax-M2.7Paradigm=ReAct, Model Category=Reasoning Models2026.05 | 92.3 | |
| MAP-4BParadigm=CoMAP, Model Category=Fine-Tuning Models2026.05 | 92.3 | |
| Minimax-M2.7Paradigm=CoMAP, Model Category=Reasoning Models2026.05 | 92.1 | |
| GPT-4o-0806Paradigm=ReAct, Model Category=Non-reasoning Models2026.05 | 91.6 | |
| MAP-4BParadigm=ReAct, Model Category=Fine-Tuning Models2026.05 | 91.2 | |
| Qwen3-32B-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 90.4 | |
| Qwen3-32B-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 87.7 | |
| Qwen3-8B-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 87.1 | |
| Qwen3-32B-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 82.4 | |
| ACT-4BParadigm=MAP, Model Category=Fine-Tuning Models2026.05 | 79.4 | |
| GPT-4o-miniParadigm=MAP, Model Category=Non-reasoning Models2026.05 | 75.6 | |
| ACT-4BParadigm=CoMAP, Model Category=Fine-Tuning Models2026.05 | 74.5 | |
| Qwen3-4B-InstructParadigm=MAP, Model Category=Non-reasoning Models2026.05 | 71.9 | |
| ACT-4BParadigm=ReAct, Model Category=Fine-Tuning Models2026.05 | 70.1 | |
| Doubao-Seed-2.0-ProParadigm=MAP, Model Category=Reasoning Models2026.05 | 69.8 | |
| Qwen3-8B-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 67 | |
| Qwen3-30B-A3B-InstructParadigm=MAP, Model Category=Non-reasoning Models2026.05 | 66.6 | |
| Qwen3-8B-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 66.4 | |
| Doubao-Seed-2.0-ProParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 65.6 | |
| Doubao-Seed-2.0-ProParadigm=ReAct, Model Category=Reasoning Models2026.05 | 63.1 | |
| Qwen3-4B-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 59.6 | |
| Qwen3-30B-A3B-InstructParadigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 58.6 | |
| Qwen3-30B-A3B-InstructParadigm=ReAct, Model Category=Non-reasoning Models2026.05 | 56.8 | |
| GPT-4o-miniParadigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 54.2 | |
| GPT-4o-miniParadigm=ReAct, Model Category=Non-reasoning Models2026.05 | 46.5 | |
| Multi2Base Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 44.5 | |
| Qwen3-4B-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 37.5 | |
| Qwen3-4B-InstructParadigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 37.1 | |
| Qwen3-4B-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 35.6 | |
| Multi2Base Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 35.6 | |
| Qwen3-4B-InstructParadigm=ReAct, Model Category=Non-reasoning Models2026.05 | 31.8 | |
| ADaPTBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 30.2 | |
| Multi2Base Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 28.5 | |
| GliderBase Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 28.5 | |
| ReflexionBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Single2026.06 | 23.16 | |
| ReActBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Single2026.06 | 23 | |
| ADaPTBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 21 | |
| GliderBase Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 18.5 | |
| GRPOBase Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 11 | |
| ReflexionBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Single2026.06 | 11 | |
| GliderBase Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 9.5 | |
| ReActBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Single2026.06 | 9 | |
| GRPOBase Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 5.5 | |
| ADaPTBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 5 | |
| GRPOBase Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 3.5 | |
| ReActBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Single2026.06 | 3 | |
| ReflexionBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Single2026.06 | 1.43 |