Interactive Decision Making on ScienceWorld
69.97Success RateMulti2
Evaluation Results
| Method | Links | |
|---|---|---|
| Multi2Base Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 69.97 | |
| Multi2Base Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 67.61 | |
| HIPIFType=RL2026.06 | 64.8 | |
| STEP-HRLType=RL2026.06 | 61.8 | |
| Multi2Base Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 60.68 | |
| GliderBase Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 60.48 | |
| GliderBase Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 58.33 | |
| GIGPOType=RL2026.06 | 58.1 | |
| GLIDERType=RL2026.06 | 56.9 | |
| Gemini2.5proType=PE2026.06 | 54.7 | |
| GliderBase Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 54.69 | |
| Minimax-M2.7Paradigm=MAP, Model Category=Reasoning Models2026.05 | 54.2 | |
| GPT-4o-1120Paradigm=MAP, Model Category=Non-reasoning Models2026.05 | 53.3 | |
| Minimax-M2.7Paradigm=ReAct, Model Category=Reasoning Models2026.05 | 51.1 | |
| PPOType=RL2026.06 | 50.3 | |
| Minimax-M2.7Paradigm=CoMAP, Model Category=Reasoning Models2026.05 | 50.2 | |
| Doubao-Seed-2.0-ProParadigm=MAP, Model Category=Reasoning Models2026.05 | 48.9 | |
| GPT4oType=PE2026.06 | 47.1 | |
| Kimi-K2-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 46.8 | |
| Hiagent+GRPOType=RL2026.06 | 46.1 | |
| GPT-4o-1120Paradigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 44.8 | |
| Doubao-Seed-2.0-ProParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 44.1 | |
| Kimi-K2-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 43.5 | |
| GRPOType=RL2026.06 | 43.1 | |
| Gemini2.5pro (Hiagent)Type=PE2026.06 | 42.8 | |
| HiperType=RL2026.06 | 42.6 | |
| Doubao-Seed-2.0-ProParadigm=ReAct, Model Category=Reasoning Models2026.05 | 42.5 | |
| RL-GCDType=RL2026.06 | 42.3 | |
| GPT-4o-1120Paradigm=ReAct, Model Category=Non-reasoning Models2026.05 | 41.3 | |
| Kimi-K2-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 41.2 | |
| Deepseek-V4-ProParadigm=MAP, Model Category=Reasoning Models2026.05 | 41.2 | |
| MAP-4BParadigm=MAP, Model Category=Fine-Tuning Models2026.05 | 40.5 | |
| GRPOBase Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 38.47 | |
| RLOOType=RL2026.06 | 38.4 | |
| GPT-4o-0806Paradigm=MAP, Model Category=Non-reasoning Models2026.05 | 38.2 | |
| MAP-4BParadigm=CoMAP, Model Category=Fine-Tuning Models2026.05 | 37.2 | |
| Deepseek-V4-ProParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 36.8 | |
| MAP-4BParadigm=ReAct, Model Category=Fine-Tuning Models2026.05 | 35 | |
| GPT-4o-0806Paradigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 32.7 | |
| Qwen3-8B-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 32.4 | |
| Deepseek-V4-ProParadigm=ReAct, Model Category=Reasoning Models2026.05 | 32.3 | |
| GPT4o (Hiagent)Type=PE2026.06 | 32 | |
| GPT-4o-0806Paradigm=ReAct, Model Category=Non-reasoning Models2026.05 | 31.4 | |
| Qwen3-8B-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 28.7 | |
| Qwen3-32B-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 28 | |
| ADaPTBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 26.2 | |
| Qwen3-8B-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 25.8 | |
| GRPOBase Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 25.79 | |
| Qwen3-4B-InstructParadigm=MAP, Model Category=Non-reasoning Models2026.05 | 24.3 | |
| ReflexionBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Single2026.06 | 23.68 | |
| ACT-4BParadigm=MAP, Model Category=Fine-Tuning Models2026.05 | 23.6 | |
| ReActBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Single2026.06 | 23.25 | |
| ReActBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Single2026.06 | 23.23 | |
| ReflexionBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Single2026.06 | 23.2 | |
| ReflexionBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Single2026.06 | 21.87 | |
| ReActBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Single2026.06 | 20.82 | |
| ACT-4BParadigm=CoMAP, Model Category=Fine-Tuning Models2026.05 | 20.1 | |
| ADaPTBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 20 | |
| Qwen3-32B-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 19.7 | |
| GRPOBase Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 18.11 | |
| ACT-4BParadigm=ReAct, Model Category=Fine-Tuning Models2026.05 | 16.9 | |
| ReflexionType=PE2026.06 | 16.4 | |
| Qwen3-4B-InstructParadigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 16.3 | |
| Qwen3-32B-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 16.1 | |
| Qwen3-4B-InstructParadigm=ReAct, Model Category=Non-reasoning Models2026.05 | 13.9 | |
| GPT-4o-miniParadigm=MAP, Model Category=Non-reasoning Models2026.05 | 12.2 | |
| Qwen3-4B-ThinkingParadigm=MAP, Model Category=Reasoning Models2026.05 | 11.4 | |
| HiagentType=PE2026.06 | 10.8 | |
| ADaPTBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 10.5 | |
| ReactType=PE2026.06 | 10.2 | |
| Qwen3-30B-A3B-InstructParadigm=MAP, Model Category=Non-reasoning Models2026.05 | 9.8 | |
| Qwen3-4B-ThinkingParadigm=CoMAP, Model Category=Reasoning Models2026.05 | 9.2 | |
| Qwen2.5-3B-InstructType=PE2026.06 | 7.8 | |
| GPT-4o-miniParadigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 6.2 | |
| GPT-4o-miniParadigm=ReAct, Model Category=Non-reasoning Models2026.05 | 1.6 | |
| Qwen3-30B-A3B-InstructParadigm=CoMAP, Model Category=Non-reasoning Models2026.05 | 1.5 | |
| Qwen3-4B-ThinkingParadigm=ReAct, Model Category=Reasoning Models2026.05 | 1.5 | |
| Qwen3-30B-A3B-InstructParadigm=ReAct, Model Category=Non-reasoning Models2026.05 | 0.5 |