Agent Interaction on ScienceWorld (test)
38.18Success RateLLaMA3-8B + MISE
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaMA3-8B + MISEBackbone=LLaMA3-8B-Instruct, Technique=MISE2026.04 | 38.18 | |
| Gemma2-9B + MISEBackbone=Gemma2-9B-Instruct, Technique=MISE2026.04 | 36.8 | |
| LLaMA3-8B + RFTBackbone=LLaMA3-8B-Instruct, Technique=RFT2026.04 | 34.02 | |
| Gemma2-9B + PRMBackbone=Gemma2-9B-Instruct, Technique=PRM2026.04 | 33.85 | |
| LLaMA3-8B + PRMBackbone=LLaMA3-8B-Instruct, Technique=PRM2026.04 | 33.65 | |
| LLaMA3-8B + ReActBackbone=LLaMA3-8B-Instruct, Technique=ReAct2026.04 | 33.1 | |
| GPT-4oBackbone=GPT-4o2026.04 | 32.41 | |
| Gemma2-9B + PPOBackbone=Gemma2-9B-Instruct, Technique=PPO2026.04 | 32.19 | |
| LLaMA3-8B + online DPOBackbone=LLaMA3-8B-Instruct, Technique=online DPO2026.04 | 32.14 | |
| GPT-4o-miniBackbone=GPT-4o-mini2026.04 | 31.98 | |
| LLaMA3-8BBackbone=LLaMA3-8B-Instruct2026.04 | 31.79 | |
| Qwen2-7B + MISEBackbone=Qwen2-7B-Instruct, Technique=MISE2026.04 | 28.61 | |
| Qwen2-7B + PRMBackbone=Qwen2-7B-Instruct, Technique=PRM2026.04 | 22.24 | |
| Qwen2-7B + PPOBackbone=Qwen2-7B-Instruct, Technique=PPO2026.04 | 21.85 | |
| LLaMA3-8B + PPOBackbone=LLaMA3-8B-Instruct, Technique=PPO2026.04 | 20.03 | |
| Gemma2-9BBackbone=Gemma2-9B-Instruct2026.04 | 11.91 | |
| Qwen2-7BBackbone=Qwen2-7B-Instruct2026.04 | 10.67 |