Agent Interaction on ScienceWorld (val)
44.08Success RateGemma2-9B + MISE
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemma2-9B + MISEBackbone=Gemma2-9B-Instruct, Technique=MISE2026.04 | 44.08 | |
| LLaMA3-8B + MISEBackbone=LLaMA3-8B-Instruct, Technique=MISE2026.04 | 43.4 | |
| Gemma2-9B + PRMBackbone=Gemma2-9B-Instruct, Technique=PRM2026.04 | 42.12 | |
| Gemma2-9B + PPOBackbone=Gemma2-9B-Instruct, Technique=PPO2026.04 | 40.66 | |
| GPT-4oBackbone=GPT-4o2026.04 | 40.65 | |
| LLaMA3-8B + PRMBackbone=LLaMA3-8B-Instruct, Technique=PRM2026.04 | 38.87 | |
| LLaMA3-8B + RFTBackbone=LLaMA3-8B-Instruct, Technique=RFT2026.04 | 38.64 | |
| GPT-4o-miniBackbone=GPT-4o-mini2026.04 | 38.6 | |
| LLaMA3-8B + ReActBackbone=LLaMA3-8B-Instruct, Technique=ReAct2026.04 | 37.97 | |
| LLaMA3-8B + online DPOBackbone=LLaMA3-8B-Instruct, Technique=online DPO2026.04 | 36.76 | |
| LLaMA3-8BBackbone=LLaMA3-8B-Instruct2026.04 | 36.12 | |
| Qwen2-7B + MISEBackbone=Qwen2-7B-Instruct, Technique=MISE2026.04 | 28.87 | |
| LLaMA3-8B + PPOBackbone=LLaMA3-8B-Instruct, Technique=PPO2026.04 | 26.04 | |
| Qwen2-7B + PRMBackbone=Qwen2-7B-Instruct, Technique=PRM2026.04 | 22.6 | |
| Qwen2-7B + PPOBackbone=Qwen2-7B-Instruct, Technique=PPO2026.04 | 22.09 | |
| Gemma2-9BBackbone=Gemma2-9B-Instruct2026.04 | 13.49 | |
| Qwen2-7BBackbone=Qwen2-7B-Instruct2026.04 | 12.35 |