Agent Interaction on FTWP (val)
43.66Success RateGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oBackbone=GPT-4o2026.04 | 43.66 | |
| Gemma2-9B + MISEBackbone=Gemma2-9B-Instruct, Technique=MISE2026.04 | 40.14 | |
| Gemma2-9B + PRMBackbone=Gemma2-9B-Instruct, Technique=PRM2026.04 | 37.77 | |
| Gemma2-9B + PPOBackbone=Gemma2-9B-Instruct, Technique=PPO2026.04 | 36.95 | |
| LLaMA3-8B + MISEBackbone=LLaMA3-8B-Instruct, Technique=MISE2026.04 | 34.71 | |
| Qwen2-7B + MISEBackbone=Qwen2-7B-Instruct, Technique=MISE2026.04 | 33.8 | |
| Qwen2-7B + PRMBackbone=Qwen2-7B-Instruct, Technique=PRM2026.04 | 31.8 | |
| Qwen2-7B + PPOBackbone=Qwen2-7B-Instruct, Technique=PPO2026.04 | 30.69 | |
| LLaMA3-8B + PRMBackbone=LLaMA3-8B-Instruct, Technique=PRM2026.04 | 28.45 | |
| LLaMA3-8B + PPOBackbone=LLaMA3-8B-Instruct, Technique=PPO2026.04 | 27.87 | |
| GPT-4o-miniBackbone=GPT-4o-mini2026.04 | 27.26 | |
| LLaMA3-8B + RFTBackbone=LLaMA3-8B-Instruct, Technique=RFT2026.04 | 24.75 | |
| LLaMA3-8B + online DPOBackbone=LLaMA3-8B-Instruct, Technique=online DPO2026.04 | 22.54 | |
| LLaMA3-8BBackbone=LLaMA3-8B-Instruct2026.04 | 21.73 | |
| LLaMA3-8B + ReActBackbone=LLaMA3-8B-Instruct, Technique=ReAct2026.04 | 18.81 | |
| Gemma2-9BBackbone=Gemma2-9B-Instruct2026.04 | 16.3 | |
| Qwen2-7BBackbone=Qwen2-7B-Instruct2026.04 | 16.2 |