Agent Interaction on FTWP (test)
51.08Success RateGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oBackbone=GPT-4o2026.04 | 51.08 | |
| Gemma2-9B + MISEBackbone=Gemma2-9B-Instruct, Technique=MISE2026.04 | 32.94 | |
| GPT-4o-miniBackbone=GPT-4o-mini2026.04 | 31.63 | |
| Gemma2-9B + PRMBackbone=Gemma2-9B-Instruct, Technique=PRM2026.04 | 30.5 | |
| Gemma2-9B + PPOBackbone=Gemma2-9B-Instruct, Technique=PPO2026.04 | 29.83 | |
| LLaMA3-8B + MISEBackbone=LLaMA3-8B-Instruct, Technique=MISE2026.04 | 28.9 | |
| LLaMA3-8B + PRMBackbone=LLaMA3-8B-Instruct, Technique=PRM2026.04 | 25.61 | |
| Qwen2-7B + MISEBackbone=Qwen2-7B-Instruct, Technique=MISE2026.04 | 24.9 | |
| LLaMA3-8B + PPOBackbone=LLaMA3-8B-Instruct, Technique=PPO2026.04 | 24.48 | |
| Qwen2-7B + PRMBackbone=Qwen2-7B-Instruct, Technique=PRM2026.04 | 22.81 | |
| LLaMA3-8B + RFTBackbone=LLaMA3-8B-Instruct, Technique=RFT2026.04 | 22.32 | |
| Qwen2-7B + PPOBackbone=Qwen2-7B-Instruct, Technique=PPO2026.04 | 20.85 | |
| LLaMA3-8B + online DPOBackbone=LLaMA3-8B-Instruct, Technique=online DPO2026.04 | 20.09 | |
| LLaMA3-8B + ReActBackbone=LLaMA3-8B-Instruct, Technique=ReAct2026.04 | 17.8 | |
| Gemma2-9BBackbone=Gemma2-9B-Instruct2026.04 | 17.3 | |
| LLaMA3-8BBackbone=LLaMA3-8B-Instruct2026.04 | 17.24 | |
| Qwen2-7BBackbone=Qwen2-7B-Instruct2026.04 | 13.11 |