Web-based Agent Interaction on WebShop (test)
73Success RateFed-SE
Evaluation Results
| Method | Links | |
|---|---|---|
| Fed-SEBase Model=Qwen2.5-7B2025.12 | 73 | |
| CentralizedBase Model=Qwen2.5-7B2025.12 | 71 | |
| Fed-SEBase Model=Qwen3-8B2025.12 | 68 | |
| FedITBase Model=Qwen2.5-7B2025.12 | 67.5 | |
| Fed-SEBase Model=Llama2-7B2025.12 | 66 | |
| LocalBase Model=Qwen2.5-7B2025.12 | 65 | |
| Fed-SEBase Model=Qwen2.5-3B2025.12 | 65 | |
| LocalBase Model=Qwen3-8B2025.12 | 64.5 | |
| FedITBase Model=Qwen3-8B2025.12 | 64.5 | |
| FedITBase Model=Qwen2.5-3B2025.12 | 63.5 | |
| CentralizedBase Model=Qwen2.5-3B2025.12 | 61.5 | |
| FedITBase Model=Llama2-7B2025.12 | 61 | |
| LocalBase Model=Qwen2.5-3B2025.12 | 60 | |
| CentralizedBase Model=Llama2-7B2025.12 | 59 | |
| Fed-SEBase Model=Qwen3-1.7B2025.12 | 57.5 | |
| LocalBase Model=Llama2-7B2025.12 | 54 | |
| LocalBase Model=Qwen3-1.7B2025.12 | 52 | |
| FedITBase Model=Qwen3-1.7B2025.12 | 50.5 | |
| CentralizedBase Model=Qwen3-1.7B2025.12 | 44.5 | |
| CentralizedBase Model=Qwen3-8B2025.12 | 33.5 | |
| GPT-4oBackbone=GPT-4o2026.04 | 31.39 | |
| GPT-4o-miniBackbone=GPT-4o-mini2026.04 | 25.3 | |
| Qwen2-7B + MISEBackbone=Qwen2-7B-Instruct, Technique=MISE2026.04 | 25.15 | |
| LLaMA3-8B + MISEBackbone=LLaMA3-8B-Instruct, Technique=MISE2026.04 | 24.34 | |
| Qwen2-7B + PRMBackbone=Qwen2-7B-Instruct, Technique=PRM2026.04 | 23.81 | |
| Qwen2-7B + PPOBackbone=Qwen2-7B-Instruct, Technique=PPO2026.04 | 23.75 | |
| Qwen2-7BBackbone=Qwen2-7B-Instruct2026.04 | 23.38 | |
| LLaMA3-8B + PRMBackbone=LLaMA3-8B-Instruct, Technique=PRM2026.04 | 22.81 | |
| LLaMA3-8B + PPOBackbone=LLaMA3-8B-Instruct, Technique=PPO2026.04 | 22.47 | |
| LLaMA3-8B + RFTBackbone=LLaMA3-8B-Instruct, Technique=RFT2026.04 | 21.97 | |
| LLaMA3-8B + online DPOBackbone=LLaMA3-8B-Instruct, Technique=online DPO2026.04 | 20.96 | |
| LLaMA3-8BBackbone=LLaMA3-8B-Instruct2026.04 | 20.14 | |
| LLaMA3-8B + ReActBackbone=LLaMA3-8B-Instruct, Technique=ReAct2026.04 | 19.98 | |
| Pre-TrainedBase Model=Qwen3-1.7B2025.12 | 7 | |
| Pre-TrainedBase Model=Qwen2.5-3B2025.12 | 3 | |
| Pre-TrainedBase Model=Qwen2.5-7B2025.12 | 2 | |
| Pre-TrainedBase Model=Qwen3-8B2025.12 | 1.5 | |
| Pre-TrainedBase Model=Llama2-7B2025.12 | 0 | |
| Gemma2-9BBackbone=Gemma2-9B-Instruct2026.04 | 0 | |
| Gemma2-9B + PPOBackbone=Gemma2-9B-Instruct, Technique=PPO2026.04 | 0 | |
| Gemma2-9B + PRMBackbone=Gemma2-9B-Instruct, Technique=PRM2026.04 | 0 | |
| Gemma2-9B + MISEBackbone=Gemma2-9B-Instruct, Technique=MISE2026.04 | 0 |