Multi-Task Agent Generalization on Five Agent Environments Average (test)
73.2Average Success RateFed-SE
Evaluation Results
| Method | Links | |
|---|---|---|
| Fed-SEBase Model=Qwen2.5-7B2025.12 | 73.2 | |
| Fed-SEBase Model=Qwen3-8B2025.12 | 70.2 | |
| CentralizedBase Model=Qwen2.5-7B2025.12 | 66.6 | |
| Fed-SEBase Model=Llama2-7B2025.12 | 66.1 | |
| LocalBase Model=Qwen2.5-7B2025.12 | 65.7 | |
| LocalBase Model=Qwen3-8B2025.12 | 65.2 | |
| Fed-SEBase Model=Qwen2.5-3B2025.12 | 63 | |
| FedITBase Model=Qwen2.5-7B2025.12 | 62.7 | |
| FedITBase Model=Qwen3-8B2025.12 | 61.6 | |
| CentralizedBase Model=Qwen2.5-3B2025.12 | 57.3 | |
| FedITBase Model=Qwen2.5-3B2025.12 | 57.3 | |
| LocalBase Model=Qwen2.5-3B2025.12 | 56.8 | |
| FedITBase Model=Llama2-7B2025.12 | 55.7 | |
| Fed-SEBase Model=Qwen3-1.7B2025.12 | 54.3 | |
| LocalBase Model=Qwen3-1.7B2025.12 | 50.2 | |
| CentralizedBase Model=Llama2-7B2025.12 | 49.3 | |
| CentralizedBase Model=Qwen3-8B2025.12 | 48 | |
| LocalBase Model=Llama2-7B2025.12 | 47.3 | |
| CentralizedBase Model=Qwen3-1.7B2025.12 | 46.8 | |
| FedITBase Model=Qwen3-1.7B2025.12 | 46.6 | |
| Pre-TrainedBase Model=Qwen2.5-7B2025.12 | 18.6 | |
| Pre-TrainedBase Model=Qwen3-1.7B2025.12 | 17.7 | |
| Pre-TrainedBase Model=Qwen2.5-3B2025.12 | 13.2 | |
| Pre-TrainedBase Model=Qwen3-8B2025.12 | 11.4 | |
| Pre-TrainedBase Model=Llama2-7B2025.12 | 5.9 |