LLM Agent Navigation on BabyAI (test)
93.3Success RateFed-SE
Evaluation Results
| Method | Links | |
|---|---|---|
| Fed-SEBase Model=Qwen2.5-7B2025.12 | 93.3 | |
| Fed-SEBase Model=Llama2-7B2025.12 | 92.2 | |
| Fed-SEBase Model=Qwen3-8B2025.12 | 92.2 | |
| LocalBase Model=Qwen2.5-7B2025.12 | 90 | |
| CentralizedBase Model=Qwen2.5-7B2025.12 | 88.9 | |
| Fed-SEBase Model=Qwen2.5-3B2025.12 | 86.7 | |
| LocalBase Model=Qwen3-8B2025.12 | 85.6 | |
| FedITBase Model=Qwen3-8B2025.12 | 85.6 | |
| FedITBase Model=Qwen2.5-7B2025.12 | 83.3 | |
| CentralizedBase Model=Qwen2.5-3B2025.12 | 83.3 | |
| LocalBase Model=Qwen2.5-3B2025.12 | 81.1 | |
| CentralizedBase Model=Qwen3-8B2025.12 | 78.9 | |
| Fed-SEBase Model=Qwen3-1.7B2025.12 | 74.4 | |
| LocalBase Model=Qwen3-1.7B2025.12 | 73.3 | |
| FedITBase Model=Qwen2.5-3B2025.12 | 72.2 | |
| FedITBase Model=Llama2-7B2025.12 | 70 | |
| CentralizedBase Model=Qwen3-1.7B2025.12 | 70 | |
| Pre-TrainedBase Model=Qwen2.5-7B2025.12 | 67.8 | |
| LocalBase Model=Llama2-7B2025.12 | 67.8 | |
| CentralizedBase Model=Llama2-7B2025.12 | 61.1 | |
| FedITBase Model=Qwen3-1.7B2025.12 | 61.1 | |
| Pre-TrainedBase Model=Qwen2.5-3B2025.12 | 48.9 | |
| Pre-TrainedBase Model=Qwen3-1.7B2025.12 | 43.3 | |
| Pre-TrainedBase Model=Qwen3-8B2025.12 | 40 | |
| Pre-TrainedBase Model=Llama2-7B2025.12 | 23.3 |