Multi-agent Reasoning on ARMMAN
85.78AccuracyOW-L
Evaluation Results
| Method | Links | |
|---|---|---|
| OW-LEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 85.78 | |
| OW-IEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 85.78 | |
| ISPEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 85.78 | |
| Single BestEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-4, Oracle=true2025.10 | 85.32 | |
| MVEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 85.24 | |
| OW-LEnsemble Size=All Eight Models2025.10 | 85.1 | |
| OW-IEnsemble Size=All Eight Models2025.10 | 84.94 | |
| ISPEnsemble Size=All Eight Models2025.10 | 84.79 | |
| MVEnsemble Size=All Eight Models2025.10 | 84.4 |