Multi-agent Reasoning on Ultrafeedback
73.66AccuracyOW-L
Evaluation Results
| Method | Links | |
|---|---|---|
| OW-LEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 73.66 | |
| OW-IEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 73.66 | |
| ISPEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 73.26 | |
| Single BestEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-4, Oracle=true2025.10 | 73.14 | |
| OW-IEnsemble Size=All Eight Models2025.10 | 72.44 | |
| OW-LEnsemble Size=All Eight Models2025.10 | 72.44 | |
| MVEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 72.21 | |
| ISPEnsemble Size=All Eight Models2025.10 | 71.18 | |
| MVEnsemble Size=All Eight Models2025.10 | 70.23 |