Graduate-Level Reasoning on GPQA
78.9AccuracyM2CL
Evaluation Results
| Method | Links | |
|---|---|---|
| M2CLBackbone Model=Qwen-72B, Number of LLMs=42026.02 | 78.9 | |
| Qwen3-OmniOpen-Source=✓, Size=30B-A3B, no tools=true2026.04 | 73.1 | |
| Nemotron 3 Nano 30B-A3BOpen-Source=✓, Size=30B-A3B, no tools=true2026.04 | 73 | |
| Nemotron 3 Nano OmniOpen-Source=✓, Size=30B-A3B, no tools=true2026.04 | 72.2 | |
| M2CLBackbone Model=Qwen-14B, Number of LLMs=42026.02 | 66.2 | |
| M2CLBackbone Model=Qwen-7B, Number of LLMs=42026.02 | 66.1 | |
| BLASSTBackbone=Qwen3-8B, Attention Method=BLASST, Sparsity=~50%, Phase=Decode2025.12 | 61.51 | |
| Dense AttentionBackbone=Qwen3-8B, Attention Method=Dense, Phase=Decode2025.12 | 61.21 | |
| RocketKVBackbone=Qwen3-8B, Attention Method=RocketKV, Phase=Decode2025.12 | 60.5 | |
| QuestBackbone=Qwen3-8B, Attention Method=Quest, Phase=Decode2025.12 | 60.12 | |
| HCP-MADBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 54.04 | |
| GPTSwarmBackbone Model=Qwen-72B, Number of LLMs=42026.02 | 52.4 | |
| DyLANBackbone Model=Qwen-72B, Number of LLMs=42026.02 | 51.6 | |
| DOWNBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 51.01 | |
| Heter-MADBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 50.5 | |
| MADBase Model=Llama-3.1-70b-instruct2026.04 | 49.49 | |
| MARSBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 49.49 | |
| CoTBase Model=Llama-3.1-70b-instruct2026.04 | 48.99 | |
| SRBase Model=Llama-3.1-70b-instruct2026.04 | 47.98 | |
| SCBase Model=Llama-3.1-70b-instruct2026.04 | 46.97 | |
| MacNetBackbone Model=Qwen-72B, Number of LLMs=42026.02 | 46.2 | |
| MADBase Model=Qwen2.5-32b-instruct2026.04 | 45.96 | |
| Best-of-N (BoN)Backbone Model=Qwen-72B, Number of LLMs=42026.02 | 45.9 | |
| DebateBackbone Model=Qwen-72B, Number of LLMs=42026.02 | 43.4 | |
| CoTBase Model=Qwen2.5-32b-instruct2026.04 | 42.93 | |
| SCBase Model=Qwen2.5-32b-instruct2026.04 | 41.92 | |
| SRBase Model=Qwen2.5-32b-instruct2026.04 | 41.41 | |
| DyLANBackbone Model=Qwen-14B, Number of LLMs=42026.02 | 39.4 | |
| GPTSwarmBackbone Model=Qwen-14B, Number of LLMs=42026.02 | 38.7 | |
| Best-of-N (BoN)Backbone Model=Qwen-7B, Number of LLMs=42026.02 | 36.4 | |
| GPTSwarmBackbone Model=Qwen-7B, Number of LLMs=42026.02 | 35.6 | |
| DyLANBackbone Model=Qwen-7B, Number of LLMs=42026.02 | 35.4 | |
| Single executionBackbone Model=Qwen-72B, Number of LLMs=42026.02 | 34.9 | |
| Qwen2-57B-A14BArchitecture=MoE, # Act Params=14B, # Params=57B2024.07 | 34.3 | |
| Best-of-N (BoN)Backbone Model=Qwen-14B, Number of LLMs=42026.02 | 32.8 | |
| MacNetBackbone Model=Qwen-14B, Number of LLMs=42026.02 | 31.9 | |
| Yi-1.5-34BArchitecture=Dense, # Act Params=32B, # Params=32B2024.07 | 30.8 | |
| Qwen1.5-32BArchitecture=Dense, # Act Params=34B, # Params=34B2024.07 | 30.8 | |
| MacNetBackbone Model=Qwen-7B, Number of LLMs=42026.02 | 30.8 | |
| DebateBackbone Model=Qwen-14B, Number of LLMs=42026.02 | 30.3 | |
| Mixtral-8x7BArchitecture=MoE, # Act Params=12B, # Params=47B2024.07 | 29.2 | |
| DebateBackbone Model=Qwen-7B, Number of LLMs=42026.02 | 28.7 | |
| Single executionBackbone Model=Qwen-14B, Number of LLMs=42026.02 | 21.2 | |
| Single executionBackbone Model=Qwen-7B, Number of LLMs=42026.02 | 20.2 |