Question Answering on CSQA (Accuracy)
88AccuracyMA-PoP
Evaluation Results
| Method | Links | |
|---|---|---|
| MA-PoP2026.05 | 88 | |
| LLP2026.05 | 86.67 | |
| Sparse MADT=22026.05 | 86.33 | |
| Self-Consistency2026.05 | 86 | |
| ISP2026.05 | 86 | |
| Free MADT=32026.05 | 85.67 | |
| Decentr. MADT=32026.05 | 85.33 | |
| Sparse MADT=32026.05 | 85.33 | |
| Free MADT=22026.05 | 85.33 | |
| Majority Voting2026.05 | 85.33 | |
| Decentr. MADT=22026.05 | 85 | |
| Sparse MADT=52026.05 | 85 | |
| Free MADT=52026.05 | 84.67 | |
| Decentr. MADT=52026.05 | 84.33 | |
| Falcon-7B2026.05 | 83 | |
| Centr. MADT=22026.05 | 82.33 | |
| Centr. MADT=52026.05 | 82.33 | |
| ICRBackbone=Qwen2.5-7B2025.09 | 82 | |
| Qwen-7B2026.05 | 81.53 | |
| ICVBackbone=Qwen2.5-7B2025.09 | 81.3 | |
| IVBackbone=Qwen2.5-7B2025.09 | 81.2 | |
| Centr. MADT=32026.05 | 80.67 | |
| TVBackbone=Qwen2.5-7B2025.09 | 80.6 | |
| Gemma-9B2026.05 | 80.33 | |
| ELICITBackbone=Qwen2.5-7B2025.09 | 79.2 | |
| FVBackbone=Qwen2.5-7B2025.09 | 78.8 | |
| CommonSynBackbone=Llama-3.1-8B-Instruct, Fine-tuned on=CommonSyn, Evaluation Mode=Zero-shot2026.03 | 70.8 | |
| VanillaBackbone=Llama-3.1-8B-Instruct, Evaluation Mode=Zero-shot2026.03 | 70.3 | |
| BLT2026.02 | 69.2 | |
| Mistral-7B2026.05 | 68 | |
| Llama-8B2026.05 | 67.67 | |
| OLMo 2Type=Sub-word reference2026.02 | 66 | |
| OursTraining Stage=Stage 12026.02 | 65.8 | |
| Bolmo2026.02 | 64.2 | |
| OursTraining Stage=Stage 22026.02 | 62.6 | |
| HnetTraining Stage=2-stage2026.02 | 62.4 | |
| HnetTraining Stage=1-stage2026.02 | 61.4 | |
| CommonGenBackbone=Llama-3.1-8B-Instruct, Fine-tuned on=CommonGen, Evaluation Mode=Zero-shot2026.03 | 53.6 | |
| AdaMoLEFoundation Model=Qwen-2.5-3B, Jointly Fine-Tuning=true, r (per-expert rank)=6, n (number of experts)=4, k (number of activated experts)=22026.05 | 49.39 | |
| RotMoLEFoundation Model=Qwen-2.5-3B, Jointly Fine-Tuning=true, r (per-expert rank)=6, n (number of experts)=4, k (number of activated experts)=22026.05 | 43 | |
| MoLAFoundation Model=Qwen-2.5-3B, Jointly Fine-Tuning=true, r (per-expert rank)=6, n (number of experts)=4, k (number of activated experts)=22026.05 | 39.31 | |
| MoCLEFoundation Model=Qwen-2.5-3B, Jointly Fine-Tuning=true, r (per-expert rank)=6, n (number of experts)=4, k (number of activated experts)=22026.05 | 36.28 |