Accuracy on MMLU Reasoning
91.35AccuracyDMoA
Evaluation Results
| Method | Links | |
|---|---|---|
| DMoABackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 91.35 | |
| DR-Rubric-8B (BS-3)Training=SFT+RL, 3K2026.05 | 85.3 | |
| ARG-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 85.04 | |
| SafeSieveBackbone=gpt-oss-120b2026.05 | 84.65 | |
| G-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 84.63 | |
| STEERBackbone=gpt-oss-120b2026.05 | 84.4 | |
| DALAToken Cons.=3.80 × 10⁵2025.11 | 84.3 | |
| SpecReasonBackbone=gpt-oss-120b2026.05 | 84.2 | |
| AgentPrune-RToken Cons.=9.60 × 10⁵2025.11 | 84 | |
| GPTSwarmBackbone=gpt-oss-120b2026.05 | 83.8 | |
| WebExplorer-8BTraining=SFT+RL, 25K2026.05 | 83.8 | |
| DR-Rubric-8B (Gemini)Training=SFT+RL, 1K2026.05 | 83.8 | |
| LLM-DebateToken Cons.=1.50 × 10⁶2025.11 | 83.7 | |
| PHPToken Cons.=2.60 × 10⁶2025.11 | 83.4 | |
| LLM-DebateBackbone=gpt-oss-120b2026.05 | 83.28 | |
| AutoGenBackbone=gpt-oss-120b2026.05 | 83.25 | |
| AFlowBackbone=gpt-oss-120b2026.05 | 83.22 | |
| Random GraphBackbone=gpt-oss-120b2026.05 | 83.2 | |
| SCBackbone=gpt-oss-120b2026.05 | 82.95 | |
| Complete GraphBackbone=gpt-oss-120b2026.05 | 82.75 | |
| MoABackbone=gpt-oss-120b2026.05 | 82.65 | |
| ChainBackbone=gpt-oss-120b2026.05 | 82.4 | |
| VanillaToken Cons.=1.50 × 10⁵2025.11 | 82.1 | |
| CoTBackbone=gpt-oss-120b2026.05 | 81.85 | |
| Qwen3-8B-SFTTraining=SFT, 1K2026.05 | 81.8 | |
| TreeBackbone=gpt-oss-120b2026.05 | 81.55 | |
| VanillaBackbone=gpt-oss-120b2026.05 | 80.47 | |
| DR-Rubric-8B (GPT-5)Training=SFT+RL, 1K2026.05 | 80.3 | |
| DyLANToken Cons.=1.20 × 10⁶2025.11 | 80.2 | |
| Relational AggregationCategory=Ours2026.05 | 79.8 | |
| StarBackbone=gpt-oss-120b2026.05 | 79.64 | |
| Qwen2.5-7B2026.05 | 79.3 | |
| GoAMaxCategory=Multi-Agent2026.05 | 79.18 | |
| DR-Tulu-SFT-8BTraining=SFT, 16K2026.05 | 79 | |
| DR-Tulu-RL-8BTraining=SFT+RL, 25K2026.05 | 79 | |
| GoAMeanCategory=Multi-Agent2026.05 | 78.52 | |
| Qwen3-8B2026.05 | 78.5 | |
| Anchor (Refined Belief)Category=Ours2026.05 | 78.43 | |
| Self-MoACategory=Multi-Agent2026.05 | 78.14 | |
| Search-R1-7BTraining=RL, 90K2026.05 | 78 | |
| SCCategory=Multi-Agent2026.05 | 77.97 | |
| GeneralCategory=Single-Agent2026.05 | 77.61 | |
| RefineCategory=Multi-Agent2026.05 | 77.4 | |
| Anchor (Initial Belief)Category=Ours2026.05 | 77.31 | |
| Majority (Refined Belief)Category=Ours2026.05 | 76.22 | |
| MoACategory=Multi-Agent2026.05 | 75.71 | |
| Majority (Initial Belief)Category=Ours2026.05 | 73.51 | |
| DebateCategory=Multi-Agent2026.05 | 72.53 | |
| ReConcileCategory=Multi-Agent2026.05 | 69.61 | |
| CodeCategory=Single-Agent2026.05 | 68.04 | |
| MathCategory=Single-Agent2026.05 | 63.47 | |
| LegalCategory=Single-Agent2026.05 | 55.86 | |
| FP16Precision=FP162026.06 | 55.26 | |
| FinanceCategory=Single-Agent2026.05 | 54.11 | |
| BiomedicalCategory=Single-Agent2026.05 | 46.6 | |
| LC-QATQuantization=Linear-Constrained Vector Quantization2026.06 | 45.92 | |
| PV-TUNING2026.06 | 44.7 |