Question Answering on HotpotQA (Acc)
90.38AccuracyDMoA
Evaluation Results
| Method | Links | |
|---|---|---|
| DMoABackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 90.38 | |
| AFlowBackbone=gpt-oss-120b2026.05 | 90.04 | |
| STEERBackbone=gpt-oss-120b2026.05 | 89.35 | |
| SpecReasonBackbone=gpt-oss-120b2026.05 | 88.29 | |
| G-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 87.66 | |
| SafeSieveBackbone=gpt-oss-120b2026.05 | 87.22 | |
| ARG-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 86.45 | |
| GPTSwarmBackbone=gpt-oss-120b2026.05 | 85.4 | |
| LLM-DebateBackbone=gpt-oss-120b2026.05 | 84.55 | |
| Random GraphBackbone=gpt-oss-120b2026.05 | 84.28 | |
| MoABackbone=gpt-oss-120b2026.05 | 84.02 | |
| StarBackbone=gpt-oss-120b2026.05 | 83.52 | |
| Complete GraphBackbone=gpt-oss-120b2026.05 | 83.35 | |
| AutoGenBackbone=gpt-oss-120b2026.05 | 83.25 | |
| VanillaBackbone=gpt-oss-120b2026.05 | 82.35 | |
| SCBackbone=gpt-oss-120b2026.05 | 82.24 | |
| TreeBackbone=gpt-oss-120b2026.05 | 81.5 | |
| CoTBackbone=gpt-oss-120b2026.05 | 81.04 | |
| ChainBackbone=gpt-oss-120b2026.05 | 80.77 | |
| FE-SFT & FC-RLBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 59 | |
| FE-SFT & RLBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 57 | |
| FE-SFT & RL*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 55.4 | |
| State-SFT & RL†Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 55.2 | |
| IWM & RLBackbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 55 | |
| State-SFT & RL‡Backbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 54.6 | |
| SFT & RL*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 53.8 | |
| SFT & RLBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 53.6 | |
| IWMBackbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=SFT stage2026.06 | 46 | |
| FE-SFTBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=SFT stage2026.06 | 45.8 | |
| SFT*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=SFT stage2026.06 | 44.8 | |
| SFTBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=SFT stage2026.06 | 44.6 | |
| Naive RAGLLM=Llama-3.1-8B, Write-back=true2026.03 | 43.56 | |
| RePlugLLM=Llama-3.1-8B, Write-back=true2026.03 | 43.12 | |
| Naive RAGLLM=Llama-3.1-8B, Write-back=false2026.03 | 42.33 | |
| FE-SFT*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=SFT stage2026.06 | 42.2 | |
| RePlugLLM=Llama-3.1-8B, Write-back=false2026.03 | 42.12 | |
| Naive RAGLLM=Gemma-3-12B, Write-back=true2026.03 | 41.99 | |
| RePlugLLM=Gemma-3-12B, Write-back=true2026.03 | 41.97 | |
| Naive RAGLLM=Gemma-3-12B, Write-back=false2026.03 | 41.13 | |
| RePlugLLM=Gemma-3-12B, Write-back=false2026.03 | 41.13 | |
| FLARELLM=Llama-3.1-8B, Write-back=true2026.03 | 32.12 | |
| FLARELLM=Llama-3.1-8B, Write-back=false2026.03 | 31.25 | |
| Self-RAGLLM=Llama-3.1-8B, Write-back=true2026.03 | 31.04 | |
| FLARELLM=Gemma-3-12B, Write-back=true2026.03 | 30.18 | |
| FLARELLM=Gemma-3-12B, Write-back=false2026.03 | 29.82 | |
| Self-RAGLLM=Llama-3.1-8B, Write-back=false2026.03 | 29.33 | |
| Self-RAGLLM=Gemma-3-12B, Write-back=true2026.03 | 28.73 | |
| Self-RAGLLM=Gemma-3-12B, Write-back=false2026.03 | 27.49 | |
| No RetrievalLLM=Gemma-3-12B2026.03 | 24.28 | |
| No RetrievalLLM=Llama-3.1-8B2026.03 | 23.9 |