Multiple-choice Question Answering on AQuA
89.45AccuracyAgentRevive
Evaluation Results
| Method | Links | |
|---|---|---|
| AgentReviveVar. NS=True, Flex. State=True, Base model=Qwen2.5-72B-Instruct2026.05 | 89.45 | |
| AgentDropoutVar. NS=True, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 87.5 | |
| GPT-4o + QuaSARBackbone=GPT-4o, Prompting Strategy=QuaSAR2025.02 | 87.4 | |
| ARG-DesignerVar. NS=True, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 87.23 | |
| AgentPruneVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 87.08 | |
| ST-EVOBackbone=gpt-oss-120b2026.02 | 86.56 | |
| SC (CoT)Var. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 86.25 | |
| G-DesignerVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 86.24 | |
| MASround=TVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 85.83 | |
| AutogenVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 85.73 | |
| CoTVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 84.58 | |
| MASround=1Var. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 84.58 | |
| AgentVerseVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 84.35 | |
| GPT-4o + CoTBackbone=GPT-4o, Prompting Strategy=CoT2025.02 | 84.3 | |
| VanillaVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 83.75 | |
| GPT-4o + CoMATBackbone=GPT-4o, Prompting Strategy=CoMAT2025.02 | 83.5 | |
| STEERBackbone=gpt-oss-120b2026.02 | 82.66 | |
| SpecReasonBackbone=gpt-oss-120b2026.02 | 81.36 | |
| SafeSieveBackbone=gpt-oss-120b2026.02 | 80.4 | |
| ARG-DesignerBackbone=gpt-oss-120b2026.02 | 79.48 | |
| Llama-3-70B + QuaSARBackbone=Llama-3-70B, Prompting Strategy=QuaSAR2025.02 | 79.1 | |
| Qwen2-72B + CoTBackbone=Qwen2-72B, Prompting Strategy=CoT2025.02 | 78.8 | |
| AFlowBackbone=gpt-oss-120b2026.02 | 78.2 | |
| Qwen2-72B + QuaSARBackbone=Qwen2-72B, Prompting Strategy=QuaSAR2025.02 | 77.5 | |
| G-DesignerBackbone=gpt-oss-120b2026.02 | 76.3 | |
| GPTSwarmBackbone=gpt-oss-120b2026.02 | 75.44 | |
| Llama-3-70B + CoTBackbone=Llama-3-70B, Prompting Strategy=CoT2025.02 | 74 | |
| GPT-4o + FCoTBackbone=GPT-4o, Prompting Strategy=FCoT2025.02 | 73.6 | |
| LLM-DebateBackbone=gpt-oss-120b2026.02 | 73.52 | |
| GPT-4oBackbone=GPT-4o, Prompting Strategy=Zero-shot2025.02 | 72.8 | |
| Qwen2-72B + CoMATBackbone=Qwen2-72B, Prompting Strategy=CoMAT2025.02 | 72.4 | |
| CoTBackbone=gpt-oss-120b2026.02 | 72.4 | |
| SCBackbone=gpt-oss-120b2026.02 | 71.85 | |
| AutoGenBackbone=gpt-oss-120b2026.02 | 71.5 | |
| TreeBackbone=gpt-oss-120b2026.02 | 71.44 | |
| LangGraphBackbone=gpt-oss-120b2026.02 | 71.27 | |
| Llama-3-70BBackbone=Llama-3-70B, Prompting Strategy=Zero-shot2025.02 | 70.9 | |
| Complete GraphBackbone=gpt-oss-120b2026.02 | 70.44 | |
| Random GraphBackbone=gpt-oss-120b2026.02 | 70.16 | |
| ChainBackbone=gpt-oss-120b2026.02 | 69.85 | |
| VanillaBackbone=gpt-oss-120b2026.02 | 69.27 | |
| Qwen2-72BBackbone=Qwen2-72B, Prompting Strategy=Zero-shot2025.02 | 69 | |
| StarBackbone=gpt-oss-120b2026.02 | 68.5 |