Mathematical Word Problem Solving on SVAMP
96.94AccuracyAgentRevive
Evaluation Results
| Method | Links | |
|---|---|---|
| AgentReviveVar. NS=True, Flex. State=True, Base model=Qwen2.5-72B-Instruct2026.05 | 96.94 | |
| SafeSieveParadigm=post-prune, Base model=deepseek-V3-671B2025.08 | 96.6 | |
| AgentDropoutParadigm=post-prune, Base model=deepseek-V3-671B2025.08 | 96.01 | |
| AgentPruneParadigm=post-prune, Base model=deepseek-V3-671B2025.08 | 95.4 | |
| AgentDropoutVar. NS=True, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 95.34 | |
| ARG-DesignerVar. NS=True, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 94.63 | |
| AgentPruneVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 94.33 | |
| MASround=TVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 94.07 | |
| CoTParadigm=single, Base model=deepseek-V3-671B2025.08 | 93.94 | |
| AutogenVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 93.86 | |
| G-DesignerParadigm=pre-design, Base model=deepseek-V3-671B2025.08 | 93.79 | |
| SC (CoT)Var. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 93.79 | |
| VanillaParadigm=single, Base model=deepseek-V3-671B2025.08 | 93.67 | |
| CoTVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 93.35 | |
| SafeSieveParadigm=post-prune, Base model=gpt-4o-mini (~8B)2025.08 | 93.29 | |
| AgentPruneParadigm=post-prune, Base model=gpt-4o-mini (~8B)2025.08 | 93.05 | |
| AgentDropoutParadigm=post-prune, Base model=gpt-4o-mini (~8B)2025.08 | 92.9 | |
| G-DesignerVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 92.81 | |
| VanillaVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 92.67 | |
| AgentVerseVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 92.45 | |
| GPTSwarmParadigm=pre-design, Base model=deepseek-V3-671B2025.08 | 92.43 | |
| MASround=1Var. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 92.36 | |
| G-DesignerParadigm=pre-design, Base model=gpt-4o-mini (~8B)2025.08 | 90.29 | |
| VanillaParadigm=single, Base model=gpt-4o-mini (~8B)2025.08 | 88.26 | |
| ATOMBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 87.4 | |
| RandomBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 87.29 | |
| ARG-DesignerBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 87.29 | |
| LLM-DebateBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 87.19 | |
| G-DesignerBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 87.08 | |
| GPTSwarmParadigm=pre-design, Base model=gpt-4o-mini (~8B)2025.08 | 87.02 | |
| AgentPruneBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 86.77 | |
| CoTParadigm=single, Base model=gpt-4o-mini (~8B)2025.08 | 86.24 | |
| AgentDropoutBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 86.1 | |
| ChainBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 85.36 | |
| CoTBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 84.69 | |
| VanillaBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 84.39 | |
| CompleteBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 83.13 | |
| StarBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 82.74 |