Mathematical Reasoning on MATH (test) (Reward, Acc (%))
80.9AccuracyReM-MoA*
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReM-MoA*Width (N)=8, Depth (L)=3, Trend=↑↑, Distilled Reviewer=true2026.06 | 80.9 | — | |
| ReM-MoA*Width (N)=7, Depth (L)=3, Trend=↑↑, Distilled Reviewer=true2026.06 | 80.5 | — | |
| ReM-MoA*Width (N)=6, Depth (L)=3, Trend=↑↑, Distilled Reviewer=true2026.06 | 79.9 | — | |
| ReM-MoA*Width (N)=5, Depth (L)=3, Trend=↑↑, Distilled Reviewer=true2026.06 | 79.1 | — | |
| ReM-MoAWidth (N)=8, Depth (L)=3, Trend=↑↑2026.06 | 78.9 | — | |
| ReM-MoAWidth (N)=7, Depth (L)=3, Trend=↑↑2026.06 | 78.5 | — | |
| ReM-MoAWidth (N)=6, Depth (L)=3, Trend=↑↑2026.06 | 78 | — | |
| ReM-MoA*Width (N)=4, Depth (L)=3, Trend=↑↑, Distilled Reviewer=true2026.06 | 78 | — | |
| ReM-MoAWidth (N)=5, Depth (L)=3, Trend=↑↑2026.06 | 77.2 | — | |
| ReM-MoA*Width (N)=3, Depth (L)=3, Trend=↑↑, Distilled Reviewer=true2026.06 | 76.8 | — | |
| AttentionMoAWidth (N)=8, Depth (L)=3, Trend=↑↑2026.06 | 76.2 | — | |
| ReM-MoAWidth (N)=4, Depth (L)=3, Trend=↑↑2026.06 | 76.2 | — | |
| AttentionMoAWidth (N)=7, Depth (L)=3, Trend=↑↑2026.06 | 75.9 | — | |
| AttentionMoAWidth (N)=6, Depth (L)=3, Trend=↑↑2026.06 | 75.5 | — | |
| ReM-MoAWidth (N)=3, Depth (L)=3, Trend=↑↑2026.06 | 75 | — | |
| AttentionMoAWidth (N)=5, Depth (L)=3, Trend=↑↑2026.06 | 74.8 | — | |
| AttentionMoAWidth (N)=4, Depth (L)=3, Trend=↑↑2026.06 | 74 | — | |
| RMoAWidth (N)=8, Depth (L)=3, Trend=↑↑2026.06 | 73.8 | — | |
| RMoAWidth (N)=7, Depth (L)=3, Trend=↑↑2026.06 | 73.6 | — | |
| RMoAWidth (N)=6, Depth (L)=3, Trend=↑↑2026.06 | 73.3 | — | |
| AttentionMoAWidth (N)=3, Depth (L)=3, Trend=↑↑2026.06 | 73 | — | |
| RMoAWidth (N)=5, Depth (L)=3, Trend=↑↑2026.06 | 72.7 | — | |
| Standard MoAWidth (N)=8, Depth (L)=3, Trend=↑→2026.06 | 72.1 | — | |
| Standard MoAWidth (N)=7, Depth (L)=3, Trend=↑→2026.06 | 72 | — | |
| RMoAWidth (N)=4, Depth (L)=3, Trend=↑↑2026.06 | 72 | — | |
| Standard MoAWidth (N)=6, Depth (L)=3, Trend=↑→2026.06 | 71.8 | — | |
| Standard MoAWidth (N)=5, Depth (L)=3, Trend=↑→2026.06 | 71.4 | — | |
| RMoAWidth (N)=3, Depth (L)=3, Trend=↑↑2026.06 | 71 | — | |
| Standard MoAWidth (N)=4, Depth (L)=3, Trend=↑→2026.06 | 70.8 | — | |
| Standard MoAWidth (N)=3, Depth (L)=3, Trend=↑→2026.06 | 70 | — | |
| TriAttentionApproach=Trig-series scoring+evict, Offload?=No, Model=Qwen3-8B, Budget=10242026.05 | 68.4 | — | |
| JF-HPOBackbone=Qwen-2.5 7B, Training Dataset=MATH2026.06 | 68.19 | — | |
| VeRL RecipeBackbone=Qwen-2.5 7B, Training Dataset=MATH2026.06 | 63.21 | — | |
| MANGOBase LLM=GPT-4o-mini2026.05 | 58.44 | — | |
| SWIFTParadigm=Proposed, Backbone=GPT-4o-mini2026.04 | 55.14 | — | |
| MANGO (Skip-2)Base LLM=GPT-4o-mini2026.05 | 54.32 | — | |
| MaASParadigm=Automated (Probabilistic Supernet), Backbone=GPT-4o-mini2026.04 | 51.82 | — | |
| MaASBase LLM=GPT-4o-mini2026.05 | 51.82 | — | |
| AFlowParadigm=Automated, Backbone=GPT-4o-mini2026.04 | 51.28 | — | |
| AFlowBase LLM=GPT-4o-mini2026.05 | 51.28 | — | |
| DyLANParadigm=Hand-craft, Backbone=GPT-4o-mini2026.04 | 48.63 | — | |
| DyLANBase LLM=GPT-4o-mini2026.05 | 48.63 | — | |
| LLM-DebateParadigm=Hand-craft, Backbone=GPT-4o-mini2026.04 | 48.54 | — | |
| LLM-DebateBase LLM=GPT-4o-mini2026.05 | 48.54 | — | |
| Plan-and-ExecuteBase LLM=GPT-4o-mini2026.05 | 48.54 | — | |
| AgentSquareParadigm=Automated, Backbone=GPT-4o-mini2026.04 | 48.51 | — | |
| AgentSquareBase LLM=GPT-4o-mini2026.05 | 48.51 | — | |
| SC (CoT×5)Paradigm=Single, Backbone=GPT-4o-mini2026.04 | 47.91 | — | |
| SC (CoT×5)Base LLM=GPT-4o-mini2026.05 | 47.91 | — | |
| GPTSwarmParadigm=Automated, Backbone=GPT-4o-mini2026.04 | 47.88 | — | |
| GPTSwarmBase LLM=GPT-4o-mini2026.05 | 47.88 | — | |
| AgentVerseParadigm=Hand-craft, Backbone=GPT-4o-mini2026.04 | 47.35 | — | |
| LLM-BlenderParadigm=Hand-craft, Backbone=GPT-4o-mini2026.04 | 46.92 | — | |
| ComplexCoTParadigm=Single, Backbone=GPT-4o-mini2026.04 | 46.53 | — | |
| CoTParadigm=Single, Backbone=GPT-4o-mini2026.04 | 46.4 | — | |
| CoTBase LLM=GPT-4o-mini2026.05 | 46.4 | — | |
| VanillaParadigm=Single, Backbone=GPT-4o-mini2026.04 | 46.29 | — | |
| IO (direct LLM invocation)Base LLM=GPT-4o-mini2026.05 | 46.29 | — | |
| Self-RefineBase LLM=GPT-4o-mini2026.05 | 46.09 | — | |
| MultiPersonaParadigm=Hand-craft, Backbone=GPT-4o-mini2026.04 | 45.43 | — | |
| MultiPersonaBase LLM=GPT-4o-mini2026.05 | 45.43 | — | |
| AutoAgentsParadigm=Automated, Backbone=GPT-4o-mini2026.04 | 45.32 | — | |
| MacNetParadigm=Hand-craft, Backbone=GPT-4o-mini2026.04 | 45.18 | — | |
| ADASParadigm=Automated, Backbone=GPT-4o-mini2026.04 | 43.18 | — | |
| ADASBase LLM=GPT-4o-mini2026.05 | 43.18 | — | |
| SEABase Model=LLaMA-3.2-1B-Instruct2025.05 | 32 | 10.83 | |
| SFTBase Model=LLaMA-3.2-1B-Instruct2025.05 | 27.5 | 6.19 | |
| BoN-8Base Model=LLaMA-3.2-1B-Instruct, N=82025.05 | 19.5 | 4.84 | |
| BoN-64Base Model=LLaMA-3.2-1B-Instruct, N=642025.05 | 16 | 7.41 | |
| BoN-32Base Model=LLaMA-3.2-1B-Instruct, N=322025.05 | 15.5 | 6.49 | |
| RSBase Model=LLaMA-3.2-1B-Instruct2025.05 | 13 | 1.42 | |
| ARGSBase Model=LLaMA-3.2-1B-Instruct2025.05 | 7 | -2.33 | |
| CBSBase Model=LLaMA-3.2-1B-Instruct2025.05 | 0.5 | -2.02 |