General Reasoning on MMLU-Pro (Accuracy)
82.3AccuracyAFlow
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AFlowOptimizer=Claude-3.5-Sonnet, Executor=Claude-3.7-Sonnet2026.01 | 82.3 | — | |
| MaASOptimizer=Claude-3.5-Sonnet, Executor=Claude-3.7-Sonnet2026.01 | 82 | — | |
| BayesFlowOptimizer=Claude-3.5-Sonnet, Executor=Claude-3.7-Sonnet2026.01 | 81.8 | — | |
| QwenLong-L1.5-30B-A3B2025.12 | 81.33 | — | |
| QwenLong L1.5-30BModel=QwenLong L1.5-30B2026.05 | 81.1 | — | |
| Qwen3-30B-A3B-Thinking-25072025.12 | 81.03 | — | |
| GoLongRL (w. GRPO)Model=Qwen3-30B-A3B-Thinking-2507, Optimization Method=GRPO2026.05 | 81 | — | |
| Qwen3-30B-A3B-Thinking-2507 BaseModel=Qwen3-30B-A3B-Thinking-2507, Optimization Method=Base2026.05 | 80.2 | — | |
| ADASOptimizer=Claude-3.5-Sonnet, Executor=Claude-3.7-Sonnet2026.01 | 80.1 | — | |
| Critique-GRPOCritique Model=GPT-4o, Decoding budget=16,384 tokens2025.06 | 78.49 | — | |
| R1-GRPOCritique Model=None, Decoding budget=16,384 tokens2025.06 | 77.97 | — | |
| CoTOptimizer=Claude-3.5-Sonnet, Executor=Claude-3.7-Sonnet2026.01 | 77.4 | — | |
| Qwen3-32BCritique Model=None, Decoding budget=16,384 tokens2025.06 | 77.06 | — | |
| GoLongRL (w. TMN-Reweight)Model=Qwen3-4B-Thinking-2507, Optimization Method=TMN-Reweight2026.05 | 74.3 | — | |
| GSPO + NSRModel=Qwen3-30B-A3B-Base, Zero-shot=true (k=32, T=1.0)2026.05 | 74.27 | — | |
| Qwen3-4B-Thinking-2507 BaseModel=Qwen3-4B-Thinking-2507, Optimization Method=Base2026.05 | 73.6 | — | |
| GSPOModel=Qwen3-30B-A3B-Base, Zero-shot=true (k=32, T=1.0)2026.05 | 72.08 | — | |
| AGENT-RADAR2026.05 | 69.4 | — | |
| AgentDropout2026.05 | 67.4 | — | |
| Qwen3-8BEvaluation Protocol=Zero-shot, TPS=31.422025.12 | 67.25 | — | |
| TTSRBackbone Model=Qwen3-8B-Base2026.02 | 66.7 | — | |
| DAPO + NSRModel=Qwen3-8B-Base, Zero-shot=true (k=32, T=1.0)2026.05 | 66.41 | — | |
| INFUSERModel Backbone=Qwen3-8B-Base2026.06 | 66.2 | — | |
| WISTBackbone=Qwen3-14B-Base2026.03 | 66 | — | |
| DAPOModel=Qwen3-8B-Base, Zero-shot=true (k=32, T=1.0)2026.05 | 65.67 | — | |
| SPICEBackbone=Qwen3-14B-Base2026.03 | 65.4 | — | |
| R-ZeroBackbone=Qwen3-14B-Base2026.03 | 65.3 | — | |
| + SPICEBackbone=Qwen3-8B-Base, #Data=20K2026.05 | 65 | — | |
| SPICEModel Backbone=Qwen3-8B-Base2026.06 | 65 | — | |
| Base ModelBackbone=Qwen3-14B-Base2026.03 | 63.9 | — | |
| AgentPrune2026.05 | 63.6 | — | |
| R-FewModel Backbone=Qwen3-8B-Base2026.06 | 63.2 | — | |
| D2EvoBackbone=Qwen3-8B-Base, #Data=1.7K, Iteration=32026.05 | 62.95 | — | |
| TTRLBackbone Model=Qwen3-8B-Base2026.02 | 62.8 | — | |
| CoT-SCsample_size (n)=82026.05 | 62.6 | — | |
| + AZRBackbone=Qwen3-8B-Base2026.05 | 62.5 | — | |
| + Full DataBackbone=Qwen3-8B-Base, #Data=19K2026.05 | 62.41 | — | |
| SpecRModel Scale=1.5B, System Configuration=LLM-involved2026.04 | 62.4 | — | |
| AZRModel Backbone=Qwen3-8B-Base2026.06 | 62.32 | — | |
| R-ZeroModel Backbone=Qwen3-8B-Base2026.06 | 61.82 | — | |
| + R-ZeroBackbone=Qwen3-8B-Base2026.05 | 61.56 | — | |
| R-ZeroBackbone Model=Qwen3-8B-Base2026.02 | 61.5 | — | |
| WISTBackbone=Qwen3-8B-Base2026.03 | 61.1 | — | |
| TTSRBackbone Model=Qwen3-4B-Base2026.02 | 60.8 | — | |
| SPICEBackbone=Qwen3-8B-Base2026.03 | 60.8 | — | |
| R-ZeroBackbone=Qwen3-8B-Base2026.03 | 60.4 | — | |
| Vanilla2026.05 | 60.2 | — | |
| INFUSERModel Backbone=Qwen3-4B-Base2026.06 | 60.2 | — | |
| BaseModel Backbone=Qwen3-8B-Base2026.06 | 59.91 | — | |
| Base ModelBackbone=Qwen3-8B-Base2026.05 | 58.8 | — | |
| Base ModelBackbone Model=Qwen3-8B-Base2026.02 | 58.6 | — | |
| Base ModelBackbone=Qwen3-8B-Base2026.03 | 58.2 | — | |
| + SPICEBackbone=Qwen3-4B-Base, #Data=20K2026.05 | 58.1 | — | |
| SPICEModel Backbone=Qwen3-4B-Base2026.06 | 58.1 | — | |
| NEMOTRON-CROSSTHINKCategory=Data Source, Blend=Bgpr↑2025.04 | 57.82 | — | |
| IOOptimizer=Claude-3.5-Sonnet, Executor=Claude-3.7-Sonnet2026.01 | 57.8 | — | |
| AZRModel Backbone=Qwen3-4B-Base2026.06 | 57.53 | — | |
| LLaDA2.1-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 57.52 | — | |
| LLaDA2.0-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 57.1 | — | |
| TakeoverModel Scale=1.5B, System Configuration=LLM-involved2026.04 | 57 | — | |
| SDAR-8B-Chatgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 56.49 | — | |
| Compaction2026.05 | 56.4 | — | |
| D2EvoBackbone=Qwen3-4B-Base, #Data=1.4K, Iteration=32026.05 | 56.37 | — | |
| BayesFlowOptimizer=Claude-3.5-Sonnet, Executor=Qwen 2.5-7B-Instruct2026.01 | 56.2 | — | |
| CHORD-ϕmechanism=dual-control2025.08 | 56.2 | — | |
| R-FewModel Backbone=Qwen3-4B-Base2026.06 | 56.2 | — | |
| NEMOTRON-CROSSTHINKCategory=Data Usefulness, Blend=Bscore2025.04 | 56.16 | — | |
| R2RModel Scale=1.5B, System Configuration=LLM-involved2026.04 | 56.1 | — | |
| TTRLBackbone Model=Qwen3-4B-Base2026.02 | 56 | — | |
| NEMOTRON-CROSSTHINKCategory=Question Types, Blend=Bopen↑2025.04 | 55.82 | — | |
| R-ZeroModel Backbone=Qwen3-4B-Base2026.06 | 55.8 | — | |
| NEMOTRON-CROSSTHINKCategory=Question Types, Blend=Bmcq↑2025.04 | 55.77 | — | |
| + Full DataBackbone=Qwen3-4B-Base, #Data=19K2026.05 | 55.76 | — | |
| WISTBackbone=Qwen3-4B-Base2026.03 | 55.7 | — | |
| S2TModel Scale=1.5B, System Configuration=LLM-involved2026.04 | 55.6 | — | |
| NEMOTRON-CROSSTHINKCategory=Data Source, Blend=Bmr↑2025.04 | 55.51 | — | |
| R-ZeroBackbone Model=Qwen3-4B-Base2026.02 | 55 | — | |
| NEMOTRON-CROSSTHINKBlend=Bnd2025.04 | 54.81 | — | |
| MaASOptimizer=Claude-3.5-Sonnet, Executor=Qwen 2.5-7B-Instruct2026.01 | 54.6 | — | |
| SPICEBackbone=Qwen3-4B-Base2026.03 | 54.3 | — | |
| NEMOTRON-CROSSTHINKCategory=Single Source, Blend=Bonly_mr2025.04 | 54.26 | — | |
| CoTOptimizer=Claude-3.5-Sonnet, Executor=Qwen 2.5-7B-Instruct2026.01 | 53.9 | — | |
| R-ZeroBackbone=Qwen3-4B-Base2026.03 | 53.7 | — | |
| ADASOptimizer=Claude-3.5-Sonnet, Executor=Qwen 2.5-7B-Instruct2026.01 | 53.4 | — | |
| LUFFYBase Model=Qwen2.5-Math-7B2025.07 | 53 | — | |
| BaseModel Backbone=Qwen3-4B-Base2026.06 | 52.98 | — | |
| + AZRBackbone=Qwen3-4B-Base2026.05 | 52.6 | — | |
| + R-ZeroBackbone=Qwen3-4B-Base2026.05 | 52.55 | — | |
| ReLIFTBase Model=Qwen2.5-Math-7B2025.07 | 52.5 | — | |
| Prefix-RFTBase Model=Qwen2.5-Math-7B2025.07 | 52.1 | — | |
| NEMOTRON-CROSSTHINKCategory=Single Source, Blend=Bonly_gpr2025.04 | 52.06 | — | |
| Base ModelBackbone Model=Qwen3-4B-Base2026.02 | 52 | — | |
| Base ModelBackbone=Qwen3-4B-Base2026.03 | 51.5 | — | |
| SFT-best + RLSFT intensity=thorough, RL=true2025.08 | 51.3 | — | |
| AFlowOptimizer=Claude-3.5-Sonnet, Executor=Qwen 2.5-7B-Instruct2026.01 | 51 | — | |
| Base ModelBackbone=Qwen3-4B-Base2026.05 | 50.39 | — | |
| D2EvoBackbone=Llama-3.1-8B, #Data=1.2K, Iteration=32026.05 | 49.49 | — | |
| UFTBase Model=Qwen2.5-Math-7B2025.07 | 49.4 | — | |
| RFTBase Model=Qwen2.5-Math-7B2025.07 | 49.3 | — | |
| ORZModel=ORZ2025.04 | 48.9 | — |