Mathematics on MATH (Accuracy)
95.1MATH AccuracyQwen 3 VL 32B Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen 3 VL 32B InstructParameters=32B2025.12 | 95.1 | |
| Qwen3-VLModel Size=8B, Variant=Instruct, maj@1 evaluation protocol=true2026.01 | 94.6 | |
| Olmo 3.1 32B InstructStage=Final Instruct 3.12025.12 | 93.4 | |
| POESOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 92.7 | |
| POESOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 92.2 | |
| AnchorOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 91.9 | |
| RandomOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 91.7 | |
| ZipCache-4Backbone=DeepSeek-R1-Distill-Llama-8B, Quantization=ZipCache-42025.02 | 91.6 | |
| POESOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 91.5 | |
| AnchorOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 91.5 | |
| AnchorOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 91.3 | |
| IPOMPOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 91.2 | |
| Bf16Backbone=DeepSeek-R1-Distill-Llama-8B, Quantization=Bf162025.02 | 91.2 | |
| PredictionOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 90.8 | |
| PredictionOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 90.8 | |
| RandomOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 90.7 | |
| SESSOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 90.7 | |
| SESSOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 90.5 | |
| Ministral 3Model Size=14B, maj@1 evaluation protocol=true2026.01 | 90.4 | |
| RandomOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 90.3 | |
| SESSOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 90.2 | |
| IPOMPOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 90.1 | |
| Qwen3-VLModel Size=4B, Variant=Instruct, maj@1 evaluation protocol=true2026.01 | 90 | |
| POESOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 90 | |
| PredictionOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 89.8 | |
| KIVI-4Backbone=DeepSeek-R1-Distill-Llama-8B, Quantization=KIVI-42025.02 | 89.8 | |
| IPOMPOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 89.4 | |
| PolarQuant44Backbone=DeepSeek-R1-Distill-Llama-8B, Quantization=PolarQuant442025.02 | 89 | |
| Ministral 3Model Size=8B, maj@1 evaluation protocol=true2026.01 | 87.6 | |
| Gemma 3 27BParameters=27B2025.12 | 87.4 | |
| Gemma 3 27BParameters=27B2026.02 | 87.4 | |
| Qwen3Model Size=14B, Variant=Non-Thinking, maj@1 evaluation protocol=true2026.01 | 87 | |
| MAS-GPTBackbone=Qwen-2.5-72B-Instruct2025.05 | 87 | |
| Olmo 3.1 32B InstructStage=DPO2025.12 | 86.6 | |
| DictaLM 3.0 24B-ThinkParameters=24B, Variant=Thinking2026.02 | 86.41 | |
| SCBackbone=Qwen-2.5-72B-Instruct2025.05 | 86 | |
| Gemma3Model Size=12B, Variant=Instruct, maj@1 evaluation protocol=true2026.01 | 85.4 | |
| DebateBackbone=Qwen-2.5-72B-Instruct2025.05 | 85.4 | |
| Bf16Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Quantization=Bf162025.02 | 85.2 | |
| AFlow-MathBackbone=Qwen-2.5-72B-Instruct2025.05 | 84.8 | |
| LLaDA2.1-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 84.56 | |
| Qwen 3 32BThinking=No, Parameters=32B2025.12 | 84.3 | |
| DyLANBackbone=Qwen-2.5-72B-Instruct2025.05 | 84.2 | |
| MADBackbone=Qwen-2.5-72B-Instruct2025.05 | 83.8 | |
| Ministral 3Model Size=3B, maj@1 evaluation protocol=true2026.01 | 83 | |
| CoTBackbone=Qwen-2.5-72B-Instruct2025.05 | 83 | |
| AgentVerseBackbone=Qwen-2.5-72B-Instruct2025.05 | 82.8 | |
| SingleBackbone=Qwen-2.5-72B-Instruct2025.05 | 82.4 | |
| AFlow-MathBackbone=Llama-3.3-70B-Instruct2025.05 | 82.2 | |
| MacNetBackbone=Qwen-2.5-72B-Instruct2025.05 | 82.2 | |
| MAVBackbone=Qwen-2.5-72B-Instruct2025.05 | 82.2 | |
| LLaDA2.0-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 81.5 | |
| AutoGenBackbone=Qwen-2.5-72B-Instruct2025.05 | 81.4 | |
| KIVI-4Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Quantization=KIVI-42025.02 | 80.4 | |
| Qwen 2.5 32BParameters=32B2025.12 | 80.2 | |
| PolarQuant44Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Quantization=PolarQuant442025.02 | 80.2 | |
| MAS-GPTBackbone=Llama-3.3-70B-Instruct2025.05 | 79.8 | |
| MAVBackbone=Llama-3.3-70B-Instruct2025.05 | 79.4 | |
| Qwen3-VLModel Size=2B, Variant=Instruct, maj@1 evaluation protocol=true2026.01 | 78.6 | |
| AgentVerseBackbone=Llama-3.3-70B-Instruct2025.05 | 78.6 | |
| SDAR-8B-Chatgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 78.4 | |
| DebateBackbone=Llama-3.3-70B-Instruct2025.05 | 78.4 | |
| JoyAI-LLM Flash-Baseshots=4-shot, Decoding=Greedy2026.04 | 78.1 | |
| DyLANBackbone=Llama-3.3-70B-Instruct2025.05 | 77.6 | |
| RandomOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 77.5 | |
| IPOMPOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 76.7 | |
| SCBackbone=Llama-3.3-70B-Instruct2025.05 | 76.2 | |
| MADBackbone=Llama-3.3-70B-Instruct2025.05 | 76.2 | |
| Gemma3Model Size=4B, Variant=Instruct, maj@1 evaluation protocol=true2026.01 | 75.9 | |
| Fine-tunedBase LLM=Qwen-2.5-7B-Instruct, Parameters=x4, Evaluation Protocol=0 shot, CoT2026.05 | 75.3 | |
| MacNetBackbone=Llama-3.3-70B-Instruct2025.05 | 75.2 | |
| Zero-shotBase LLM=Qwen-2.5-7B-Instruct, Parameters=x1, Evaluation Protocol=0 shot, CoT2026.05 | 75 | |
| Qwen3-14BShots=42026.04 | 74.7 | |
| Olmo 3.1 32B InstructStage=SFT2025.12 | 74.4 | |
| CoTBackbone=Llama-3.3-70B-Instruct2025.05 | 74.4 | |
| FREE-MergingBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.08, Evaluation Protocol=0 shot, CoT2026.05 | 74.2 | |
| DiDi-Merg.-LBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.0, Evaluation Protocol=0 shot, CoT2026.05 | 74 | |
| AnchorOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 73.5 | |
| XekRung-8BShots=42026.04 | 73.5 | |
| SingleBackbone=Llama-3.3-70B-Instruct2025.05 | 72.8 | |
| AutoGenBackbone=Llama-3.3-70B-Instruct2025.05 | 72.8 | |
| Twin-MergingBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.25, Evaluation Protocol=0 shot, CoT2026.05 | 72.1 | |
| SESSOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 72 | |
| PredictionOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 72 | |
| POESOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 71.5 | |
| SESSOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 71.3 | |
| Qwen3-8BShots=42026.04 | 71.05 | |
| RandomOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 70.8 | |
| POESOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 70.3 | |
| Llama-3.3-70B-InstructShots=42026.04 | 69.55 | |
| SESSOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 69.5 | |
| RandomOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 69 | |
| PredictionOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 68.8 | |
| SDAR-30B-A3Bgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 68.56 | |
| AnchorOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 68.5 | |
| IPOMPOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 68.2 | |
| Mistral Small 3.12026.02 | 67.93 | |
| IPOMPOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 67.7 | |
| Qwen3.5-9BShots=42026.04 | 66.9 | |
| AnchorOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 66.7 |