Math Reasoning on MATH 500 (Pass@4)
96.8Pass@4Qwen3 (ExpertCondenser)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3 (ExpertCondenser)Model Size=30B, Distill Type=ExpertCondenser, Fine-tuning with Stanford-S1=true2026.04 | 96.8 | |
| Qwen3 (DenseMixer)Model Size=30B, Distill Type=DenseMixer, Fine-tuning with Stanford-S1=true2026.04 | 95.8 | |
| Qwen3 (SFT)Model Size=30B, Distill Type=SFT, Fine-tuning with Stanford-S1=true2026.04 | 94.8 | |
| Qwen3 (ESFT)Model Size=30B, Distill Type=ESFT, Fine-tuning with Stanford-S1=true2026.04 | 92 | |
| JURY-RLBackbone=Qwen2.5-7B2026.04 | 75.65 | |
| GT-RewardBackbone=Qwen2.5-7B2026.04 | 75.1 | |
| CoRewardBackbone=Qwen2.5-7B2026.04 | 73.85 | |
| EntropyBackbone=Qwen2.5-7B2026.04 | 73.15 | |
| LLM-KDBackbone=Qwen2.5-7B2026.04 | 72.7 | |
| Self-CertaintyBackbone=Qwen2.5-7B2026.04 | 72.45 | |
| LLM-as-a-JudgeBackbone=Qwen2.5-7B2026.04 | 72.3 | |
| Majority-VotingBackbone=Qwen2.5-7B2026.04 | 71 | |
| GT-RewardBackbone=Qwen3-1.7B-Base2026.04 | 68.35 | |
| LLM-KDBackbone=Qwen3-1.7B-Base2026.04 | 67.8 | |
| DeepSeek-Coder-V2-Lite (ExpertCondenser)Model Size=16B, Distill Type=ExpertCondenser, Fine-tuning with Stanford-S1=true2026.04 | 66.8 | |
| JURY-RLBackbone=Qwen3-1.7B-Base2026.04 | 66.4 | |
| CoRewardBackbone=Qwen3-1.7B-Base2026.04 | 65.4 | |
| EntropyBackbone=Qwen3-1.7B-Base2026.04 | 65 | |
| DeepSeek-Coder-V2-Lite (DenseMixer)Model Size=16B, Distill Type=DenseMixer, Fine-tuning with Stanford-S1=true2026.04 | 64.8 | |
| DeepSeek-Coder-V2-Lite (SFT)Model Size=16B, Distill Type=SFT, Fine-tuning with Stanford-S1=true2026.04 | 64.6 | |
| DeepSeek-Coder-V2-Lite (ESFT)Model Size=16B, Distill Type=ESFT, Fine-tuning with Stanford-S1=true2026.04 | 63 | |
| LLM-as-a-JudgeBackbone=Qwen3-1.7B-Base2026.04 | 63 | |
| Majority-VotingBackbone=Qwen3-1.7B-Base2026.04 | 59.6 | |
| Self-CertaintyBackbone=Qwen3-1.7B-Base2026.04 | 57.05 | |
| LLM-KDBackbone=Llama-3.2-3B-Instruct2026.04 | 51.25 | |
| Before RLBackbone=Qwen2.5-7B2026.04 | 49.2 | |
| JURY-RLBackbone=Llama-3.2-3B-Instruct2026.04 | 48.8 | |
| Majority-VotingBackbone=Llama-3.2-3B-Instruct2026.04 | 48.4 | |
| GT-RewardBackbone=Llama-3.2-3B-Instruct2026.04 | 47.5 | |
| LLM-as-a-JudgeBackbone=Llama-3.2-3B-Instruct2026.04 | 47.35 | |
| CoRewardBackbone=Llama-3.2-3B-Instruct2026.04 | 47.2 | |
| Before RLBackbone=Qwen3-1.7B-Base2026.04 | 46.85 | |
| Before RLBackbone=Llama-3.2-3B-Instruct2026.04 | 44.4 | |
| Self-CertaintyBackbone=Llama-3.2-3B-Instruct2026.04 | 42.4 | |
| EntropyBackbone=Llama-3.2-3B-Instruct2026.04 | 40.5 | |
| Qwen1.5-MoE (ExpertCondenser)Model Size=14B, Distill Type=ExpertCondenser, Fine-tuning with Stanford-S1=true2026.04 | 28.6 | |
| Qwen1.5-MoE (DenseMixer)Model Size=14B, Distill Type=DenseMixer, Fine-tuning with Stanford-S1=true2026.04 | 26.7 | |
| Qwen1.5-MoE (SFT)Model Size=14B, Distill Type=SFT, Fine-tuning with Stanford-S1=true2026.04 | 20.1 | |
| Qwen1.5-MoE (ESFT)Model Size=14B, Distill Type=ESFT, Fine-tuning with Stanford-S1=true2026.04 | 18.1 |