Math Reasoning on AIME 2025 (Accuracy %)
94.6AccuracyGPT-5 high
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5 highInput Modality=Text, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 94.6 | |
| JCJudge Model=GPT-OSS 20B, Trace Generation Model=DS-R1 8B2026.05 | 93.5 | |
| JCJudge Model=GPT-OSS 20B, Trace Generation Model=Qwen3 32B2026.05 | 90.9 | |
| WSCJudge Model=GPT-OSS 20B, Trace Generation Model=DS-R1 8B2026.05 | 88.4 | |
| Gemini 2.5 ProInput Modality=Text, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 88 | |
| JCJudge Model=DS-R1 8B, Trace Generation Model=DS-R1 8B2026.05 | 87.1 | |
| Claude Sonnet 4.5Input Modality=Text, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 87 | |
| JCJudge Model=GPT-OSS 20B, Trace Generation Model=Qwen3 8B2026.05 | 86.2 | |
| WSCJudge Model=DS-R1 8B, Trace Generation Model=DS-R1 8B2026.05 | 85.5 | |
| JCJudge Model=DS-R1 8B, Trace Generation Model=Qwen3 32B2026.05 | 84.9 | |
| JCJudge Model=DS-R1 8B, Trace Generation Model=Qwen3 8B2026.05 | 84.1 | |
| WSCJudge Model=GPT-OSS 20B, Trace Generation Model=Qwen3 32B2026.05 | 83.4 | |
| SCJudge Model=Intrinsic (None), Trace Generation Model=DS-R1 8B2026.05 | 83.1 | |
| Self-Cert.Judge Model=Intrinsic (None), Trace Generation Model=DS-R1 8B2026.05 | 83.1 | |
| DeepConfJudge Model=Intrinsic (None), Trace Generation Model=DS-R1 8B2026.05 | 83.1 | |
| WSCJudge Model=GPT-OSS 20B, Trace Generation Model=Qwen3 8B2026.05 | 81.4 | |
| WSCJudge Model=DS-R1 8B, Trace Generation Model=Qwen3 32B2026.05 | 80.7 | |
| DeepConfJudge Model=Intrinsic (None), Trace Generation Model=Qwen3 32B2026.05 | 80.3 | |
| SCJudge Model=Intrinsic (None), Trace Generation Model=Qwen3 32B2026.05 | 80.2 | |
| Self-Cert.Judge Model=Intrinsic (None), Trace Generation Model=Qwen3 32B2026.05 | 80 | |
| SCJudge Model=Intrinsic (None), Trace Generation Model=Qwen3 8B2026.05 | 77 | |
| DeepConfJudge Model=Intrinsic (None), Trace Generation Model=Qwen3 8B2026.05 | 76.8 | |
| WSCJudge Model=DS-R1 8B, Trace Generation Model=Qwen3 8B2026.05 | 76.8 | |
| Self-Cert.Judge Model=Intrinsic (None), Trace Generation Model=Qwen3 8B2026.05 | 76.6 | |
| Uni-OPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 57.2 | |
| Uni-OPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 57 | |
| ExOPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 56.1 | |
| ExOPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 56 | |
| ExPODistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 55.2 | |
| OPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 55.2 | |
| TeacherTraining Strategy=RL2026.05 | 55.1 | |
| ExPODistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 54.5 | |
| SFTDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 53.3 | |
| OPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 52.4 | |
| Sora-2 AudioInput Modality=Audio, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 36.7 | |
| Sora-2 Last FrameInput Modality=Last Frame, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 33.3 | |
| Prefix-RFTBase Model=Qwen2.5-Math-7B2025.07 | 26.4 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 24.2 | |
| SFT+RFTBase Model=Qwen2.5-Math-7B2025.07 | 23.1 | |
| LUFFYBase Model=Qwen2.5-Math-7B2025.07 | 23.1 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 23 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 22.8 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 22.4 | |
| SFTBase Model=Qwen2.5-Math-7B2025.07 | 22.3 | |
| ReLIFTBase Model=Qwen2.5-Math-7B2025.07 | 20.1 | |
| StudentModel Scale=4B2026.05 | 19.3 | |
| UFTBase Model=Qwen2.5-Math-7B2025.07 | 16.5 | |
| RL w/ SFT LossBase Model=Qwen2.5-Math-7B2025.07 | 16.4 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 15.9 | |
| RFTBase Model=Qwen2.5-Math-7B2025.07 | 15.3 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 13.3 | |
| Oat-ZeroBase Model=Qwen2.5-Math-7B2025.07 | 11.9 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 11.8 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 11.3 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 10.8 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 9.4 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 9 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 7.9 | |
| SimpleRL-ZeroBase Model=Qwen2.5-Math-7B2025.07 | 6.8 | |
| Qwen2.5-Math-7B2025.07 | 4.9 |