Math Reasoning on AIME 2024 (Accuracy)
95AccuracyGPT-5 high
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5 highInput Modality=Text, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 95 | |
| Gemini 2.5 ProInput Modality=Text, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 93.3 | |
| Claude Sonnet 4.5Input Modality=Text, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 75 | |
| Uni-OPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 63.3 | |
| ExOPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 62.7 | |
| Uni-OPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 62.3 | |
| ExOPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 61 | |
| OPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 60.9 | |
| TeacherTraining Strategy=RL2026.05 | 60.1 | |
| ExPODistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 58.7 | |
| SFTDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 58.5 | |
| OPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 57.9 | |
| ExPODistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 57.5 | |
| Sora-2 AudioInput Modality=Audio, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 46.7 | |
| Sora-2 Last FrameInput Modality=Last Frame, LLM-as-a-Judge=GPT-4o, Evaluation Protocol=Avg@42025.11 | 38.3 | |
| Oat-ZeroBase Model=Qwen2.5-Math-7B2025.07 | 33.4 | |
| Prefix-RFTBase Model=Qwen2.5-Math-7B2025.07 | 31.8 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 30.7 | |
| LUFFYBase Model=Qwen2.5-Math-7B2025.07 | 29.4 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 29.2 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 28.3 | |
| ReLIFTBase Model=Qwen2.5-Math-7B2025.07 | 28.2 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 27.9 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 27.8 | |
| SimpleRL-ZeroBase Model=Qwen2.5-Math-7B2025.07 | 27 | |
| SFT+RFTBase Model=Qwen2.5-Math-7B2025.07 | 25.8 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 25.4 | |
| RFTBase Model=Qwen2.5-Math-7B2025.07 | 25.1 | |
| StudentModel Scale=4B2026.05 | 23 | |
| SFTBase Model=Qwen2.5-Math-7B2025.07 | 22.2 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 21.3 | |
| UFTBase Model=Qwen2.5-Math-7B2025.07 | 20.8 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 20.7 | |
| RL w/ SFT LossBase Model=Qwen2.5-Math-7B2025.07 | 19.5 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 16.5 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 16.2 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 12.4 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 11.6 | |
| Qwen2.5-Math-7B2025.07 | 11.5 |