Mathematics on AIME 2024 (Pass@1)
0.798Pass@1DeepSeek-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-R1Architecture=MoE, Activated Params=37B, Total Params=671B2025.01 | 0.798 | |
| OpenAI-o1-12172025.01 | 0.792 | |
| MiMo-RL 7B-R-TAPModel Backbone=7B2026.03 | 0.758 | |
| R1-Distill-Qwen-14BModel Backbone=Qwen-14B2026.03 | 0.697 | |
| MiMo 7B-RLModel Backbone=7B2026.03 | 0.682 | |
| OpenAI-o1-mini2025.01 | 0.636 | |
| OpenAI o1-miniModel Backbone=o1-mini2026.03 | 0.636 | |
| GT-RewardBase Model=Qwen3-8B-Base2025.11 | 0.5666 | |
| R1-Distill-Qwen-7BModel Backbone=Qwen-7B2026.03 | 0.555 | |
| GT-RewardBase Model=Qwen3-4B-Base2025.11 | 0.5 | |
| QwQ-32B PreviewModel Backbone=QwQ-32B2026.03 | 0.5 | |
| DeepSeek-V3Architecture=MoE, Activated Params=37B, Total Params=671B2025.01 | 0.392 | |
| GT-RewardBase Model=Llama-3.2-3B-Instruct2025.11 | 0.3333 | |
| GT-RewardBase Model=Llama-3.1-8B-Instruct2025.11 | 0.3333 | |
| Majority-VotingBase Model=Qwen3-8B-Base2025.11 | 0.2416 | |
| Self-HarmonyBase Model=Qwen3-8B-Base2025.11 | 0.2333 | |
| GT-RewardBase Model=Qwen3-1.7B-Base2025.11 | 0.2083 | |
| Majority-VotingBase Model=Qwen3-4B-Base2025.11 | 0.2 | |
| Self-HarmonyBase Model=Qwen3-4B-Base2025.11 | 0.2 | |
| RentBase Model=Qwen3-8B-Base2025.11 | 0.1854 | |
| IntuitorBase Model=Qwen3-8B-Base2025.11 | 0.1708 | |
| Claude-3.5-Sonnet-10222025.01 | 0.16 | |
| Claude 3.5 Sonnet-1022Model Backbone=Claude 3.5 Sonnet2026.03 | 0.16 | |
| Co-RewardBase Model=Qwen3-8B-Base2025.11 | 0.1583 | |
| Majority-VotingBase Model=Llama-3.2-3B-Instruct2025.11 | 0.1333 | |
| Co-RewardBase Model=Llama-3.2-3B-Instruct2025.11 | 0.1333 | |
| Self-HarmonyBase Model=Llama-3.2-3B-Instruct2025.11 | 0.1333 | |
| Co-RewardBase Model=Qwen3-4B-Base2025.11 | 0.1271 | |
| RentBase Model=Qwen3-4B-Base2025.11 | 0.1208 | |
| IntuitorBase Model=Qwen3-4B-Base2025.11 | 0.1041 | |
| Self-HarmonyBase Model=Qwen3-1.7B-Base2025.11 | 0.1 | |
| Before RLBase Model=Qwen3-8B-Base2025.11 | 0.1 | |
| Self-HarmonyBase Model=Llama-3.1-8B-Instruct2025.11 | 0.1 | |
| Majority-VotingBase Model=Qwen3-1.7B-Base2025.11 | 0.0937 | |
| GPT-4o-05132025.01 | 0.093 | |
| GPT-4o 0513Model Backbone=GPT-4o2026.03 | 0.093 | |
| IntuitorBase Model=Llama-3.2-3B-Instruct2025.11 | 0.0916 | |
| RentBase Model=Llama-3.2-3B-Instruct2025.11 | 0.077 | |
| Co-RewardBase Model=Qwen3-1.7B-Base2025.11 | 0.0667 | |
| Before RLBase Model=Llama-3.2-3B-Instruct2025.11 | 0.0667 | |
| Before RLBase Model=Qwen3-4B-Base2025.11 | 0.0666 | |
| RentBase Model=Qwen3-1.7B-Base2025.11 | 0.0645 | |
| IntuitorBase Model=Llama-3.1-8B-Instruct2025.11 | 0.0645 | |
| Majority-VotingBase Model=Llama-3.1-8B-Instruct2025.11 | 0.0413 | |
| RentBase Model=Llama-3.1-8B-Instruct2025.11 | 0.0395 | |
| IntuitorBase Model=Qwen3-1.7B-Base2025.11 | 0.0375 | |
| Before RLBase Model=Qwen3-1.7B-Base2025.11 | 0.0333 | |
| Before RLBase Model=Llama-3.1-8B-Instruct2025.11 | 0.0333 | |
| Co-RewardBase Model=Llama-3.1-8B-Instruct2025.11 | 0.0333 |