Mathematics on AIME 2025 (Accuracy, Training Time)
76.7AccuracyDocument RAG (Google)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Document RAG (Google)Backbone=Qwen3-32B, Ret.=Fact., m=82026.04 | 76.7 | — | |
| Reasoning MemoryBackbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 76.7 | — | |
| pass@32k=322026.06 | 75.8 | — | |
| Reasoning MemoryBackbone=Qwen3-32B, Ret.=Proc., m=302026.04 | 75.4 | — | |
| Reasoning MemoryBackbone=OpenThinker3-7B, Ret.=Proc., m=302026.04 | 67.9 | — | |
| Reasoning MemoryBackbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 64.6 | — | |
| Qwen 3 VL 32B InstructParameters=32B2025.12 | 64.2 | — | |
| Length ScalingBackbone=Qwen3-32B, Ret.=N/A, m=302026.04 | 61.9 | — | |
| SCsamples=322026.06 | 60.8 | — | |
| Length ScalingBackbone=Qwen3-32B, Ret.=N/A, m=82026.04 | 59.1 | — | |
| No RAGBackbone=Qwen3-32B, Ret.=N/A, m=82026.04 | 58.6 | — | |
| Olmo 3.1 32B InstructStage=Final Instruct 3.12025.12 | 57.9 | — | |
| Qwen3-4B-SFT-RLVRParameters=4B, Training=SFT-RLVR2026.06 | 55 | — | |
| Length ScalingBackbone=OpenThinker3-7B, Ret.=N/A, m=302026.04 | 52.8 | — | |
| Length ScalingBackbone=OpenThinker3-7B, Ret.=N/A, m=82026.04 | 50.6 | — | |
| Template RAG (ReasonFlux)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 50 | — | |
| iS@1k=12026.06 | 49.9 | — | |
| Template RAG (Self-Discover)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 48.3 | — | |
| Qwen3-4BParameters=4B2026.06 | 47.5 | — | |
| pass@1k=12026.06 | 45.3 | — | |
| Trajectory RAG (Summary)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 42.9 | — | |
| Document RAG (Google)Backbone=OpenThinker3-7B, Ret.=Fact., m=82026.04 | 42.2 | — | |
| Zero-shotBase Model=Qwen3-4B-Instruct-25072026.04 | 41.71 | — | |
| Trajectory RAG (Prefix)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 40.8 | — | |
| Cog-DRIFTBase Model=Qwen3-4B-Instruct-25072026.04 | 40.28 | — | |
| Reasoning MemoryBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=302026.04 | 39.2 | — | |
| No RAGBackbone=OpenThinker3-7B, Ret.=N/A, m=82026.04 | 39.2 | — | |
| Template RAG (Self-Discover)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 39.2 | — | |
| NuRL (Prefix)Base Model=Qwen3-4B-Instruct-25072026.04 | 38.81 | — | |
| Document RAG (CompactDS)Backbone=Qwen3-32B, Ret.=Fact., m=82026.04 | 38.8 | — | |
| Few-shotBase Model=Qwen3-4B-Instruct-25072026.04 | 37.98 | — | |
| NuRL (Abstract)Base Model=Qwen3-4B-Instruct-25072026.04 | 36.44 | — | |
| Reasoning MemoryBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 36.4 | — | |
| Length ScalingBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=N/A, m=302026.04 | 35.8 | — | |
| Trajectory RAG (Prefix)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 35.8 | — | |
| Trajectory RAG (Summary)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 35.4 | — | |
| Template RAG (ReasonFlux)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 35.4 | — | |
| Document RAG (Google)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Fact., m=82026.04 | 35.1 | — | |
| No RAGBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=N/A, m=82026.04 | 35 | — | |
| RFTBase Model=Qwen3-4B-Instruct-25072026.04 | 34.88 | — | |
| Template RAG (ReasonFlux)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 34.2 | — | |
| Document RAG (CompactDS)Backbone=OpenThinker3-7B, Ret.=Fact., m=82026.04 | 33.3 | — | |
| Length ScalingBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=N/A, m=82026.04 | 32.5 | — | |
| Trajectory RAG (Summary)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 32.1 | — | |
| Document RAG (CompactDS)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Fact., m=82026.04 | 31.2 | — | |
| Template RAG (Self-Discover)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 29.6 | — | |
| Qwen3-1.7BParameters=1.7B2026.06 | 28.33 | — | |
| Qwen3-1.7B-SFT-RLVRParameters=1.7B, Training=SFT-RLVR2026.06 | 27.5 | — | |
| GRPOBase Model=Qwen3-4B-Instruct-25072026.04 | 27.29 | — | |
| Trajectory RAG (Prefix)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 24.6 | — | |
| Olmo 3.1 32B InstructStage=DPO2025.12 | 23.3 | — | |
| Gemma 3 27BParameters=27B2025.12 | 22.9 | — | |
| Qwen 3 32BThinking=No, Parameters=32B2025.12 | 21.3 | — | |
| Qwen 2.5 32BParameters=32B2025.12 | 13.4 | — | |
| Olmo 3.1 32B InstructStage=SFT2025.12 | 8.2 | — | |
| NuRL (Abstract)Base Model=Llama3.2-3B-Instruct2026.04 | 1.11 | — | |
| Gemma 2 27BParameters=27B2025.12 | 0.9 | — | |
| OLMo 2 32BParameters=32B2025.12 | 0.9 | — | |
| Latent-GRPOModel Scale=Qwen3-4B2026.01 | 0.667 | 3,108.44 | |
| BaseModel Scale=Qwen3-4B2026.01 | 0.656 | — | |
| GRPO (LLM-Judge)Model Scale=Qwen3-4B2026.01 | 0.633 | 6,753.47 | |
| Zero-shotBase Model=Llama3.2-3B-Instruct2026.04 | 0.42 | — | |
| GRPOBase Model=Llama3.2-3B-Instruct2026.04 | 0.42 | — | |
| NuRL (Prefix)Base Model=Llama3.2-3B-Instruct2026.04 | 0.42 | — | |
| Cog-DRIFTBase Model=Llama3.2-3B-Instruct2026.04 | 0.42 | — | |
| BaseModel Scale=Qwen3-1.7B2026.01 | 0.368 | — | |
| Latent-GRPOModel Scale=Qwen3-1.7B2026.01 | 0.354 | 2,340.05 | |
| GRPO (LLM-Judge)Model Scale=Qwen3-1.7B2026.01 | 0.338 | 4,988.84 | |
| Few-shotBase Model=Llama3.2-3B-Instruct2026.04 | 0.33 | — | |
| Latent-GRPOModel Scale=Qwen3-0.6B2026.01 | 0.192 | 2,280.52 | |
| BaseModel Scale=Qwen3-0.6B2026.01 | 0.151 | — | |
| GRPO (LLM-Judge)Model Scale=Qwen3-0.6B2026.01 | 0.117 | 4,082.96 | |
| Apertus 70BParameters=70B2025.12 | 0.1 | — | |
| RFTBase Model=Llama3.2-3B-Instruct2026.04 | 0 | — |