Mathematical Reasoning on AMC23 (Pass@1 and Pass@8)
86.02Pass@1 ScoreGRPO w/ MAPR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO w/ MAPRBase Model=Qwen3-14B2025.09 | 86.02 | 95.12 | |
| GRPOBase Model=Qwen3-14B2025.09 | 81.56 | 96.2 | |
| GRPO w/ MAPRBase Model=Qwen3-8B2025.09 | 79.53 | 94.39 | |
| GRPOBase Model=Qwen3-8B2025.09 | 73.67 | 92.77 | |
| GRPO w/ MAPRBase Model=Qwen3-4B2025.09 | 70.16 | 93.18 | |
| oracle ZS vs MemBase Model=Qwen2.5-Math-7B, #Train Params=-2026.06 | 67.5 | — | |
| ELM offlineBase Model=Qwen2.5-Math-7B, #Train Params=0.07M2026.06 | 65 | — | |
| ELM kvBackbone=Qwen2.5-Math-7B, Setting=Online2026.06 | 62.5 | — | |
| GRPOBackbone=Qwen2.5-Math-7B, Setting=Offline2026.06 | 62.5 | — | |
| TTRLBackbone=Qwen2.5-Math-7B, Setting=Offline2026.06 | 62.5 | — | |
| Full GTBase Model=Qwen2.5-Math-7B, #Train Params=7B2026.06 | 62.5 | — | |
| Full MajBase Model=Qwen2.5-Math-7B, #Train Params=7B2026.06 | 62.5 | — | |
| ELM-LoRAofflineBase Model=Qwen2.5-Math-7B, #Train Params=40M2026.06 | 62.5 | — | |
| ELM-Full ModelofflineBase Model=Qwen2.5-Math-7B, #Train Params=7B2026.06 | 60 | — | |
| GRPOBase Model=Qwen3-4B2025.09 | 59.3 | 84.93 | |
| ELM inputBackbone=Qwen2.5-Math-7B, Setting=Online2026.06 | 56 | — | |
| PASS2026.06 | 53.8 | 83.7 | |
| Zero-shot CoTBackbone=Qwen2.5-Math-7B2026.06 | 50 | — | |
| Zero-shot CoTBase Model=Qwen2.5-Math-7B, #Train Params=-2026.06 | 50 | — | |
| GRPO(ORM)2026.06 | 47 | 83.5 | |
| LAGBackbone=Qwen2.5-Math-7B, Setting=Online2026.06 | 40 | — | |
| ICLBackbone=Qwen2.5-Math-7B, Setting=Online2026.06 | 38.3 | — | |
| Reasoning BankBackbone=Qwen2.5-Math-7B, Setting=Online2026.06 | 37.5 | — | |
| oracle ZS vs MemBase Model=Llama-3.1-8B-Instr., #Train Params=-2026.06 | 35 | — | |
| ELM offlineBase Model=Llama-3.1-8B-Instr., #Train Params=0.08M2026.06 | 32.5 | — | |
| ELM-LoRAofflineBase Model=Llama-3.1-8B-Instr., #Train Params=42M2026.06 | 30 | — | |
| GRPOBackbone=Llama-3.1-8B-Instr., Setting=Offline2026.06 | 27.5 | — | |
| TTRLBackbone=Llama-3.1-8B-Instr., Setting=Offline2026.06 | 27.5 | — | |
| GRPOBase Model=Llama-3.1-8B-Instr., #Train Params=8B2026.06 | 27.5 | — | |
| TTRLBase Model=Llama-3.1-8B-Instr., #Train Params=8B2026.06 | 27.5 | — | |
| ELM-Full ModelofflineBase Model=Llama-3.1-8B-Instr., #Train Params=8B2026.06 | 27.5 | — | |
| ELM inputBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | 26 | — | |
| Reasoning BankBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | 24.2 | — | |
| ELM kvBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | 23.3 | — | |
| Base Model (Qwen2.5-Math-7B)Backbone=Qwen2.5-Math-7B2026.06 | 22.8 | 70.4 | |
| ICLBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | 21.7 | — | |
| Zero-shot CoTBackbone=Llama-3.1-8B-Instr.2026.06 | 20 | — | |
| Zero-shot CoTBase Model=Llama-3.1-8B-Instr., #Train Params=-2026.06 | 20 | — | |
| LAGBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | 19.2 | — | |
| AsymPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | — | 67.5 | |
| GRPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | — | 65 | |
| SPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | — | 67.5 |