Mathematical Reasoning on AIME 2025 (Pass@32, Var)
47.03Pass@32EAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EAPOPolicy Backbone=Qwen3-8B2025.09 | 47.03 | 0.0578 | |
| Self-Exploratory RLPolicy Backbone=Qwen3-8B2025.09 | 43.52 | 0.0634 | |
| Expert-Assisted WorkflowPolicy Backbone=Qwen3-8B2025.09 | 28.16 | 0.2127 | |
| Base ModelPolicy Backbone=Qwen3-8B2025.09 | 22.62 | 0.0812 | |
| TOP-DStudent Model=Qwen3-1.7B-Base, Paradigm=Distillation, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 17.71 | — | |
| TOP-DStudent Model=Qwen3-1.7B-Base, Paradigm=Distillation, Teacher Model=Qwen3-14B2026.07 | 14.69 | — | |
| DAPOStudent Model=Qwen3-1.7B-Base, Paradigm=RLVR, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 11.56 | — | |
| DAPOStudent Model=Qwen3-1.7B-Base, Paradigm=RLVR, Teacher Model=Qwen3-14B2026.07 | 11.56 | — | |
| OPDStudent Model=Qwen3-1.7B-Base, Paradigm=Distillation, Teacher Model=Qwen3-14B2026.07 | 8.33 | — | |
| OPDStudent Model=Qwen3-1.7B-Base, Paradigm=Distillation, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 7.5 | — | |
| GRPOStudent Model=Qwen3-1.7B-Base, Paradigm=RLVR, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 7.19 | — | |
| GRPOStudent Model=Qwen3-1.7B-Base, Paradigm=RLVR, Teacher Model=Qwen3-14B2026.07 | 7.19 | — | |
| BaseStudent Model=Qwen3-1.7B-Base, Paradigm=Base, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 1.98 | — | |
| BaseStudent Model=Qwen3-1.7B-Base, Paradigm=Base, Teacher Model=Qwen3-14B2026.07 | 1.98 | — |