Math Reasoning on Minerva Math (Acc. (%) and ∆ (%))
48.5Accuracy (%)CGD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CGDTeacher Model=S1.1-32B2025.05 | 48.5 | — | |
| ED-GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 48.2 | 11.8 | |
| DAPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 45.2 | 8.8 | |
| CFTTeacher Model=GPT-4o2025.05 | 45.2 | — | |
| ED-iDPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 44.5 | 8.1 | |
| GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 44.1 | 7.7 | |
| CGDTeacher Model=Claude Sonnet 3.72025.05 | 44.1 | — | |
| ETOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 42.3 | 5.9 | |
| CoTBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 41.9 | 5.5 | |
| ED-GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 41.2 | 4.8 | |
| GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 39.7 | 3.3 | |
| ED-iDPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 38.6 | 2.2 | |
| DAPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 38.2 | 1.8 | |
| ETOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 37.9 | 1.5 | |
| CoTBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 36.4 | — | |
| EGLR-OracleLModel=Qwen2.5-14B-Instruct2026.06 | 35.3 | — | |
| EGLR-OracleLModel=Qwen2.5-7B-Instruct2026.06 | 32.4 | — | |
| EGLR-OracleLModel=Qwen2.5-Math-7B-Instruct2026.06 | 32 | — | |
| VRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=VRPO2025.08 | 31.99 | — | |
| EGLR-OracleLModel=Qwen2.5-3B-Instruct2026.06 | 30.9 | — | |
| PPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=PPO2025.08 | 30.51 | — | |
| EGLR (best L)Model=Qwen2.5-14B-Instruct2026.06 | 29 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-14B-Instruct2026.06 | 28.7 | — | |
| BaseModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Base2025.08 | 28.68 | — | |
| GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=GRPO2025.08 | 28.68 | — | |
| EGLR-OracleLModel=Qwen2.5-Math-1.5B-Instruct2026.06 | 28.3 | — | |
| Dr.GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Dr.GRPO2025.08 | 27.94 | — | |
| CFTTeacher Model=S1.1-32B2025.05 | 27.9 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-Math-7B-Instruct2026.06 | 27.9 | — | |
| EGLR-OracleLModel=Llama-3.1-8B-Instruct2026.06 | 27.9 | — | |
| GreedyModel=Qwen2.5-Math-7B-Instruct2026.06 | 27.6 | — | |
| Reinforce++Model Backbone=Qwen3-8B(Strong Model), Optimization Method=Reinforce++2025.08 | 27.21 | — | |
| GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 27.2 | 8.8 | |
| GreedyModel=Qwen2.5-14B-Instruct2026.06 | 27.2 | — | |
| ED-iDPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 26.8 | 8.4 | |
| EGLR (best L)Model=Qwen2.5-Math-7B-Instruct2026.06 | 26.8 | — | |
| ED-GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 26.5 | 8.1 | |
| DAPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 25.4 | 7 | |
| ETOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 24.3 | 5.9 | |
| EGLR (best L)Model=Qwen2.5-7B-Instruct2026.06 | 23.9 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-7B-Instruct2026.06 | 23.5 | — | |
| ED-iDPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 23.2 | 4.8 | |
| ED-GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 23.2 | 4.8 | |
| CoTBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 22.8 | 4.4 | |
| GreedyModel=Qwen2.5-7B-Instruct2026.06 | 22.1 | — | |
| GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 21.7 | 3.3 | |
| DAPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 21.7 | 3.3 | |
| VRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=VRPO2025.08 | 19.85 | — | |
| GreedyModel=Qwen2.5-Math-1.5B-Instruct2026.06 | 19.5 | — | |
| PPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=PPO2025.08 | 19.12 | — | |
| ETOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 19.1 | 0.7 | |
| EGLR-SCL (B = 10)Model=Qwen2.5-3B-Instruct2026.06 | 19.1 | — | |
| EGLR (best L)Model=Qwen2.5-Math-1.5B-Instruct2026.06 | 19.1 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-Math-1.5B-Instruct2026.06 | 19.1 | — | |
| BaseModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Base2025.08 | 18.75 | — | |
| Dr.GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Dr.GRPO2025.08 | 18.75 | — | |
| CoTBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 18.4 | — | |
| EGLR (best L)Model=Qwen2.5-3B-Instruct2026.06 | 18.4 | — | |
| EGLR-SCL (B = 10)Model=Llama-3.1-8B-Instruct2026.06 | 18 | — | |
| EGLR-OracleLModel=Mistral-7B-Instruct-v0.32026.06 | 17.6 | — | |
| EGLR (best L)Model=Llama-3.1-8B-Instruct2026.06 | 16.9 | — | |
| GreedyModel=Qwen2.5-3B-Instruct2026.06 | 15.4 | — | |
| Qwen2.5-Math-7B (Base)2025.05 | 13.6 | — | |
| GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=GRPO2025.08 | 13.6 | — | |
| GreedyModel=Llama-3.1-8B-Instruct2026.06 | 12.9 | — | |
| EGLR-OracleLModel=Qwen2.5-0.5B-Instruct2026.06 | 12.1 | — | |
| Reinforce++Model Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Reinforce++2025.08 | 10.66 | — | |
| EGLR-SCL (B = 10)Model=Mistral-7B-Instruct-v0.32026.06 | 9.2 | — | |
| EGLR (best L)Model=Mistral-7B-Instruct-v0.32026.06 | 8.1 | — | |
| GreedyModel=Mistral-7B-Instruct-v0.32026.06 | 6.6 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-0.5B-Instruct2026.06 | 5.5 | — | |
| EGLR (best L)Model=Qwen2.5-0.5B-Instruct2026.06 | 4.8 | — | |
| GreedyModel=Qwen2.5-0.5B-Instruct2026.06 | 2.6 | — |