Mathematical Reasoning on MathQA (Decoding Efficiency)
2,555Average Acceptance Length τGRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPOModel=Qwen3-14b2026.03 | 2,555 | — | 86.15 | |
| DDPOModel=Qwen3-14b, theta=0.22026.03 | 2,313 | — | 86.46 | |
| EDA (Ours)Temperature=0, Target Model=Qwen2.5-Math-7B2026.03 | 5.16 | 3.43 | — | |
| EDA (Base)Temperature=0, Target Model=Qwen2.5-Math-7B2026.03 | 4.7 | 3.16 | — | |
| Full-FTTemperature=0, Target Model=Qwen2.5-Math-7B2026.03 | 4.66 | 3.19 | — | |
| LoRATemperature=0, Target Model=Qwen2.5-Math-7B2026.03 | 4.55 | 3 | — | |
| EDA (Ours)Temperature=1, Target Model=Qwen2.5-Math-7B2026.03 | 3.52 | 2.12 | — | |
| EDA (Base)Temperature=1, Target Model=Qwen2.5-Math-7B2026.03 | 3.02 | 1.91 | — | |
| Full-FTTemperature=1, Target Model=Qwen2.5-Math-7B2026.03 | 3.01 | 1.9 | — | |
| LoRATemperature=1, Target Model=Qwen2.5-Math-7B2026.03 | 2.93 | 1.86 | — | |
| Training-FreeTemperature=0, Target Model=Qwen2.5-Math-7B2026.03 | 1.23 | 0.91 | — | |
| Training-FreeTemperature=1, Target Model=Qwen2.5-Math-7B2026.03 | 1.04 | 0.66 | — |