Math Reasoning on Olympiad Bench (Accuracy %)
55.4AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 55.4 | — | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 54.8 | — | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 53.6 | — | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 53.2 | — | |
| ED-iDPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 52.8 | 12.4 | |
| ED-GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 52.5 | 12.1 | |
| GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 52.4 | 12 | |
| CoTBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 52.1 | 11.7 | |
| DAPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 51.6 | 11.2 | |
| ETOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=true2026.05 | 51 | 10.6 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 44.5 | — | |
| ED-GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 43.9 | 3.5 | |
| GRPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 42.9 | 2.5 | |
| ETOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 42.7 | 2.3 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 42.6 | — | |
| ED-iDPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 42.6 | 2.2 | |
| DAPOBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 41.8 | 1.4 | |
| CoTBase Model=Qwen2.5-7B-Instruct-SFT, Self-Consistency=false2026.05 | 40.4 | — | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 39 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 38.2 | — | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 37.8 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 37.6 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 37.3 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 34.5 | — | |
| ED-iDPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 30.1 | 11.4 | |
| ED-GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 29.5 | 10.8 | |
| CoTBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 28.2 | 9.5 | |
| GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 27.9 | 9.2 | |
| ETOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 27.7 | 9 | |
| DAPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=true2026.05 | 26.1 | 7.4 | |
| ED-GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 20.6 | 1.9 | |
| ED-iDPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 19.6 | 0.9 | |
| ETOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 19.1 | 0.4 | |
| GRPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 19.1 | 0.4 | |
| CoTBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 18.7 | — | |
| DAPOBase Model=LLaMA3.1-8B-Instruct-SFT, Self-Consistency=false2026.05 | 18.4 | -0.3 |