Mathematical Reasoning on AIME 2024 (val)
43.3Pass@1 Success RateTrajFusion
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TrajFusionBackbone=Qwen2.5-Math-7B-base, Context Length=32K2026.02 | 43.3 | 40.8 | |
| RFTBackbone=Qwen2.5-Math-7B-base, Context Length=32K2026.02 | 40 | 36.7 | |
| λ-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=0.042025.09 | 40 | — | |
| λ-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=02025.09 | 36.67 | — | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=02025.09 | 33.33 | — | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=0.042025.09 | 30 | — | |
| GenACAlgorithm=GenAC, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 30 | — | |
| GRPOAlgorithm=GRPO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 26.46 | — | |
| VC-PPOAlgorithm=VC-PPO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 25.83 | — | |
| RLOOAlgorithm=RLOO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 24.79 | — | |
| TrajFusionBackbone=Qwen2.5-Math-7B-base, Context Length=4K2026.02 | 23.3 | 15.6 | |
| BaseModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=N/A2025.09 | 20 | — | |
| RFTBackbone=Qwen2.5-Math-7B-base, Context Length=4K2026.02 | 16.7 | 15.6 | |
| λ-GRPOModel=Llama-3.2-1B-Instruct, beta=0.042025.09 | 3.33 | — | |
| BaseModel=Llama-3.2-1B-Instruct, beta=N/A2025.09 | 0 | — | |
| GRPOModel=Llama-3.2-1B-Instruct, beta=02025.09 | 0 | — | |
| λ-GRPOModel=Llama-3.2-1B-Instruct, beta=02025.09 | 0 | — | |
| GRPOModel=Llama-3.2-1B-Instruct, beta=0.042025.09 | 0 | — |