Preference Modeling on Math Reasoning
87.6AccuracyBTPO
Evaluation Results
| Method | Links | |
|---|---|---|
| BTPOBase Model=Qwen2.5-7B-Instruct2025.10 | 87.6 | |
| BTPOBase Model=Qwen2.5-3B-Instruct2025.10 | 85.4 | |
| BTBase Model=Qwen2.5-7B-Instruct2025.10 | 84.5 | |
| BTPOBase Model=Llama3.1-8B-Instruct2025.10 | 84.2 | |
| BTPOBase Model=Llama3.2-3B-Instruct2025.10 | 81.6 | |
| GRAMBase Model=Qwen2.5-7B-Instruct2025.10 | 81 | |
| BTBase Model=Llama3.1-8B-Instruct2025.10 | 80.4 | |
| BTBase Model=Llama3.2-3B-Instruct2025.10 | 77.2 | |
| BTBase Model=Qwen2.5-3B-Instruct2025.10 | 76.3 | |
| GRAMBase Model=Qwen2.5-3B-Instruct2025.10 | 74.9 | |
| GRAMBase Model=Llama3.2-3B-Instruct2025.10 | 72.8 | |
| GRAMBase Model=Llama3.1-8B-Instruct2025.10 | 71.9 | |
| GRPO (point)Base Model=Llama3.1-8B-Instruct2025.10 | 58.4 | |
| GRPO (pair)Base Model=Qwen2.5-7B-Instruct2025.10 | 53.7 | |
| GRPO (point)Base Model=Qwen2.5-7B-Instruct2025.10 | 52.4 | |
| GRPO (pair)Base Model=Llama3.1-8B-Instruct2025.10 | 50.2 | |
| GRPO (pair)Base Model=Qwen2.5-3B-Instruct2025.10 | 50 | |
| GRPO (point)Base Model=Qwen2.5-3B-Instruct2025.10 | 50 | |
| GRPO (pair)Base Model=Llama3.2-3B-Instruct2025.10 | 50 | |
| GRPO (point)Base Model=Llama3.2-3B-Instruct2025.10 | 50 |