Mathematical Reasoning on GSM8K, AQuA, and AIME
92.4GSM8K AccuracyFOVER-Qwen2.5-7B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| FOVER-Qwen2.5-7BBackbone=Qwen 2.5 7B, Evaluation Protocol=Best-of-K (K=7), Training=Fine-tuned on FOVER-40K2025.05 | 92.4 | 79.2 | 81.1 | 12 | 66.2 | |
| Qwen 2.5 7BBackbone=Qwen 2.5 7B, Evaluation Protocol=Best-of-K (K=7), Training=None (Baseline)2025.05 | 90 | 76.4 | 80.3 | 12.4 | 64.8 | |
| FOVER-Llama3.1-8BBackbone=Llama 3.1 8B, Evaluation Protocol=Best-of-K (K=7), Training=Fine-tuned on FOVER-40K2025.05 | 88.4 | 53.6 | 71.7 | 5.2 | 54.7 | |
| Llama 3.1 8BBackbone=Llama 3.1 8B, Evaluation Protocol=Best-of-K (K=7), Training=None (Baseline)2025.05 | 87.6 | 54.4 | 66.1 | 4 | 53 |