Helpfulness on GSM8k
89.7AccuracyDR-IRL
Evaluation Results
| Method | Links | |
|---|---|---|
| DR-IRLBackbone=Qwen-2-7B-Instruct2025.03 | 89.7 | |
| Self-RewardingBackbone=Llama-3.1-8B-Instruct2025.03 | 88.1 | |
| DR-IRLBackbone=Llama-3.1-8B-Instruct2025.03 | 88.1 | |
| CoTBackbone=Qwen-2-7B-Instruct2025.03 | 88.1 | |
| STAIRBackbone=Llama-3.1-8B-Instruct2025.03 | 87.64 | |
| BaseBackbone=Qwen-2-7B-Instruct2025.03 | 87.49 | |
| Self-RewardingBackbone=Qwen-2-7B-Instruct2025.03 | 87.34 | |
| IRLBackbone=Llama-3.1-8B-Instruct2025.03 | 87.13 | |
| IRLBackbone=Qwen-2-7B-Instruct2025.03 | 87.13 | |
| CoTBackbone=Llama-3.1-8B-Instruct2025.03 | 87.11 | |
| SACPOBackbone=Llama-3.1-8B-Instruct2025.03 | 86.5 | |
| STAIRBackbone=Qwen-2-7B-Instruct2025.03 | 85.75 | |
| BaseBackbone=Llama-3.1-8B-Instruct2025.03 | 85.6 | |
| SACPOBackbone=Qwen-2-7B-Instruct2025.03 | 85.22 | |
| DPOBackbone=Llama-3.1-8B-Instruct2025.03 | 84.15 | |
| GRPOBackbone=Qwen-2-7B-Instruct2025.03 | 82.87 | |
| GRPOBackbone=Llama-3.1-8B-Instruct2025.03 | 82.37 | |
| SFTBackbone=Qwen-2-7B-Instruct2025.03 | 82.34 | |
| DPOBackbone=Qwen-2-7B-Instruct2025.03 | 81.43 | |
| SFTBackbone=Llama-3.1-8B-Instruct2025.03 | 72.02 |