Mathematical Reasoning on Minerva (Accuracy Statistics)
26.76Mean AccuracyKTO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| KTOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 26.76 | 1.31 | 25.14 | |
| DPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 24.56 | 1.52 | 22.67 | |
| TDPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 22.28 | 1.24 | 20.75 | |
| RePOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 21.69 | 1.04 | 20.4 | |
| RePO_detModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 21.4 | 1.36 | 19.71 | |
| RePOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 20.51 | 0.71 | 19.64 | |
| RePO_detModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 20 | 0.81 | 19 | |
| RPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 19.34 | 1.72 | 17.21 | |
| IPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 17.5 | 1.72 | 15.37 | |
| KTOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 16.4 | 1.24 | 14.86 | |
| IPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 16.25 | 0.92 | 15.11 | |
| DPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 15.07 | 2.01 | 12.57 | |
| RPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 10.81 | 0.92 | 9.66 | |
| TDPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 9.93 | 1.3 | 8.31 |