Mathematical Reasoning on GSM8K (Pass@1 & TC)
91.74Pass@1 AccuracyKTO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| KTOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 91.74 | — | 0.27 | 91.4 | |
| RePO_detModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 89.49 | — | 0.57 | 88.78 | |
| RePOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 89.37 | — | 0.18 | 89.15 | |
| TDPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 88.08 | — | 0.66 | 87.26 | |
| DPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 87.66 | — | 0.91 | 86.53 | |
| EAPOBackbone=Llama3.1-8B-Instruct2026.06 | 86.8 | 0.96 | — | — | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 86.2 | 1.11 | — | — | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 80.6 | 1.48 | — | — | |
| BaseBackbone=Llama3.1-8B-Instruct2026.06 | 79.6 | — | — | — | |
| KTOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 79.42 | — | 0.92 | 78.28 | |
| RPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 79.39 | — | 0.66 | 78.58 | |
| RePOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 79.33 | — | 0.88 | 78.25 | |
| RePO_detModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 79.15 | — | 0.32 | 78.75 | |
| IPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 78.17 | — | 0.81 | 77.16 | |
| IPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 77.83 | — | 1.17 | 76.38 | |
| DPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 76.09 | — | 0.88 | 74.99 | |
| TIRBackbone=Llama3.1-8B-Instruct2026.06 | 70.79 | 1.22 | — | — | |
| RPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 63.23 | — | 0.97 | 62.02 | |
| TDPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 59.03 | — | 0.77 | 58.07 |