Multi-turn response addition on MT-Add
90.3Math Score (MT-Add)RLSTA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RLSTABackbone=Qwen3-4B-Instruct-25072026.03 | 90.3 | 55.2 | |
| RLSTABackbone=Qwen2.5-7B-Instruct2026.03 | 85.7 | 35 | |
| GRPOBackbone=Qwen3-4B-Instruct-25072026.03 | 83.9 | 47.2 | |
| SFTBackbone=Qwen3-4B-Instruct-25072026.03 | 82.6 | 44.4 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.03 | 80.3 | 33.6 | |
| DPOBackbone=Qwen3-4B-Instruct-25072026.03 | 78.4 | 41.6 | |
| BaseBackbone=Qwen3-4B-Instruct-25072026.03 | 77.2 | 37 | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.03 | 74 | 31 | |
| RLSTABackbone=Qwen2.5-3B-Instruct2026.03 | 71.5 | 25.6 | |
| RLSTABackbone=Llama-3.2-3B-Instruct2026.03 | 64.9 | 20.5 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.03 | 63.8 | 31.2 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.03 | 63.6 | 19 | |
| DPOBackbone=Qwen2.5-7B-Instruct2026.03 | 63.3 | 31.2 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.03 | 60.8 | 19 | |
| SFTBackbone=Llama-3.2-3B-Instruct2026.03 | 56.8 | 17.7 | |
| DPOBackbone=Llama-3.2-3B-Instruct2026.03 | 55.9 | 19.8 | |
| SFTBackbone=Qwen2.5-3B-Instruct2026.03 | 54.6 | 20.3 | |
| DPOBackbone=Qwen2.5-3B-Instruct2026.03 | 54.6 | 20.3 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.03 | 49.3 | 22 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.03 | 47 | 14 |