General Language Model Evaluation on Average of 10 tasks
45.02Overall PerformanceT-SPIN
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| T-SPINIteration=Iter42026.01 | 45.02 | 0.12 | |
| T-SPINIteration=Iter32026.01 | 44.9 | 1.34 | |
| SFTMethod=Supervised Fine-Tuning2026.01 | 44.17 | — | |
| T-SPINIteration=Iter22026.01 | 43.56 | 0.24 | |
| T-SPINIteration=Iter12026.01 | 43.32 | 0.61 | |
| T-SPINIteration=Iter02026.01 | 42.71 | — | |
| SPINIteration=Iter02026.01 | 42.6 | — | |
| SPINIteration=Iter12026.01 | 42.52 | -0.08 | |
| Mistral-7BConfiguration=Base2026.01 | 42.51 | — | |
| SPINIteration=Iter42026.01 | 42.32 | 1.02 | |
| SPINIteration=Iter22026.01 | 42.3 | -0.22 | |
| SPINIteration=Iter32026.01 | 41.3 | -1 |