Open-ended query evaluation on Arena-Hard-Auto v0.1
31.5Win RateS-SPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| S-SPPOBackbone=Llama-3-8B, Iteration=32026.06 | 31.5 | |
| SPPOBackbone=Llama-3-8B, Iteration=12026.06 | 31 | |
| S-SPPOBackbone=Llama-3-8B, Iteration=22026.06 | 30.6 | |
| SPPOBackbone=Llama-3-8B, Iteration=22026.06 | 30.1 | |
| S-SPPOBackbone=Llama-3-8B, Iteration=12026.06 | 30 | |
| SPPOBackbone=Llama-3-8B, Iteration=32026.06 | 29.8 | |
| S-SPPOBackbone=Mistral-7B, Iteration=32026.06 | 23.9 | |
| SPPOBackbone=Mistral-7B, Iteration=32026.06 | 23.3 | |
| S-SPPOBackbone=Mistral-7B, Iteration=22026.06 | 21.8 | |
| S-SPPOBackbone=Mistral-7B, Iteration=12026.06 | 21.5 | |
| SnorkelBackbone=Mistral-7B, Training Method=PairRM-DPO2026.06 | 20.7 | |
| SPPOBackbone=Mistral-7B, Iteration=22026.06 | 20.4 | |
| SPPOBackbone=Mistral-7B, Iteration=12026.06 | 18.7 | |
| Mistral-7B-InstructBackbone=Mistral-7B2026.06 | 12.6 |