LLM Chat Evaluation on Arena-Hard v0.1 (test)
40.1Win RateOurs
Evaluation Results
| Method | Links | |
|---|---|---|
| OursBase Model=Llama-3.1-Tulu-3-8B, Data Selection=30% easiest prompts2025.10 | 40.1 | |
| Full DatasetBase Model=Llama-3.1-Tulu-3-8B, Data Selection=Full Dataset2025.10 | 38.8 | |
| RandomBase Model=Llama-3.1-Tulu-3-8B, Data Selection=30% random prompts2025.10 | 34.1 | |
| OursBase Model=Mistral-7B-Instruct-v0.2, Data Selection=30% easiest prompts2025.10 | 23.1 | |
| Full DatasetBase Model=Mistral-7B-Instruct-v0.2, Data Selection=Full Dataset2025.10 | 21.2 | |
| RandomBase Model=Mistral-7B-Instruct-v0.2, Data Selection=30% random prompts2025.10 | 20.2 |