Multi-turn ambiguous query clarification on ClarifyMT-Bench Average 1.0 (full dataset)
77.1AccuracyLlama-3.1-70B-It
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-3.1-70B-Itparameters=70B, alignment=Instruction-Tuned2025.12 | 77.1 | |
| Claude-Sonnet-4.5variant=Sonnet2025.12 | 74.8 | |
| Qwen-2.5-72B-Itparameters=72B, alignment=Instruction-Tuned2025.12 | 74.7 | |
| Gemini-2.5-Flashvariant=Flash2025.12 | 72.4 | |
| GPT-4.12025.12 | 72.1 | |
| DeepSeek-V32025.12 | 72.1 | |
| Llama-3.1-8B-Itparameters=8B, alignment=Instruction-Tuned2025.12 | 71.2 | |
| DeepSeek-R12025.12 | 68.6 | |
| o32025.12 | 64.2 | |
| Qwen-2.5-7B-Itparameters=7B, alignment=Instruction-Tuned2025.12 | 57.9 |