Multi-turn ambiguous query clarification on ClarifyMT-Bench Factually-Wrong persona 1.0
93.7AccuracyClaude-Sonnet-4.5
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-Sonnet-4.5variant=Sonnet2025.12 | 93.7 | |
| Llama-3.1-70B-Itparameters=70B, alignment=Instruction-Tuned2025.12 | 88.7 | |
| Llama-3.1-8B-Itparameters=8B, alignment=Instruction-Tuned2025.12 | 84.8 | |
| Gemini-2.5-Flashvariant=Flash2025.12 | 83.7 | |
| DeepSeek-V32025.12 | 78.6 | |
| Qwen-2.5-72B-Itparameters=72B, alignment=Instruction-Tuned2025.12 | 75.4 | |
| GPT-4.12025.12 | 69.9 | |
| DeepSeek-R12025.12 | 64.4 | |
| o32025.12 | 54.7 | |
| Qwen-2.5-7B-Itparameters=7B, alignment=Instruction-Tuned2025.12 | 38.8 |