Pairwise Comparison Evaluation on Chatbot Arena
60.2AccuracyCollabEval
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CollabEvalModel Setting=multi-agents2026.03 | 60.2 | 1.542 | 50 | 2.63 | |
| Llama3 70bModel Setting=Single-LLM2026.03 | 59.7 | 1 | 53.85 | 0 | |
| Mistral LargeModel Setting=Single-LLM2026.03 | 58.2 | 1 | 45.54 | 4.22 | |
| Round-Table Agents EvalModel Setting=multi-agents2026.03 | 57.7 | 1.214 | 15.84 | 43.97 | |
| HaikuModel Setting=Single-LLM2026.03 | 57.2 | 1 | 46.3 | 3.38 |