LLM as a Judge on Chatbot Arena (test)
68.13AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProPrompting=Default2025.06 | 68.13 | |
| Gemini-2.5-FlashPrompting=Default2025.06 | 67.25 | |
| SynthesizeMeBackbone=Gemini-2.5-Flash2025.06 | 66.73 | |
| SynthesizeMeBackbone=Gemini-2.5-Pro2025.06 | 66.37 | |
| SynthesizeMeBackbone=Qwen2-32B2025.06 | 64.68 | |
| SynthesizeMeBackbone=Gemini-2.0-Flash2025.06 | 64.61 | |
| SynthesizeMeBackbone=Qwen2-30B-A3B2025.06 | 63.91 | |
| Gemini-2.0-FlashPrompting=Default2025.06 | 63.2 | |
| Qwen2-32BPrompting=Default2025.06 | 62.22 | |
| SynthesizeMeBackbone=Qwen2-8B2025.06 | 61.83 | |
| SynthesizeMeBackbone=GPT4o-mini2025.06 | 61.8 | |
| Qwen2-8BPrompting=Default2025.06 | 61.41 | |
| Qwen2-30B-A3BPrompting=Default2025.06 | 60.74 | |
| GPT4o-miniPrompting=Default2025.06 | 59.86 |