Conversational AI Evaluation on Chatbot Arena
1RankGPT-4
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-4Evaluation Protocol=Weighted (Judge-aware)2026.01 | 1 | — | 72.8 | 51.5 | 94.1 | — | — | — | — | — | |
| Claude-v1Evaluation Protocol=Unweighted (Baseline)2026.01 | 1 | — | 110.6 | 97.8 | 123.4 | — | — | — | — | — | |
| Claude-v1Evaluation Protocol=Weighted (Judge-aware)2026.01 | 2 | — | 72.5 | 51.3 | 93.8 | — | — | — | — | — | |
| Claude-Instant-v1Evaluation Protocol=Unweighted (Baseline)2026.01 | 2 | — | 108.8 | 93.6 | 123.9 | — | — | — | — | — | |
| GPT-4Evaluation Protocol=Unweighted (Baseline)2026.01 | 3 | — | 94.2 | 82 | 106.4 | — | — | — | — | — | |
| Claude-Instant-v1Evaluation Protocol=Weighted (Judge-aware)2026.01 | 3 | — | 70.1 | 48.8 | 91.5 | — | — | — | — | — | |
| GPT-3.5-TurboEvaluation Protocol=Weighted (Judge-aware)2026.01 | 4 | — | 43.1 | 29.6 | 56.6 | — | — | — | — | — | |
| GPT-3.5-TurboEvaluation Protocol=Unweighted (Baseline)2026.01 | 4 | — | 61.6 | 50.7 | 72.4 | — | — | — | — | — | |
| Guanaco-33BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 5 | — | 21.3 | 6.6 | 36 | — | — | — | — | — | |
| Guanaco-33BEvaluation Protocol=Unweighted (Baseline)2026.01 | 5 | — | 24.6 | 3 | 46.2 | — | — | — | — | — | |
| WizardLM-13BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 6 | — | 16.5 | 3 | 30 | — | — | — | — | — | |
| Vicuna-13BEvaluation Protocol=Unweighted (Baseline)2026.01 | 6 | — | 7.8 | -1.7 | 17.3 | — | — | — | — | — | |
| Vicuna-13BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 7 | — | 15.9 | 8.6 | 23.1 | — | — | — | — | — | |
| PaLM 2Evaluation Protocol=Unweighted (Baseline)2026.01 | 7 | — | 2 | -10.7 | 14.6 | — | — | — | — | — | |
| WizardLM-13BEvaluation Protocol=Unweighted (Baseline)2026.01 | 8 | — | -1 | -21.6 | 19.6 | — | — | — | — | — | |
| PaLM 2Evaluation Protocol=Weighted (Judge-aware)2026.01 | 8 | — | 13.1 | 4.7 | 21.6 | — | — | — | — | — | |
| Vicuna-7BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 9 | — | 7.2 | -1 | 15.4 | — | — | — | — | — | |
| Koala-13BEvaluation Protocol=Unweighted (Baseline)2026.01 | 9 | — | -2.9 | -12.6 | 6.8 | — | — | — | — | — | |
| Vicuna-7BEvaluation Protocol=Unweighted (Baseline)2026.01 | 10 | — | -4.5 | -17.9 | 8.8 | — | — | — | — | — | |
| Koala-13BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 10 | — | -3.8 | -9.8 | 2.3 | — | — | — | — | — | |
| GPT4All-13B-SnoozyEvaluation Protocol=Weighted (Judge-aware)2026.01 | 11 | — | -7.8 | -19.9 | 4.3 | — | — | — | — | — | |
| RWKV-4-Raven-14BEvaluation Protocol=Unweighted (Baseline)2026.01 | 11 | — | -11.3 | -23.2 | 0.6 | — | — | — | — | — | |
| GPT4All-13B-SnoozyEvaluation Protocol=Unweighted (Baseline)2026.01 | 12 | — | -12.7 | -33.4 | 8.1 | — | — | — | — | — | |
| MPT-7B-ChatEvaluation Protocol=Weighted (Judge-aware)2026.01 | 12 | — | -13 | -21.8 | -4.2 | — | — | — | — | — | |
| Alpaca-13BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 13 | — | -23 | -31.9 | -14 | — | — | — | — | — | |
| Alpaca-13BEvaluation Protocol=Unweighted (Baseline)2026.01 | 13 | — | -16.5 | -27.2 | -5.8 | — | — | — | — | — | |
| RWKV-4-Raven-14BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 14 | — | -24.6 | -34.4 | -14.9 | — | — | — | — | — | |
| ChatGLM-6BEvaluation Protocol=Unweighted (Baseline)2026.01 | 14 | — | -24.2 | -36.4 | -11.9 | — | — | — | — | — | |
| MPT-7B-ChatEvaluation Protocol=Unweighted (Baseline)2026.01 | 15 | — | -29.4 | -43.1 | -15.7 | — | — | — | — | — | |
| OASST-Pythia-12BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 15 | — | -25.9 | -35.3 | -16.5 | — | — | — | — | — | |
| ChatGLM-6BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 16 | — | -33.5 | -45.4 | -21.6 | — | — | — | — | — | |
| FastChat-T5-3BEvaluation Protocol=Unweighted (Baseline)2026.01 | 16 | — | -42.1 | -54.8 | -29.5 | — | — | — | — | — | |
| OASST-Pythia-12BEvaluation Protocol=Unweighted (Baseline)2026.01 | 17 | — | -42.9 | -53.2 | -32.5 | — | — | — | — | — | |
| FastChat-T5-3BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 17 | — | -42.5 | -56.5 | -28.5 | — | — | — | — | — | |
| Dolly-v2-12BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 18 | — | -48.6 | -64.4 | -32.8 | — | — | — | — | — | |
| Dolly-v2-12BEvaluation Protocol=Unweighted (Baseline)2026.01 | 18 | — | -58.1 | -72.1 | -44 | — | — | — | — | — | |
| StableLM-Tuned-Alpha-7BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 19 | — | -51.6 | -68.1 | -35 | — | — | — | — | — | |
| LLaMA-13BEvaluation Protocol=Unweighted (Baseline)2026.01 | 19 | — | -81.6 | -98.2 | -65 | — | — | — | — | — | |
| StableLM-Tuned-Alpha-7BEvaluation Protocol=Unweighted (Baseline)2026.01 | 20 | — | -82.2 | -96.9 | -67.6 | — | — | — | — | — | |
| LLaMA-13BEvaluation Protocol=Weighted (Judge-aware)2026.01 | 20 | — | -58.4 | -77.4 | -39.5 | — | — | — | — | — | |
| AlpacaSize=13B2023.10 | — | 914 | — | — | — | — | — | — | — | — | |
| chatgpt-4o-latest-20250326Rank=22026.04 | — | 1,678.951 | — | — | — | 49.4 | 64.3 | 64.4 | 0.516 | — | |
| chatgpt-4o-latest-20250326Rank=7, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 24.6 | |
| chatgpt-4o-latest-20250326Rank=7, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 42.9 | |
| claude-opus-4-20250514-thinking-16kRank=3, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 26.9 | |
| claude-sonnet-4-20250514Rank=5, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 57.1 | |
| deepseek-r1-0528Rank=1, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 29.5 | |
| deepseek-r1-0528Rank=6, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 20.9 | |
| deepseek-r1-0528Rank=9, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 49 | |
| deepseek-v3-0324Rank=10, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 73.5 | |
| deepseek-v3-0324Rank=10, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 51.9 | |
| gemini-2.0-flash-thinking-exp-01-21Rank=82026.04 | — | 1,505.213 | — | — | — | 44.5 | 45.8 | 56.1 | 0.091 | — | |
| gemini-2.5-flashRank=7, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 64.9 | |
| gemini-2.5-flashRank=10, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 34.5 | |
| gemini-2.5-flashRank=4, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 31.3 | |
| gemini-2.5-flash-preview-04-17Rank=72026.04 | — | 1,626.607 | — | — | — | 46 | 49.5 | 56.4 | 0.179 | — | |
| gemini-2.5-proRank=12026.04 | — | 1,753.749 | — | — | — | 69.8 | 91.5 | 72.7 | 0.877 | — | |
| gemini-2.5-proRank=3, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 46.8 | |
| gemini-2.5-proRank=1, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 10.6 | |
| gemini-2.5-proRank=1, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 16.2 | |
| gemini-2.5-pro-preview-03-25Rank=52026.04 | — | 1,624.634 | — | — | — | 47.2 | 83.1 | 68.2 | 0.691 | — | |
| gemini-2.5-pro-preview-03-25Rank=2, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 11.3 | |
| gemini-2.5-pro-preview-05-06Rank=5, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 17.8 | |
| gemma-3-27b-itRank=8, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 68.1 | |
| GPT-3.5-Turbo2024.03 | — | 1,117 | — | — | — | — | — | — | — | — | |
| GPT-4-Turbo2024.03 | — | 1,243 | — | — | — | — | — | — | — | — | |
| gpt-4.1-mini-2025-04-14Rank=2, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 38.4 | |
| grok-3-mini-betaRank=102026.04 | — | 1,402.303 | — | — | — | 37.7 | 52.9 | 50.1 | -0.053 | — | |
| grok-3-preview-02-24Rank=42026.04 | — | 1,541.837 | — | — | — | 47.8 | 60.5 | 62.8 | 0.461 | — | |
| grok-3-preview-02-24Rank=6, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 61.1 | |
| grok-3-preview-02-24Rank=8, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 27.4 | |
| grok-4-0709Rank=3, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 12.1 | |
| grok-4-0709Rank=2, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 22.3 | |
| Llama 2 ChatSize=13B2023.10 | — | 1,012 | — | — | — | — | — | — | — | — | |
| Llama 2 ChatSize=7B2023.10 | — | 985 | — | — | — | — | — | — | — | — | |
| llama-4-maverick-03-26-experimentalRank=62026.04 | — | 1,626.565 | — | — | — | 46.3 | 40.9 | 61.9 | 0.42 | — | |
| llama-4-maverick-03-26-experimentalRank=9, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 30.1 | |
| LLaMA2-ChatSize=70B2024.03 | — | 1,077 | — | — | — | — | — | — | — | — | |
| Mistral InstructSize=7B2023.10 | — | 1,031 | — | — | — | — | — | — | — | — | |
| mistral-medium-2505Rank=8, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 46.1 | |
| o3-2025-04-16Rank=32026.04 | — | 1,604.549 | — | — | — | 49 | 61.2 | 64.6 | 0.513 | — | |
| o3-2025-04-16Rank=4, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 52.8 | |
| o3-2025-04-16Rank=4, Portfolio Selection Strategy=Global ordering2026.05 | — | — | — | — | — | — | — | — | — | 16.3 | |
| o3-2025-04-16Rank=5, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 35.4 | |
| o4-mini-2025-04-16Rank=92026.04 | — | 1,531.531 | — | — | — | 39.2 | 41.1 | 53.7 | 0.083 | — | |
| o4-mini-2025-04-16Rank=9, Portfolio Selection Strategy=Greedy portfolio2026.05 | — | — | — | — | — | — | — | — | — | 70.9 | |
| qwen3-235b-a22b-no-thinkingRank=6, Portfolio Selection Strategy=MIP portfolio2026.05 | — | — | — | — | — | — | — | — | — | 39.3 | |
| VicunaSize=13B2023.10 | — | 1,041 | — | — | — | — | — | — | — | — | |
| VicunaSize=7B2023.10 | — | 997 | — | — | — | — | — | — | — | — | |
| WizardLMSize=13B, Version=v1.22023.10 | — | 1,047 | — | — | — | — | — | — | — | — | |
| Yi-ChatSize=34B2024.03 | — | 1,110 | — | — | — | — | — | — | — | — |