Open-ended Text Generation on Chatbot Arena inspired qualitative prompts (val)
1,150.78ELOMamba
Evaluation Results
| Method | Links | |
|---|---|---|
| MambaJudge Model=Gemma-3-4B-IT, Evaluation Protocol=LLM-as-a-judge, Criteria=coherence, relevance, fluency, and correctness2026.02 | 1,150.78 | |
| ProtoTJudge Model=Gemma-3-4B-IT, Evaluation Protocol=LLM-as-a-judge, Criteria=coherence, relevance, fluency, and correctness2026.02 | 1,015.93 | |
| LLaMAJudge Model=Gemma-3-4B-IT, Evaluation Protocol=LLM-as-a-judge, Criteria=coherence, relevance, fluency, and correctness2026.02 | 938.59 | |
| DeltaNetJudge Model=Gemma-3-4B-IT, Evaluation Protocol=LLM-as-a-judge, Criteria=coherence, relevance, fluency, and correctness2026.02 | 894.7 |