LLM-as-a-Judge on ARENA
66.07AccuracyEpiPersona-A
Evaluation Results
| Method | Links | |
|---|---|---|
| EpiPersona-AJudge Model=GPT-OSS-120B2026.03 | 66.07 | |
| EpiPersona-AJudge Model=LLAMA-3.3-70B2026.03 | 65.01 | |
| SYNTHESIZEMEBase Model=GPT-OSS-120B, Judge Model=GPT-OSS-120B2026.03 | 64.89 | |
| SYNTHESIZEMEBase Model=GPT-OSS-120B, Judge Model=LLAMA-3.3-70B2026.03 | 64.39 | |
| LLM AS A JUDGE (BASE MODEL)Judge Model=GPT-OSS-120B2026.03 | 64.36 | |
| LLM AS A JUDGE (BASE MODEL)Judge Model=LLAMA-3.3-70B2026.03 | 64.18 | |
| SYNTHESIZEMEBase Model=LLAMA-3.1-8B, Judge Model=LLAMA-3.3-70B2026.03 | 64.17 | |
| PERSONALLLMDemo Num=5, Judge Model=LLAMA-3.3-70B2026.03 | 64.13 | |
| PIBase Model=LLAMA-3.1-8B, Judge Model=LLAMA-3.3-70B2026.03 | 63.97 | |
| SYNTHESIZEMEBase Model=LLAMA-3.1-8B, Judge Model=GPT-OSS-120B2026.03 | 63.83 | |
| PIBase Model=GPT-OSS-120B, Judge Model=LLAMA-3.3-70B2026.03 | 63.28 | |
| PERSONALLLMDemo Num=3, Judge Model=LLAMA-3.3-70B2026.03 | 63.13 | |
| PIBase Model=LLAMA-3.1-8B, Judge Model=GPT-OSS-120B2026.03 | 63.06 | |
| PERSONALLLMDemo Num=5, Judge Model=GPT-OSS-120B2026.03 | 62.43 | |
| PERSONALLLMDemo Num=3, Judge Model=GPT-OSS-120B2026.03 | 62.01 | |
| PIBase Model=GPT-OSS-120B, Judge Model=GPT-OSS-120B2026.03 | 61.72 | |
| PERSONALLLMDemo Num=1, Judge Model=GPT-OSS-120B2026.03 | 59.71 | |
| PERSONALLLMDemo Num=1, Judge Model=LLAMA-3.3-70B2026.03 | 59.33 | |
| RANDOMJudge Model=GPT-OSS-120B2026.03 | 50 | |
| RANDOMJudge Model=LLAMA-3.3-70B2026.03 | 50 |