LLM-as-a-judge on PRISM
59.38AccuracyEpiPersona-A
Evaluation Results
| Method | Links | |
|---|---|---|
| EpiPersona-AJudge Model=GPT-OSS-120B2026.03 | 59.38 | |
| EpiPersona-AJudge Model=LLAMA-3.3-70B2026.03 | 59.15 | |
| SYNTHESIZEMEBase Model=GPT-OSS-120B, Judge Model=LLAMA-3.3-70B2026.03 | 57.67 | |
| PIBase Model=LLAMA-3.1-8B, Judge Model=GPT-OSS-120B2026.03 | 57.48 | |
| SYNTHESIZEMEBase Model=LLAMA-3.1-8B, Judge Model=GPT-OSS-120B2026.03 | 57.27 | |
| SYNTHESIZEMEBase Model=GPT-OSS-120B, Judge Model=GPT-OSS-120B2026.03 | 57.24 | |
| PIBase Model=GPT-OSS-120B, Judge Model=LLAMA-3.3-70B2026.03 | 57.22 | |
| SYNTHESIZEMEBase Model=LLAMA-3.1-8B, Judge Model=LLAMA-3.3-70B2026.03 | 56.86 | |
| PIBase Model=LLAMA-3.1-8B, Judge Model=LLAMA-3.3-70B2026.03 | 56.58 | |
| PERSONALLLMDemo Num=5, Judge Model=GPT-OSS-120B2026.03 | 56.46 | |
| PERSONALLLMDemo Num=3, Judge Model=LLAMA-3.3-70B2026.03 | 56.42 | |
| LLM AS A JUDGE (BASE MODEL)Judge Model=GPT-OSS-120B2026.03 | 56.3 | |
| PERSONALLLMDemo Num=3, Judge Model=GPT-OSS-120B2026.03 | 56.29 | |
| PERSONALLLMDemo Num=5, Judge Model=LLAMA-3.3-70B2026.03 | 56.21 | |
| LLM AS A JUDGE (BASE MODEL)Judge Model=LLAMA-3.3-70B2026.03 | 55.9 | |
| PERSONALLLMDemo Num=1, Judge Model=LLAMA-3.3-70B2026.03 | 55.81 | |
| PERSONALLLMDemo Num=1, Judge Model=GPT-OSS-120B2026.03 | 54.39 | |
| PIBase Model=GPT-OSS-120B, Judge Model=GPT-OSS-120B2026.03 | 54 | |
| RANDOMJudge Model=GPT-OSS-120B2026.03 | 50 | |
| RANDOMJudge Model=LLAMA-3.3-70B2026.03 | 50 |